/朝聞通/8月10日、2025世界ロボット大会が北京で開催された。智元ロボットパートナー兼身業務部の姚卯青総裁は会議で「具身知能の大規模突破への道——智元の本体データアルゴリズムフライホイール」と題した講演を行い、具身知能分野における智元の探索成果と未来方向を系統的に述べた。

姚卯青氏によると、上海智元ロボットは2023年2月に設立され、創立以来AIとロボットの深い融合の推進に力を入れてきた。これまで、智元は一連の着実な成果を上げてきた:リリース全シリーズの複数種類のロボット製品は、規模化生産ラインとロボット訓練場データ収集センターを建設し、具身知能関連アルゴリズムの分野で複数の革新を実現し、そして複数の実際の応用シーンで探索検証を完成し、技術の定着のために基礎を築く。
姚卯青氏は、ロボット企業がソフト・ハードウェア製品を業界で効果的に着地させるには、核心は「本体-データ-モデル-シーン」が緊密に結合された全スタック配置を構築することにあると強調した。この4つは相互に駆動するフライホイール反復論理を形成する:良質な本体は高品質データを生成し、大量の高品質データ支持アルゴリズムは持続的に突破し、アルゴリズムはシーンの試行錯誤に結合した後、また本体の最適化、データ収集方向、アルゴリズム反復に新たな導きを提供する。この閉ループループは絶えず加速し、未来の智元はより多くのフライホイール反復成果を分かち合うだろう。
「フライホイールサイクルへの最初の挑戦はデータです。」姚卯青氏は、大言語モデル事業者と異なり、ロボット事業者は物理世界の強い相互作用特性に直面する必要があり、ハードウェアをデバッグするだけでなく、モデルを工業レベルのシステムテストに配置する必要があり、データ需要とインターネットデータに本質的な違いがあると指摘した。
「しかし、既存のインターネットデータはロボットの訓練には十分ではない」と姚卯青氏は説明し、「ロボットは大量の動作系、長距離計画系データを必要とし、このようなデータはネットワーク上で極めて不足している」と述べた。
データの難題を解決するために、智元は2024年末にAgiBot World百万真機データセットをオープンした。姚卯青氏によると、このデータセットは工業級の高品質データサポートを提供することを目的としており、百万本のロボット数の軌跡を含み、各データは複数の審査を経て、シーンが現実に近く、任務が複雑で多様であることを確保する。
姚卯青氏はまた、AgiBot Worldデータセットは起点にすぎず、智元はデータ収集方式に2つの重要な革新があると述べた:
対抗式収集データ:通常のデータ収集過程において、言語命令の変更、視覚的摂動の製造などの干渉を積極的に導入し、データ情報密度を向上させる。実践により、この方法は通常のデータの数倍の情報量を提供し、ロボット訓練の収束速度を効果的に加速させ、マルチタスクと多構造ロボットで効果を検証したことが証明された。
自主进化式的数据采集:针对机器人在真实环境中自主执行任务时难以提前枚举的 “长尾失效” 问题,智元引入自主进化式采集方案。 当机器人执行任务失效瞬间,系统自动接管并打断进程,回退到失效前状态,再通过人工接管完成数据采集。这一方式能将难场景下的高价值数据补充到训练集,有效拓展数据分布边界,依托数据扩增提升机器人能力上限,其逻辑类似 Dagger 算法框架。
姚卯青说,围绕数据消费,智元于今年 3 月推出具身智能基座模型GO-1 。该模型在架构上实现双重创新:依托 VLM 基础模型和 MOE 混合专家架构,其中 “隐式动作专家” 融合多源数据形成通用动作表达,“显式动作专家” 则将通用描述精准落实到特定本体控制,让机器人既能从人类视角学习动作规律,又能掌握物理世界交互逻辑。
姚卯青指出,GO-1 模型リリース后,其在生活、零售、工业三大场景的评测中表现尤为亮眼。相较于 3 月时的海内外开源模型,成功率提升 10%-30%。同时,智元リリース的AgiBot World数据集,能够很好的验证 Scaling Law,研究揭示了预训练关键规律:数据量、多样性及质量对模型性能影响显著,且实验证明,单一本体预训练数据的后训练迁移效果优于多本体数据。这表明,机器人预训练的核心在于数据场景的多样性、质量,以及适配的模型设计。
“除 GO-1外,智元团队深耕世界模型方向,秉持 “生成理解一体化” 理念。正如人类做事前会在脑海中规划推演,机器人也需依托世界模型精准推演,缩短与实际操作的差距。测试显示,在智元自身本体的多任务测试中,GE-Act 效果优于近期开源的 UniVLA 和 NVIDIA 的 GR00T 模型;针对跨本体迁移能力,以AgiBot World数据集训练的 GE-Base 模型,在 Franka 等本体上表现优异,在开源 Benchmark 和真机测试中,成功率显著高于现有开源模型。”姚卯青说

姚卯青强调,基于世界模型生成的动作,智元机器人能完成叠衣服、组装纸盒等复杂双臂灵巧操作,也能在工业传送带上精准执行物体抓取和打包任务。值得注意的是,相较于 VLA 等短时序输入输出模型,具备长时序推演能力的 GE-Act 在动态场景抓取定位精度上优势明显。
GE-Sim 以动作序列为输入,如同高精度仿真器,能在杂乱真实环境中渲染画面,且具备时空一致性和语义合理性。对比测试显示,其与真实机器人的推理效果高度一致,量化成功率接近。姚卯青说,依托该仿真器,可快速迭代机器人策略,极大缩短模型研发周期,减少实际评测中的复杂流程与损失。
姚卯青表示,为规范世界模型评测,智元推出 GE Bench 并已在 GitHub 和 HuggingFace 开源,成为 IROS 世界模型挑战赛的重要准备工具。 该 Benchmark 从轨迹遵循度、语义合理性、因果一致性等多维度评估模型,而基于机前数据预训练的 GE-Base 模型,在各维度表现均优于主流视频生成类模型。
姚卯青分享了智元在机器人研发中的实践心得:机器人本质要回归执行器,优质执行器是性能基础;传感器虽重要,但调教与量产一致性是行业难题;若聚焦单一机器人类型,人形是较合理的选择;具身智能应是 “机器人 + AI”,需深度结合硬件本体;此外,必须追求量产和一致性,以减少各环节误差。

姚卯青表示,智元计划将上述 “苦涩教训” 融入飞轮迭代,并于今年下半年推出新一代机器人AgiBotG2.该平台采用更灵巧的本体设计,对传感器、执行器提出更高标准,搭载英伟达 Thor 高算力量产域控制器,被定义为 “工业级交互式具身智能作业全球标杆平台”,引发行业广泛关注。
姚卯青强调,“数据 - 模型 - 本体 - 场景” 飞轮的转动,最终是为赋能千行百业。过去一年,智元在多场景取得突破:柔性制造中,用具身智能解决专业设备无法应对的高精度、力控、泛化性操作问题;物流分拣上,具身智能通用机器人与专用设备配合,处理传统视觉定位 + 规划难以完成的杂乱物品分拣;此外,还实现了安检岗点人力清零、电力通信机房巡检操作等场景的人力替代与降本增效。
“具身智能赛道广阔,” 姚卯青呼吁,“希望全球同行携手,共同探索这一智能边疆,让技术真正创造价值。”