(资料图片仅供参考)
9月9日消息,智元机器人近日发布GE-Act 2.0原生世界-动作模型(World Action Model)。该模型从随机初始化开始训练,视觉表征、未来生成、动作预测等核心组件均在具身操作数据上从头训练,不依赖现成视频生成模型。研究团队采用300、1200、5000、30000小时四档数据进行对照实验,真机零样本测试覆盖100项原子任务、20类技能及两种机器人本体。
实验结果显示,训练数据扩大100倍后,G1-OP机器人总体成功率从17.1%提升至44.1%,G2-90D机器人从13.4%提升至31.1%,5,000到30,000小时未见明显饱和。折叠毛巾、嵌套纸杯、拔插笔盖、插花等精细操作在小规模数据下无法完成,3万小时规模时出现能力提升。训练数据占比不足2%的G2-90D本体随共享数据扩大提升17.7个百分点,验证了跨本体能力迁移。
架构方面,GE-Act 2.0采用控制导向的自编码器CoAE,将一帧256×384画面压缩为24个视觉token,指令-画面匹配准确率达97.95%。模型采用一步式视觉规划器,在RTX 5090显卡上生成一个chunk连续动作需104毫秒;通过KASO方法解决未来预测与动作监督错位问题,陌生场景下抓取成功率提高10个百分点。数据层面,模型将3.9万小时“指令-视频”数据、3.2万小时机器人轨迹及3万小时完整配对数据分别用于世界模型预训练、逆动力学模型训练和联合训练。
微调后,GE-Act 2.0在RoboTwin陌生环境测试中成功率为60.52%,GenieSim指令遵循测试得分为0.770。(大陆)
