就在全球机器人圈还在为基准测试(Benchmark)的几个百分点“内卷”时,研究员 Yu-Mool Shu 和 Lipxin Zheng 联手投下了一枚深水炸弹。这篇名为《GPT 6 Astra as an Embodied Policy》的论文,不仅刷新了纪录,简直是把机器人操作的天花板直接捅穿了。
在针对通用机器人设计的 RoboDojo 操纵基准测试中(涵盖数十项模拟与真实世界任务),这款新模型的表现只能用“降维打击”来形容。由控制器 π₀.₅ 与强悍的 GPT-6 Astra 组成的混合系统,在 10 项核心任务中拿下了 62.6 的平均分。相比之下,排在第二名的 Galaxea G0.5 仅为 38.26。
这可不是什么“微小进步”,而是整整 64% 的性能飞跃。在这一数据面前,诸如 Xiaomi(小米)或 Meituan(美团)等大厂旗下的现有模型,表现得就像是在开慢动作。这项研究显然深化了视觉-语言-动作(VLA)模型的协同训练,通过海量异构数据实现了更强的现实世界泛化能力。
一个非常值得玩味的细节是:论文还测试了“GPT 6 Astra Direct”直连控制模式,结果仅得分 37.81,表现平平。这恰恰印证了 π₀.₅ 混合控制器的核心地位——它成功充当了“小脑”的角色,将大模型的原始智慧精准转化为细腻、有效的物理动作。目前该项目已在 GitHub 开源,预计整个机器人行业都要熬夜拆解这种新架构了。你可以通过以下链接直达项目主页和数据集:GPT 6 Astra as an Embodied Policy。
这为什么至关重要?
这不仅仅是榜单上多了一个高分,它预示着具身智能(Embodied AI)的技术路线可能正在发生质变:从追求单一的“端到端”大模型,转向更成熟的“混合系统”。
这次巨大的性能鸿沟告诉我们:将 GPT-6 Astra 这种全才型的“大脑”与 π₀.₅ 这种专注微操的“运动神经”相结合,效率远超让大模型包揽一切。对于那个长期在复杂任务成功率个位数挣扎的机器人行业来说,这种架构突破或许正是让机器人走出实验室、走进非结构化现实环境所需的“关键拼图”。
