

机器之心编辑部
拿 GPT-6 Astra 当机器人「大脑」?
好像还真行!
最近,一台售价约 150 美元的 SO-101 机械臂,在 GPT-6 Astra 的控制下,画出了一幅金门大桥。
这可不是照着预设轨迹画的,Astra 先规划从哪里落笔,再通过摄像头边画边看,最终完成了一幅红蓝相间的金门大桥。
这段视频迅速爆火,Sam Altman 直接转发:给我也来一个!

视频链接:https://x.com/cdngdev/status/2097339677128982873
最近几年,机器人圈一直在讨论一个问题:「谁会成为机器人领域的 OpenAI?」
如今看来,这个问题的答案,有可能是 OpenAI 自己。
Astra 的「动手能力」究竟如何?
画金门大桥看起来唬人,但这还不是最厉害的那个。
CMU Robotics 的 Wenli Xiao 做了一个很直观的实验。
他们先录下一段人类完成新任务的视频,把录像丢进 Codex,再让 GPT-6 Astra 控制机械臂,用同样的方式完成任务。
竟然一次就跑通了!

视频链接:https://x.com/_wenlixiao/status/2097801944119349455
Wenli Xiao 把它称为「physical ICL」—— 过去大模型可以从上下文里的文字、代码示例中临时学会一个新任务,现在的人们发现,这种能力搬到物理世界里也行得通。
另一批人则干脆让 Astra 开始当「机器人工程师」。
Lingxiao Guo 把真实机器人演示的多视角画面和动作数据交给 Astra,让它自己处理相机标定、场景重建和物理参数,再把真实环境搬进 MuJoCo。
最终得到的不只是一个看起来相似的 3D 场景,而是一套可以继续进行接触仿真和动作回放的 real2sim 环境。

视频链接:https://x.com/Lingxiao234/status/2096992059731443923
X 上还有人把 Astra 接到更复杂的机器人身体上。
Dmytro Hrybov 在 MuJoCo 中给 Astra 配了一台 Kinova Gen3 机械臂和 Shadow Hand 五指机械手,让它握住铅笔,画出毕加索那只著名的鸽子。
为了让笔真正落到纸面上,机械手还需要同时处理握笔姿态、手指与铅笔之间的摩擦,以及笔尖与纸面的接触。

视频链接:https://x.com/dimentary/status/2097141042214797801
如果说以上这些还比较像网友整活,下面这个就真能说明一些问题了。
RoboCurve 把 GPT-6 Astra 接到两只真实的 I2RT YAM 机械臂上。
每一步行动,Astra 都能看到顶部和两只手腕上的三个相机视角,以及机械臂自身的状态。随后,它直接给出两只机械臂末端执行器的 x、y、z、yaw、pitch、roll 和夹爪状态,再由底层 IK 转换成具体关节动作。
测试任务很简单:把桌上的红色积木抓起来,放进旁边的碗里。一共 20 次,Astra 成功了 19 次,成功率 95%。同样的测试里,Fable 5.1 只成功了 8 次。

谁都没想到,一个并没有专门为机器人训练的通用模型,竟然能做到这种程度。
而这个问题,恰好撞上了过去几年机器人行业最热的一条路线 —— 专门给机器人训练一颗自己的「基础模型大脑」。
「机器人大脑」不必从头训练
过去几年,随着大模型能力一路向视觉、语音和 Agent 扩展,机器人行业也在反复追问同一个问题:如果语言领域已经出现了 GPT,机器人什么时候才能拥有自己的「GPT」?
Physical Intelligence 和 Skild,正是在这样的期待中迅速成为明星公司。
Physical Intelligence 希望训练一个真正跨任务、跨场景、跨机器人本体的通用机器人基础模型。它的 π 系列模型把视觉、语言和动作放进同一套模型里,希望机器人能够像大模型理解文本一样,从大量具身经验中学会如何操作真实世界。
Skild 的目标更直接 ——「Any task, any robot, one brain」。无论是四足机器人、人形机器人,还是桌面机械臂和移动操作平台,都由同一个通用「大脑」来理解任务、规划动作。
两家公司代表的其实是过去几年机器人基础模型最典型的一条思路:既然语言有自己的 foundation model,那么机器人也需要在海量机器人数据上,训练出一套真正理解身体和动作的基础模型。
也因此,「谁会成为机器人领域的 OpenAI?」一直是这条赛道绕不开的问题。
但 Astra 出现后,这个问题突然有了一个有点出人意料的答案。
Amazon Alexa Principal Scientist、Retrocausal 联合创始人 Zeeshan Zia 有一个判断:「机器人领域的 OpenAI,看来可能就是 OpenAI,而不是 Physical Intelligence 或 Skild。」
这句话听起来有些挑衅,因为 Astra 并没有沿着机器人公司的传统路线来。
它没有先收集大量机器人轨迹,再专门训练一套从视觉到动作的基础模型,Astra 带来了另一种可能:如果通用 AI 本身已经足够强,还需不需要再从头造一颗机器人的大脑?
这个问题放在 OpenAI 身上尤其微妙,因为它其实很早就做过机器人。
2018 年,OpenAI 推出了 Dactyl,让 Shadow Dexterous Hand 在真实世界里旋转物体;随后又进一步让灵巧手完成魔方操作。

那时 OpenAI 已经在研究今天机器人行业仍然绕不开的问题:如何在模拟中训练,再把能力迁移到真实世界,如何处理摩擦、遮挡、传感器噪声,以及复杂的多自由度控制。
但几年后,OpenAI 关闭了机器人团队。Wojciech Zaremba 当时谈到过一个很现实的限制:机器人缺少像互联网文本那样可以大规模获取的数据。相比可以直接从互联网获得海量文本和图像,机器人数据昂贵、缓慢,也很难覆盖足够丰富的真实世界。
有意思的是,OpenAI 当年因为数据问题暂时离开机器人,如今却可能从另一条路绕了回来。
过去几年,OpenAI 先把模型在语言、代码、视觉和 Agent 上一路做大,让模型积累了关于物体、空间、因果关系和人类行为的大量知识。接下来,机器人需要的是把这些已有的知识,稳定地变成身体动作。
OpenAI 自己显然也重新盯上了这个方向。Sam Altman 最近已经明确表示,OpenAI 会做人形机器人,也会探索其他机器人形态。在他的表述里,真正关键的部分仍然是让机器人工作的「大脑」。
Astra 怎么控制机器人的「身体」?
目前的答案不是让 Astra 直接控制每一台电机。
以 RoboCurve 的实机测试为例,Astra 每一步会看到三个相机视角和机械臂自身的状态,然后直接给出末端执行器应该到达的位置和姿态,包括 x、y、z、yaw、pitch、roll 以及夹爪状态;再由底层的逆运动学系统,把这些目标转换成各个关节的具体动作。
这其实是一种很典型的分工:Astra 负责判断「手应该去哪里」,传统机器人控制栈负责解决「每个关节具体怎么动」。
英伟达前研究科学家 Yu Xiang 也提出,机器人学接下来一个值得关注的方向,可能就是如何把最先进的 AI 模型真正接进 manipulation。相比只让大模型停留在最上层,负责拆解任务、调用工具,Astra 已经开始更直接地介入机器人的动作决策。

链接:https://x.com/YuXiang_IRVL/status/2096074174091362388
但接着往下走,问题也逐渐显现。
有人甚至让 Astra 直接输出 Unitree Go1 的 joint targets,尝试像强化学习 policy 一样,以 50Hz 控制四足机器人行走。实验确实跑了起来,但因为 Astra 的推理速度跟不上实时控制,物理模拟必须在每次模型调用之间暂停。最终,250 次推理只换来了约 5 秒钟的行走。

链接:https://x.com/sri299792458/status/2097349207795335424
显然,Astra 已经能够决定机器人「下一步该怎么动」,但要让它直接接管毫秒级的底层控制,还不太现实。
所以,未来更现实的形态可能不是让一个大模型从头管到脚,而是让不同层级继续分工:Astra 负责理解环境、推理和规划,低层 policy 与控制器负责把这些意图快速、稳定地变成动作。
最后一毫米
会规划动作,距离真正把动作做好,其实还有不小的距离。
还是 RoboCurve 的那组测试。
在「把红色积木放进碗里」的任务中,Astra 20 次成功 19 次,成功率达到 95%;可当任务换成把一块圆形拼图准确嵌进对应凹槽时,成功率立刻跌到了 10%,20 次只完成了 2 次。

同一套实机测试中,Astra 在积木入碗任务上的成功率达到 95%,但面对需要精确嵌入的拼图任务,成功率降至 10%。图源:RoboCurve
很多距离成功仅一步之遥。Astra 已经找到拼图、抓住旋钮,并且能把它移动到目标凹槽附近,却很难完成最后的精确插入。
这最后几毫米的距离,展现了机器人最棘手的一些问题:位置和角度稍有偏差,零件就无法对准;真正接触受硬件误差干扰,下一步动作也因此无法完成。
这也是为什么 Physical Intelligence 最近会专门研究「最后一毫米」。
在他们的实验中,让一个通用机器人模型拿起螺丝刀很简单,但想要快速、准确地对准一颗很小的 M3 螺丝,仍然需要通过在线强化学习继续优化;网线插入、电源线插入、扎带固定等任务,也都卡在类似的精细接触阶段。

Astra 目前最明显的优势集中在理解环境、判断目标和规划动作这些「头脑」擅长的部分,而一旦进入高频反馈、精细接触和力控制,机器人自己的身体经验仍然很重要。
这也给前面的「机器人领域的 OpenAI」之争留下了一个很关键的悬念。
机器人当然可以用最强模型当「大脑」,但能与之匹配的物理身体,还没有出现。

© THE END
转载请联系本公众号获得授权
投稿或寻求报道:liyazhou@jiqizhixin.com