GPT-6 Astra 在具身领域引发热议后,一场关于通用模型与专用具身模型边界的讨论在行业内展开。作者 Koji 连续主持了两场与具身智能相关的论坛——9 月 10 日的 Inclusion·外滩大会和 9 月 9 日的 JDD 京东全球科技探索者大会,两场活动恰好赶上 Astra 在社交媒体上被大量尝试用于控制机械臂、抓取物体。作者将七位嘉宾的现场发言按一条 0 到 10 的「通用主导指数」重新编排,指数越高越倾向通用模型主导,越低越主张具身模型独立。

立场最偏向独立具身模型的是逆矩阵科技创始人陈博远,指数为 1/10。他认为 Astra 代表了语言模型进入物理世界的最高形态,但语言模型存在上限:他本人尝试用 GPT-6 操作夹爪拿杯子,可能需要 40 分钟到一个小时才能慢慢拿起。他指出语言模型的 token 逐个生成范式在真机上会锁死应用上限,因为 100 毫秒在聊天窗口无感,在真机上可能对应三个控制周期,物理世界时刻变化,模型难以即时响应。因此他更坚定认为物理 AI 需要自己的基座模型,学习人类操作范式与物理直觉。

自变量机器人创始人兼 CEO 王潜的指数为 2/10。他提到 Astra 这一版本训进了大量机器人数据,OpenAI、Anthropic 从去年年初开始大量采购机器人数据,因此并不意外。他提出一个观点:今天智能的本体存在于数据里,模型在训练时是蒸馏器、部署时是容器,模型作用已变得极小,更大的原因在数据。他认为基础模型通过其他领域通用智能泛化到具身、形成降维打击的可能性不大,因为语言模型历史上从未发生过这种事,视频生成模型做得优秀也未直接转化为机器人控制优势。但他也认为 Astra 说明预训练确实有效,应坚定走这条路。

蚂蚁灵波科技首席科学家沈宇军的指数为 4/10,更看重具身独立范式。他指出具身模型必须部署在机器人上,依赖身上所有传感器源源不断输入,与数字世界的轮式对话不同,机器人工作环境不可被打断,要基于新输入随时改变推理。他认为具身场景可能反过来为更高级模型提供发展方向,机器人走入生活后产生的物理世界数据,可能成为大语言模型公司的新语料。他不太认同「攒一波物理世界数据、按之前训练方式就能训出具身模型」的说法,认为具身一定会有自己的新训练范式。

苏度科技联合创始人兼 CEO 韩铮的指数为 5/10,主张上下分层。他认为上层抽象理解会分层,底层技能的泛化性和高成功率必须与上层模型同等水平,不能成功率不高却只有一些泛化性,这是上下层衔接时非常致命的问题。他提到去年底做演示时与千问模型做语言交互,靠对环境和物体的可靠底层操作完成整个动作训练,今年这一理念在 Astra 出现后被重新拿到前台。

破壳机器人创始人、清华大学交叉信息研究院助理教授许华哲的指数为 6/10。他所在团队在 Astra 可用当天立刻做了测试,认为若把具身任务看成需要语义泛化、空间泛化加物理泛化,Astra 的物理做得相对很弱,语义和空间相对很强。Astra 能抓起筷子这类难抓的小物体,也能把筷子立起来插进杯子,但在带物理接触的复杂任务上开始不行,叠盒子、叠衣服都做不了。他认为具身机器人公司最后的阵地是怎么理解物理变化,未来应是大模型、具身模型再到物理世界连接在一起的完整系统。

智元联合创始人、联席总裁、具身业务体系总裁姚卯青的指数为 7/10,偏向统一模型但仍保留专门执行层。他认为多模态大模型在上层系统已能更好适应长程任务的理解、规划和思考,但精细操作层面仍需 policy 解决。他提出值得研究的问题是架构到底分层通信,还是走向单一系统通过类似 MoE 自适应切换快慢系统。他总结三点启示:语言是高效的智能压缩;视频生成模型证明 Scaling Law 在高维空间同样成立;真正的壁垒在数据不在模型,数据至少能拉开 200 到 300 天的领先时间。

鹿明机器人创始人兼 CEO 喻超的指数为 8/10,最偏向通用主导。他认为 GPT-6 的 Astra 可能不单纯是纯语言模型的上限,补充好的表征系统再加一套执行系统后,上限会比现在高很多。他举例说,调硬件时把轨迹用纯数值丢进去,与用类似示波器的对比图片输进去相比,效果差异明显,因此认为配备合适表征系统和执行系统后整体上限还会更高。

整体来看,七位嘉宾的分歧集中在通用模型能否凭借语义与空间泛化能力直接吞掉具身模型的独立空间。偏向独立的一方强调物理接触、实时闭环与数据基础设施的不可替代性;偏向通用的一方则看重 Scaling Law 与上层规划能力的延伸。这场讨论反映出,在 Astra 展示出跨领域能力后,具身智能公司需要重新回答自己的护城河究竟建立在数据、物理理解还是执行系统之上。