GPT-6 Astra 在具身領域引發熱議後,一場關於通用模型與專用具身模型邊界的討論在行業內展開。作者 Koji 連續主持了兩場與具身智慧相關的論壇——9 月 10 日的 Inclusion·外灘大會和 9 月 9 日的 JDD 京東全球科技探索者大會,兩場活動恰好趕上 Astra 在社交媒體上被大量嘗試用於控制機械臂、抓取物體。作者將七位嘉賓的現場發言按一條 0 到 10 的「通用主導指數」重新編排,指數越高越傾向通用模型主導,越低越主張具身模型獨立。
立場最偏向獨立具身模型的是逆矩陣科技創始人陳博遠,指數為 1/10。他認為 Astra 代表了語言模型進入物理世界的最高形態,但語言模型存在上限:他本人嘗試用 GPT-6 操作夾爪拿杯子,可能需要 40 分鐘到一個小時才能慢慢拿起。他指出語言模型的 token 逐個生成範式在真機上會鎖死應用上限,因為 100 毫秒在聊天視窗無感,在真機上可能對應三個控制週期,物理世界時刻變化,模型難以即時響應。因此他更堅定認為物理 AI 需要自己的基座模型,學習人類操作範式與物理直覺。
自變數機器人創始人兼 CEO 王潛的指數為 2/10。他提到 Astra 這一版本訓進了大量機器人資料,OpenAI、Anthropic 從去年年初開始大量採購機器人資料,因此並不意外。他提出一個觀點:今天智慧的本體存在於資料裡,模型在訓練時是蒸餾器、部署時是容器,模型作用已變得極小,更大的原因在資料。他認為基礎模型通過其他領域通用智慧泛化到具身、形成降維打擊的可能性不大,因為語言模型歷史上從未發生過這種事,影片生成模型做得優秀也未直接轉化為機器人控制優勢。但他也認為 Astra 說明預訓練確實有效,應堅定走這條路。
螞蟻靈波科技首席科學家沈宇軍的指數為 4/10,更看重具身獨立範式。他指出具身模型必須部署在機器人上,依賴身上所有感測器源源不斷輸入,與數字世界的輪式對話不同,機器人工作環境不可被打斷,要基於新輸入隨時改變推理。他認為具身場景可能反過來為更高階模型提供發展方向,機器人走入生活後產生的物理世界資料,可能成為大語言模型公司的新語料。他不太認同「攢一波物理世界資料、按之前訓練方式就能訓出具身模型」的說法,認為具身一定會有自己的新訓練範式。
蘇度科技聯合創始人兼 CEO 韓錚的指數為 5/10,主張上下分層。他認為上層抽象理解會分層,底層技能的泛化性和高成功率必須與上層模型同等水平,不能成功率不高卻只有一些泛化性,這是上下層銜接時非常致命的問題。他提到去年底做演示時與千問模型做語言互動,靠對環境和物體的可靠底層操作完成整個動作訓練,今年這一理念在 Astra 出現後被重新拿到前台。
破殼機器人創始人、清華大學交叉資訊研究院助理教授許華哲的指數為 6/10。他所在團隊在 Astra 可用當天立刻做了測試,認為若把具身任務看成需要語義泛化、空間泛化加物理泛化,Astra 的物理做得相對很弱,語義和空間相對很強。Astra 能抓起筷子這類難抓的小物體,也能把筷子立起來插進杯子,但在帶物理接觸的複雜任務上開始不行,疊盒子、疊衣服都做不了。他認為具身機器人公司最後的陣地是怎麼理解物理變化,未來應是大模型、具身模型再到物理世界連線在一起的完整系統。
智元聯合創始人、聯席總裁、具身業務體系總裁姚卯青的指數為 7/10,偏向統一模型但仍保留專門執行層。他認為多模態大模型在上層系統已能更好適應長程任務的理解、規劃和思考,但精細操作層面仍需 policy 解決。他提出值得研究的問題是架構到底分層通訊,還是走向單一系統通過類似 MoE 自適應切換快慢系統。他總結三點啟示:語言是高效的智慧壓縮;影片生成模型證明 Scaling Law 在高維空間同樣成立;真正的壁壘在資料不在模型,資料至少能拉開 200 到 300 天的領先時間。
鹿明機器人創始人兼 CEO 喻超的指數為 8/10,最偏向通用主導。他認為 GPT-6 的 Astra 可能不單純是純語言模型的上限,補充好的表徵系統再加一套執行系統後,上限會比現在高很多。他舉例說,調硬體時把軌跡用純數值丟進去,與用類似示波器的對比圖片輸進去相比,效果差異明顯,因此認為配備合適表徵系統和執行系統後整體上限還會更高。
整體來看,七位嘉賓的分歧集中在通用模型能否憑藉語義與空間泛化能力直接吞掉具身模型的獨立空間。偏向獨立的一方強調物理接觸、即時閉環與資料基礎設施的不可替代性;偏向通用的一方則看重 Scaling Law 與上層規劃能力的延伸。這場討論反映出,在 Astra 展示出跨領域能力後,具身智慧公司需要重新回答自己的護城河究竟建立在資料、物理理解還是執行系統之上。