智譜(2513.HK)創始人兼首席科學家唐傑在X平台發表長文並轉發公司技術部落格,披露了智譜在遞迴自我改進(Recursive Self-Improvement,RSI)方向的首個工程化實踐。據澎湃新聞9月17日報道,這一案例由GLM-5.3驅動的基礎設施智慧體(Infra Agent)完成,它承擔了GLM-5.3-Flash推理基礎設施的設計、除錯與最佳化工作,實現了模型對自身執行系統的反向改進。智譜方面稱,這是國內大模型廠商首次公開跑進生產環境的RSI案例。
從技術細節看,Infra Agent在由超10萬張國產晶片組成的叢集上,從零完成了生產級推理服務的搭建。據官方部落格,該系統在不到兩週時間內將端到端吞吐提升至初始基線的3倍,硬體利用效率與單Token成本達到主流NVIDIA GPU相當水平,並支援1M上下文視窗與多模態請求。這意味著智慧體的工作範圍已不再侷限於生成程式碼,而是覆蓋了圍繞推理系統的完整工程閉環:自主分析效能瓶頸、定位精度缺陷、修改底層程式碼、執行分層測試,並根據實驗反饋持續迭代。
該系統已經受過真實流量的檢驗。GLM-5.3-Flash以匿名模型Ox-Alpha的身份在OpenCode、OpenRouter上線,6天內Token呼叫量超過62萬億。這一資料為RSI從實驗室概念走向生產環境提供了實際負載層面的佐證。
智譜GLM團隊同時給出了邊界說明:系統尚未達到完全自主設計和訓練下一代模型的階段,但RSI的早期形態已經出現——模型建設推理系統,系統再反過來支撐模型執行。這一表述將當前進展定位在“工程閉環”而非“自主科研”之間,既確認了能力躍遷,也劃出了與完全自主迭代之間的距離。
放在行業背景下,RSI已成為頭部實驗室競逐的下一個高地。Anthropic於6月披露Claude編寫了其程式碼庫80%以上的合入程式碼;OpenAI於9月初宣佈達成“自動化研究實習生”里程碑。智譜此次披露的案例,使國產廠商在這一方向上有了可對照的公開進展。
從資本市場與產業競爭的視角看,此次實踐釋放的訊號在於:大模型競爭正在越過引數規模與榜單成績的比拼,進入一個更根本的階段——當AI開始參與自身系統的構建,AI研發效率本身成為競爭物件。誰能率先讓模型參與構建下一代模型,誰的迭代速度就可能獲得複利式增長。對國產模型追趕路徑以及AI算力產業鏈而言,這構成一個值得持續跟蹤的邊際變化。
需要區分的是,RSI的“早期形態”與“完全自主”之間仍有明顯距離。智譜方面明確表示系統尚未達到自主設計並訓練下一代模型的階段,因此當前案例更多體現為推理基礎設施層面的自動化最佳化能力,而非模型研發全流程的自主化。這一區分對於評估該進展的實際含金量至關重要。