在今年的雲棲大會上,阿里把外界最關心的三個模型問題擺上了檯面:下一代Qwen還要做多大、模型迭代還能多快、多模態能不能打。從主論壇議程看,吳泳銘發言之後率先登台的是千問大語言模型負責人劉大一恆,隨後是負責視聽等多模態模型的ATH技術副總裁鄭波,之後才是平頭哥高慧與阿里雲CTO李飛飛——模型被放在了晶片與雲之前的位置。
下一代Qwen的規模是市場最直接的懸念。此前一年多,業內對Scaling是否撞牆的質疑不斷,但到2026年年中風向已明顯調轉。Anthropic CEO Dario Amodei在摩根士丹利的一場會上定調稱,Scaling沒有撞牆,2026年還會迎來一輪激進加速。行業行動也印證了這一點:Fable 5被估算為約4.5萬億至5萬億引數,Kimi K3總引數達到2.8萬億。
回到阿里自身,今年8月釋出的Qwen3.8引數已達2.4T。劉大一恆在演講中給出新的路線圖:Qwen4系列即將到來,其後的Qwen4.5與Qwen5計劃進一步邁向5T—10T引數。對比兩年前Qwen2.5旗艦模型的72B,千問的引數規模已增長約33倍;若繼續邁向5T—10T,還將在現有基礎上再擴大一倍至三倍以上。劉大一恆重申,基礎模型的智慧上限仍離不開算力、資料和模型規模的持續投入,阿里會繼續擴大預訓練計算量。
模型越大,訓練與推理的賬單也越高。阿里的解法是一邊擴規模、一邊重做架構。Qwen3.8-Flash展示了這條路線:通過稀疏注意力、線性注意力和外接記憶等新架構,每次推理只啟用6B引數;相比上一代,訓練成本降至九分之一,百萬Token輸入價格降至四分之一,超長上下文的預填充吞吐量提高8.6倍,而模型能力仍在上漲。這意味著下一階段的Scaling不只是把模型做大,而是用更低成本支撐更大的模型繼續向前。
迭代速度是第二個問題。當下模型競爭節奏加快,今天登頂的模型幾周或幾個月後就可能被追平,單一版本領先難以形成長期優勢,真正重要的是誰能更快產出下一代模型。一個越來越被認真對待的方向是讓模型參與造模型,即RSI(遞迴自我改進)。Anthropic曾讓Claude最佳化一段訓練小模型的程式碼:去年提速到原來的3倍,今年最新模型已能做到52倍,而人類研究員花半天通常只能做到4倍左右。OpenAI則訓練了專門攻擊其他模型的GPT-Red,用攻擊樣本訓練下一代模型,使GPT-5.6面對最難一類提示注入攻擊的失敗率比四個月前低約六倍。
阿里把RSI帶到了模型研發的底層環節。一個典型實驗發生在晶片設計上:研究團隊只給Qwen3.8-Max一份真實的片上網路(NoC)模組規格,沒有參考程式碼和現成測試樣例,模型在60多個小時裡自行呼叫EDA工具,完成從編寫電路描述、驗證到後端物理實現的全流程,期間沒有逐輪人工介入,最終晶片物理面積減少42%,功耗估算下降59.5%。在推理基礎設施上,面對一款此前從未適配過的平頭哥新GPU,Qwen3.8-Max自行修改和最佳化SGLang推理框架,用56小時完成部署,將日常對話場景的單例項吞吐量提高96%。阿里還披露,Qwen3.8-Max曾連續自主執行一個多月,完成33輪有效實驗,自己搭流程、構造資料、設計實驗、定位缺陷。這些進展距離“模型自主造出下一代模型”仍有距離,但方向已經清楚:競爭不再只是比誰釋出更強的版本,也開始比誰能把模型更深地嵌入訓練、推理、晶片等研發環節。
多模態是第三條線。鄭波給出明確時間表:下一代影片生成模型將在11月亮相,他把下一階段稱為“Agent Video”——過去的影片模型解決畫面是否逼真,隨後加入圖片、影片、聲音等參考資訊提升可控性,下一步則要理解創作者想講什麼:使用者給出一個想法,模型自己拆解劇情、設計分鏡、安排人物和場景,最終生成完整影片。新版本將沿更長、更可控、更完整、更智慧四個方向推進。
其他多模態更新同步公佈:影像生成模型Qwen-Image-3.1面向電商、創意、設計等商用場景最佳化,將原本數小時的視覺設計壓縮至秒級交付,並支援影像精準編輯;語音方面釋出Qwen-Audio-3.1系列,覆蓋語音轉寫、語音合成與即時語音互動三類模型,其中即時互動版本能邊聽、邊想、邊說,已應用於千問辦公和Qoder,並接入QwenNote A2隨身助理、QwenNote Eva桌面機器人和千問AI眼鏡等硬體;音樂生成模型HappyShrimp1.1在音樂表現、人聲質量、多語種演唱及指令理解四個維度提升,支援百餘種曲風與十餘種主流語言;世界模型HappyOyster公佈2.0 Preview版本,更準確模擬物體運動與碰撞,通過3D時空記憶保持場景穩定並降低互動延遲,阿里還聯合高校和產業夥伴搭建世界模型Benchmark和Arena。鄭波給出更遠的判斷:三年之內,行業可能出現原生的全模態統一生成模型,可同時生成影像、影片和音樂,也能理解空間與世界。
把三個問題拼在一起,阿里的下一階段模型路線逐漸清晰:一條路追逐AGI的邊界,一條路把AI普惠落到日常,最終都指向讓更高智慧走出實驗室、成為更多人可及的生產力。