在今年的云栖大会上,阿里把外界最关心的三个模型问题摆上了台面:下一代Qwen还要做多大、模型迭代还能多快、多模态能不能打。从主论坛议程看,吴泳铭发言之后率先登台的是千问大语言模型负责人刘大一恒,随后是负责视听等多模态模型的ATH技术副总裁郑波,之后才是平头哥高慧与阿里云CTO李飞飞——模型被放在了芯片与云之前的位置。
下一代Qwen的规模是市场最直接的悬念。此前一年多,业内对Scaling是否撞墙的质疑不断,但到2026年年中风向已明显调转。Anthropic CEO Dario Amodei在摩根士丹利的一场会上定调称,Scaling没有撞墙,2026年还会迎来一轮激进加速。行业行动也印证了这一点:Fable 5被估算为约4.5万亿至5万亿参数,Kimi K3总参数达到2.8万亿。
回到阿里自身,今年8月发布的Qwen3.8参数已达2.4T。刘大一恒在演讲中给出新的路线图:Qwen4系列即将到来,其后的Qwen4.5与Qwen5计划进一步迈向5T—10T参数。对比两年前Qwen2.5旗舰模型的72B,千问的参数规模已增长约33倍;若继续迈向5T—10T,还将在现有基础上再扩大一倍至三倍以上。刘大一恒重申,基础模型的智能上限仍离不开算力、数据和模型规模的持续投入,阿里会继续扩大预训练计算量。
模型越大,训练与推理的账单也越高。阿里的解法是一边扩规模、一边重做架构。Qwen3.8-Flash展示了这条路线:通过稀疏注意力、线性注意力和外接记忆等新架构,每次推理只激活6B参数;相比上一代,训练成本降至九分之一,百万Token输入价格降至四分之一,超长上下文的预填充吞吐量提高8.6倍,而模型能力仍在上涨。这意味着下一阶段的Scaling不只是把模型做大,而是用更低成本支撑更大的模型继续向前。
迭代速度是第二个问题。当下模型竞争节奏加快,今天登顶的模型几周或几个月后就可能被追平,单一版本领先难以形成长期优势,真正重要的是谁能更快产出下一代模型。一个越来越被认真对待的方向是让模型参与造模型,即RSI(递归自我改进)。Anthropic曾让Claude优化一段训练小模型的代码:去年提速到原来的3倍,今年最新模型已能做到52倍,而人类研究员花半天通常只能做到4倍左右。OpenAI则训练了专门攻击其他模型的GPT-Red,用攻击样本训练下一代模型,使GPT-5.6面对最难一类提示注入攻击的失败率比四个月前低约六倍。
阿里把RSI带到了模型研发的底层环节。一个典型实验发生在芯片设计上:研究团队只给Qwen3.8-Max一份真实的片上网络(NoC)模块规格,没有参考代码和现成测试样例,模型在60多个小时里自行调用EDA工具,完成从编写电路描述、验证到后端物理实现的全流程,期间没有逐轮人工介入,最终芯片物理面积减少42%,功耗估算下降59.5%。在推理基础设施上,面对一款此前从未适配过的平头哥新GPU,Qwen3.8-Max自行修改和优化SGLang推理框架,用56小时完成部署,将日常对话场景的单实例吞吐量提高96%。阿里还披露,Qwen3.8-Max曾连续自主运行一个多月,完成33轮有效实验,自己搭流程、构造数据、设计实验、定位缺陷。这些进展距离“模型自主造出下一代模型”仍有距离,但方向已经清楚:竞争不再只是比谁发布更强的版本,也开始比谁能把模型更深地嵌入训练、推理、芯片等研发环节。
多模态是第三条线。郑波给出明确时间表:下一代视频生成模型将在11月亮相,他把下一阶段称为“Agent Video”——过去的视频模型解决画面是否逼真,随后加入图片、视频、声音等参考信息提升可控性,下一步则要理解创作者想讲什么:用户给出一个想法,模型自己拆解剧情、设计分镜、安排人物和场景,最终生成完整视频。新版本将沿更长、更可控、更完整、更智能四个方向推进。
其他多模态更新同步公布:图像生成模型Qwen-Image-3.1面向电商、创意、设计等商用场景优化,将原本数小时的视觉设计压缩至秒级交付,并支持图像精准编辑;语音方面发布Qwen-Audio-3.1系列,覆盖语音转写、语音合成与实时语音交互三类模型,其中实时交互版本能边听、边想、边说,已应用于千问办公和Qoder,并接入QwenNote A2随身助理、QwenNote Eva桌面机器人和千问AI眼镜等硬件;音乐生成模型HappyShrimp1.1在音乐表现、人声质量、多语种演唱及指令理解四个维度提升,支持百余种曲风与十余种主流语言;世界模型HappyOyster公布2.0 Preview版本,更准确模拟物体运动与碰撞,通过3D时空记忆保持场景稳定并降低交互延迟,阿里还联合高校和产业伙伴搭建世界模型Benchmark和Arena。郑波给出更远的判断:三年之内,行业可能出现原生的全模态统一生成模型,可同时生成图像、视频和音乐,也能理解空间与世界。
把三个问题拼在一起,阿里的下一阶段模型路线逐渐清晰:一条路追逐AGI的边界,一条路把AI普惠落到日常,最终都指向让更高智能走出实验室、成为更多人可及的生产力。