DeepSeek V4.1 Flash在测试中间版两天后正式上线,并全面替代此前的V4 Pro。据钛媒体发布的文章,该模型总参数为552B,采用MoE架构与全新的Causal-Encoder-Decoder非对称结构,输入激活仅8B、输出激活16B,推理成本大幅低于同尺寸模型,同时原生支持多模态视觉理解,无需外挂视觉模块。通过KV Cache压缩,其显存需求降至上一代的1/4、SSD需求降至1/8,社区实测输出速度达300到500 tokens/秒。
性能方面,V4.1 Flash并未因体积更小、速度更快而牺牲能力,各项基准全面超越V4 Pro,其中GPQA Diamond达到90.9。价格同步下调:自9月10日12:00起,闲时缓存命中输入为0.02元、未命中1元、输出4元/百万token,高峰时段翻倍。此前缓存命中为0.05元、未命中1.5元、输出4.5元/百万token。
DSH负责人崔添翼此前在社交媒体表示,V4 Pro的调用将转到性能更高、速度更快的V4.1 Flash上,价格也按Flash计算。他称Pro价格是Flash的3倍,这一调整让开发者能省下不少成本。按照他的说法,在V4.1 Pro上线之前,V4 Pro模型的请求都会被路由到V4.1 Flash,并按Flash价格计费。
这一动作被社区纳入所谓“赛博义父”经济的讨论。文章将海外厂商的额度重置与国内厂商的直接降价做了对比。OpenAI的Tibo(蒂堡特·索蒂奥)以频繁重置Codex额度闻名,社区甚至建立网站记录其重置次数;谷歌的洛根·基尔帕特里克负责AI Studio和Gemini API,以慷慨的免费额度著称;Anthropic的雷蒂亚·哈莉则主管Claude Code的开发者体验,也曾为Max用户重置周限额。文章认为,西方走的是“恩赐派”路线,通过不定期发放额度维持用户粘性。
国内厂商则被文章归为“定价派”。DeepSeek创始人梁文锋选择将模型权重以MIT协议开源,并以远低于行业的token价格开放给市场,其定价原则被描述为10个月回本、对应6倍利润。今年4月,DeepSeek曾把Flash缓存命中价格降至0.02元/百万token,创下当时全球大模型价格新低;8月又预告全线涨价,新价生效后V4 Pro高峰时段缓存命中价上涨11倍、输出价上涨3.5倍,一度引发社区不满,OpenCode上DeepSeek调用量随之下降。而V4.1 Flash的发布与降价,被文章视为对此前涨价争议的回应。
另一家国内厂商智谱则走免费路线。其GLM-4.7 Flash于2026年1月20日发布,官方称永久免费、无token上限、200K上下文、并发限制约30 QPS。8月,匿名模型Ox Alpha空降OpenRouter,后经智谱确认即GLM-5.3-Flash,采用MIT全开源,性能超过DeepSeek V4 Pro,但改为低价收费模式,价格为旗舰模型GLM-5.3的1/10。
文章分析认为,额度重置本质上是一种营销手段,成本接近零,但用户感知价值实在。以OpenAI为例,若给所有订阅用户发放一张Banked Reset并全部使用,按Codex 2000万周活估算,总成本约1.8亿美元,与超级碗广告花费相当,但触达更直接。额度与定价因此成为2026年AI大厂竞争的第二战场:西方厂商把重置权交给用户,制造“等待感”以增强粘性;国内厂商则直接把便宜做成产品属性,用技术升级实现降价,以积攒客户。