DeepSeek V4.1 Flash在測試中間版兩天後正式上線,並全面替代此前的V4 Pro。據鈦媒體釋出的文章,該模型總引數為552B,採用MoE架構與全新的Causal-Encoder-Decoder非對稱結構,輸入啟用僅8B、輸出啟用16B,推理成本大幅低於同尺寸模型,同時原生支援多模態視覺理解,無需外掛視覺模組。通過KV Cache壓縮,其視訊記憶體需求降至上一代的1/4、SSD需求降至1/8,社群實測輸出速度達300到500 tokens/秒。
效能方面,V4.1 Flash並未因體積更小、速度更快而犧牲能力,各項基準全面超越V4 Pro,其中GPQA Diamond達到90.9。價格同步下調:自9月10日12:00起,閒時快取命中輸入為0.02元、未命中1元、輸出4元/百萬token,高峰時段翻倍。此前快取命中為0.05元、未命中1.5元、輸出4.5元/百萬token。
DSH負責人崔添翼此前在社交媒體表示,V4 Pro的呼叫將轉到效能更高、速度更快的V4.1 Flash上,價格也按Flash計算。他稱Pro價格是Flash的3倍,這一調整讓開發者能省下不少成本。按照他的說法,在V4.1 Pro上線之前,V4 Pro模型的請求都會被路由到V4.1 Flash,並按Flash價格計費。
這一動作被社群納入所謂“賽博義父”經濟的討論。文章將海外廠商的額度重置與國內廠商的直接降價做了對比。OpenAI的Tibo(蒂堡特·索蒂奧)以頻繁重置Codex額度聞名,社群甚至建立網站記錄其重置次數;谷歌的洛根·基爾帕特里克負責AI Studio和Gemini API,以慷慨的免費額度著稱;Anthropic的雷蒂亞·哈莉則主管Claude Code的開發者體驗,也曾為Max使用者重置周限額。文章認為,西方走的是“恩賜派”路線,通過不定期發放額度維持使用者粘性。
國內廠商則被文章歸為“定價派”。DeepSeek創始人梁文鋒選擇將模型權重以MIT協議開源,並以遠低於行業的token價格開放給市場,其定價原則被描述為10個月回本、對應6倍利潤。今年4月,DeepSeek曾把Flash快取命中價格降至0.02元/百萬token,創下當時全球大模型價格新低;8月又預告全線漲價,新價生效後V4 Pro高峰時段快取命中價上漲11倍、輸出價上漲3.5倍,一度引發社群不滿,OpenCode上DeepSeek呼叫量隨之下降。而V4.1 Flash的釋出與降價,被文章視為對此前漲價爭議的回應。
另一家國內廠商智譜則走免費路線。其GLM-4.7 Flash於2026年1月20日釋出,官方稱永久免費、無token上限、200K上下文、併發限制約30 QPS。8月,匿名模型Ox Alpha空降OpenRouter,後經智譜確認即GLM-5.3-Flash,採用MIT全開源,效能超過DeepSeek V4 Pro,但改為低價收費模式,價格為旗艦模型GLM-5.3的1/10。
文章分析認為,額度重置本質上是一種營銷手段,成本接近零,但使用者感知價值實在。以OpenAI為例,若給所有訂閱使用者發放一張Banked Reset並全部使用,按Codex 2000萬周活估算,總成本約1.8億美元,與超級碗廣告花費相當,但觸達更直接。額度與定價因此成為2026年AI大廠競爭的第二戰場:西方廠商把重置權交給使用者,製造“等待感”以增強粘性;國內廠商則直接把便宜做成產品屬性,用技術升級實現降價,以積攢客戶。