微軟當地時間10月1日釋出三款語音AI模型,包括即時語音轉文字模型MAI-Transcribe-2-Streaming,以及文本轉語音模型MAI-Voice-2.1和低延遲版本MAI-Voice-2.1-Flash。其中,MAI-Transcribe-2-Streaming在AI基準測試平台Artificial Analysis的流式語音識別測試中拿下準確率第一。

Artificial Analysis資料顯示,MAI-Transcribe-2-Streaming的最終轉錄詞錯誤率(WER)為2.5%,在38款模型中排名第一;從說話結束到返回最終文本僅需約0.13秒。在更強調即時性的“首次部分轉錄”測試中,其WER同樣為2.5%,延遲約0.12秒。作為對比,此前排名第一的SpaceXAI Grok Voice Transcribe 2.0最終WER為2.7%、延遲0.49秒;Muse Voice Transcribe的WER為3.1%、延遲0.16秒;ElevenLabs Scribe v2 Realtime則為3.6%和0.14秒。

此次釋出的核心是MAI-Transcribe-2-Streaming。微軟稱,該模型支援60種語言,並能持續自動識別語言,不必等使用者說完一句話才開始輸出文字。與傳統語音轉文字模型“聽完—處理—輸出”的模式不同,流式模型會先快速生成部分轉錄結果,再隨著更多語音資訊進入不斷修正,最終形成穩定文本。微軟表示,模型在接收到音訊後100多毫秒即可開始產生首批結果。

這意味著語音AI的應用場景可以從單純“把聲音變成文字”向即時互動延伸。例如在客服場景中,AI智慧體可在使用者尚未說完一句話時就開始識別需求;語音助手則可提前進行推理、準備工具呼叫,而非等使用者說完後才啟動整個處理流程。微軟稱,在即時聽寫和字幕等應用中,其內部測試顯示文字出現速度約為最接近競爭對手的兩倍。

不過,速度並非絕對領先。Artificial Analysis資料顯示,Cartesia Ink Preview的最終轉錄延遲約0.11秒,略快於微軟模型,但其WER為3.1%,準確率低於微軟。

價格方面,微軟為MAI-Transcribe-2-Streaming提供了每小時0.54美元的年末前優惠價格,相當於每1000分鐘9美元。從Artificial Analysis的橫向比較看,這一價格處於主流流式語音模型價格的相對較高位置:與Gemini 3.5 Transcribe Live的約9美元/1000分鐘相當,高於ElevenLabs Scribe v2 Realtime和Deepgram Flux的約6.50美元,也明顯高於Cartesia Ink-2約4美元和Muse Voice Transcribe約3美元。這意味著微軟此次並非單純通過低價搶市場,而是試圖將準確率、延遲和企業級部署能力結合起來。

微軟此前9月推出的非流式MAI-Transcribe-2主打準確率、說話人識別、時間戳和複雜真實場景等能力,目前支援60種語言。微軟當時稱,該模型在FLEURS基準測試中平均WER為5.2%,並在Artificial Analysis的準確率與延遲測試中位於Pareto前沿。

除轉錄模型外,微軟此次還發布MAI-Voice-2.1和MAI-Voice-2.1-Flash,分別對應更高的表達質量和更低的延遲。其中,MAI-Voice-2.1支援23種語言、26個地區/語言環境,微軟強調同一個聲音可以跨語言保持一致,同時針對不同語言使用更自然的本地口音。這意味著開發者可以讓一個AI助手在英語、中文、德語等語言之間切換,而無需為每種語言配置不同的聲音。

MAI-Voice-2.1的價格為每100萬字符22美元,更適合對語音表現力要求較高的場景;MAI-Voice-2.1-Flash則面向對延遲和成本更敏感的應用,價格降至每100萬字符15美元。微軟稱,Flash版本的模型推理速度提升55%,成本較可比模型低約60%。兩款模型均支援基於數秒參考音訊進行聲音克隆,並加入同意機制等安全措施。

從產品組合看,微軟此次實際上是在同時壓縮語音AI互動的兩端延遲:MAI-Transcribe-2-Streaming負責快速“聽懂”,MAI-Voice-2.1-Flash負責快速“說出”。微軟稱,兩者結合後可為語音智慧體釋放更多時間用於推理、呼叫工具和檢查答案,同時保持接近自然人類對話的互動節奏。

此次釋出也延續了微軟今年以來擴大MAI自研模型矩陣的動作。微軟此前已推出MAI-Transcribe-2、MAI-Voice-2、MAI-Thinking-1、MAI-Code-1.1-Flash以及MAI-Image系列模型,並將這些模型逐步接入Microsoft Foundry以及Copilot、Teams、GitHub、Dynamics 365等產品和服務。其中,MAI-Transcribe-2目前已經覆蓋會議記錄、影片字幕、客服文件、無障礙服務以及語音智慧體等場景;此次進一步加入即時流式版本,意味著其自研模型的競爭重點正從單項識別準確率轉向即時語音智慧體完整鏈路。

對微軟而言,這一方向的意義並不只在於增加幾個模型。隨著AI智慧體從文字互動進一步走向電話客服、語音助手、即時翻譯和多模態工作流,語音識別和語音生成的延遲、準確率與成本都會直接影響使用者體驗和企業部署成本。此次MAI-Transcribe-2-Streaming在Artificial Analysis測試中登頂,至少顯示微軟在語音AI這一細分賽道正在加速追趕並進入第一梯隊。