微软当地时间10月1日发布三款语音AI模型,包括实时语音转文字模型MAI-Transcribe-2-Streaming,以及文本转语音模型MAI-Voice-2.1和低延迟版本MAI-Voice-2.1-Flash。其中,MAI-Transcribe-2-Streaming在AI基准测试平台Artificial Analysis的流式语音识别测试中拿下准确率第一。
Artificial Analysis数据显示,MAI-Transcribe-2-Streaming的最终转录词错误率(WER)为2.5%,在38款模型中排名第一;从说话结束到返回最终文本仅需约0.13秒。在更强调实时性的“首次部分转录”测试中,其WER同样为2.5%,延迟约0.12秒。作为对比,此前排名第一的SpaceXAI Grok Voice Transcribe 2.0最终WER为2.7%、延迟0.49秒;Muse Voice Transcribe的WER为3.1%、延迟0.16秒;ElevenLabs Scribe v2 Realtime则为3.6%和0.14秒。
此次发布的核心是MAI-Transcribe-2-Streaming。微软称,该模型支持60种语言,并能持续自动识别语言,不必等用户说完一句话才开始输出文字。与传统语音转文字模型“听完—处理—输出”的模式不同,流式模型会先快速生成部分转录结果,再随着更多语音信息进入不断修正,最终形成稳定文本。微软表示,模型在接收到音频后100多毫秒即可开始产生首批结果。
这意味着语音AI的应用场景可以从单纯“把声音变成文字”向实时交互延伸。例如在客服场景中,AI智能体可在用户尚未说完一句话时就开始识别需求;语音助手则可提前进行推理、准备工具调用,而非等用户说完后才启动整个处理流程。微软称,在实时听写和字幕等应用中,其内部测试显示文字出现速度约为最接近竞争对手的两倍。
不过,速度并非绝对领先。Artificial Analysis数据显示,Cartesia Ink Preview的最终转录延迟约0.11秒,略快于微软模型,但其WER为3.1%,准确率低于微软。
价格方面,微软为MAI-Transcribe-2-Streaming提供了每小时0.54美元的年末前优惠价格,相当于每1000分钟9美元。从Artificial Analysis的横向比较看,这一价格处于主流流式语音模型价格的相对较高位置:与Gemini 3.5 Transcribe Live的约9美元/1000分钟相当,高于ElevenLabs Scribe v2 Realtime和Deepgram Flux的约6.50美元,也明显高于Cartesia Ink-2约4美元和Muse Voice Transcribe约3美元。这意味着微软此次并非单纯通过低价抢市场,而是试图将准确率、延迟和企业级部署能力结合起来。
微软此前9月推出的非流式MAI-Transcribe-2主打准确率、说话人识别、时间戳和复杂真实场景等能力,目前支持60种语言。微软当时称,该模型在FLEURS基准测试中平均WER为5.2%,并在Artificial Analysis的准确率与延迟测试中位于Pareto前沿。
除转录模型外,微软此次还发布MAI-Voice-2.1和MAI-Voice-2.1-Flash,分别对应更高的表达质量和更低的延迟。其中,MAI-Voice-2.1支持23种语言、26个地区/语言环境,微软强调同一个声音可以跨语言保持一致,同时针对不同语言使用更自然的本地口音。这意味着开发者可以让一个AI助手在英语、中文、德语等语言之间切换,而无需为每种语言配置不同的声音。
MAI-Voice-2.1的价格为每100万字符22美元,更适合对语音表现力要求较高的场景;MAI-Voice-2.1-Flash则面向对延迟和成本更敏感的应用,价格降至每100万字符15美元。微软称,Flash版本的模型推理速度提升55%,成本较可比模型低约60%。两款模型均支持基于数秒参考音频进行声音克隆,并加入同意机制等安全措施。
从产品组合看,微软此次实际上是在同时压缩语音AI交互的两端延迟:MAI-Transcribe-2-Streaming负责快速“听懂”,MAI-Voice-2.1-Flash负责快速“说出”。微软称,两者结合后可为语音智能体释放更多时间用于推理、调用工具和检查答案,同时保持接近自然人类对话的交互节奏。
此次发布也延续了微软今年以来扩大MAI自研模型矩阵的动作。微软此前已推出MAI-Transcribe-2、MAI-Voice-2、MAI-Thinking-1、MAI-Code-1.1-Flash以及MAI-Image系列模型,并将这些模型逐步接入Microsoft Foundry以及Copilot、Teams、GitHub、Dynamics 365等产品和服务。其中,MAI-Transcribe-2目前已经覆盖会议记录、视频字幕、客服文档、无障碍服务以及语音智能体等场景;此次进一步加入实时流式版本,意味着其自研模型的竞争重点正从单项识别准确率转向实时语音智能体完整链路。
对微软而言,这一方向的意义并不只在于增加几个模型。随着AI智能体从文字交互进一步走向电话客服、语音助手、实时翻译和多模态工作流,语音识别和语音生成的延迟、准确率与成本都会直接影响用户体验和企业部署成本。此次MAI-Transcribe-2-Streaming在Artificial Analysis测试中登顶,至少显示微软在语音AI这一细分赛道正在加速追赶并进入第一梯队。