HiDeepSeekDev
空闲特惠
语音与多模态微软语音识别语音生成AI Agent

微软发布流式转录 MAI-Transcribe-2:面向低延迟语音 Agent

微软 10 月 1 日公布 MAI-Transcribe-2-Streaming,并更新 MAI Voice 2.1 与 Flash。新转录模型支持 60 种语言,微软称首段转录延迟略高于 100 毫秒;现阶段价格、基准和质量数据均应按官方公布与实际工作负载核对。

快速结论

这是面向实时语音交互的模型更新,不是通用聊天模型发布。微软称其支持 60 种语言和持续语言识别,流式首段延迟略高于 100 毫秒;MAI Voice 2.1 有标准与 Flash 版本。团队可在语音 Agent、会议转录和客服场景试测,再比较端到端延迟、识别准确率和总成本。

  • MAI-Transcribe-2-Streaming 于 2026 年 10 月 1 日公布,微软称支持 60 种语言和连续语言检测。
  • 微软称首段转录延迟略高于 100 毫秒,并在 Artificial Analysis 的最终及部分转录准确度评估中排名第一;属于厂商引用的基准结果。
  • 微软公布 MAI Voice 2.1 与 2.1 Flash:分别支持 23 种语言/26 个地区口音,以及面向更快生成的 Flash 版本。
  • 微软公告列出转录模型介绍期价格每音频小时 0.54 美元(至 2026 年底),语音生成另按字符计费;上线前应以 Foundry 当前价格和地区可用性为准。

本次更新:依据 Microsoft AI 官方公告核对模型用途、语言范围、厂商基准口径、公开价格与接入渠道。

发布日:2026 年 10 月 1 日;核验时间:10 月 2 日。微软公布 MAI-Transcribe-2-Streaming 流式语音转录模型,同时更新 MAI Voice 2.1 和 2.1 Flash。此次更新面向实时转录与语音生成,可用于语音 Agent、客服、会议和实时字幕等场景。

一、流式转录的重点

微软称 MAI-Transcribe-2-Streaming 支持 60 种语言、持续语言检测以及流式文本输出,首段转录延迟略高于 100 毫秒。对于语音 Agent,部分结果能够更早抵达编排层,让系统可以边听边判断或准备回应;最终体验仍取决于网络、端点检测、模型推理和语音合成的合计延迟。

微软还引用 Artificial Analysis 的评估,称该模型在最终转录和部分转录准确度方面位列第一。该排名属于微软公告引用的测试结果,语言、音质、口音、噪声、领域词汇和流式切分策略都会影响实际表现。部署团队应使用自己的录音样本评估字错率、专名识别和延迟分布。

二、语音生成同步更新

MAI Voice 2.1 支持 23 种语言和 26 个地区口音;Flash 版本以更快生成和较低标价为定位。官方公告列出的价格分别为每百万字符 22 美元和约 15 美元。具体费用和可用地区以 Microsoft Foundry 的当前价格页为准,试用成本还应计入失败重试、端点常驻和上下文处理。

三、接入方式与运营评估

微软称模型可通过 Microsoft Foundry、MAI Playground 和 Vercel 使用,并提及与 Azure Voice Live 等语音体验的集成。采购或迁移前,应确认租户、区域和服务等级是否开放,核对音频保留规则与语音数据处理条款。

  • 分别测量首段文本、最终转录、端到端语音往返和打断恢复延迟。
  • 按语言、口音、噪声和领域词汇抽样,记录准确率及人工纠错时间。
  • 将 ASR、LLM、TTS、网络和日志费用合并计算每次成功会话成本。
  • 为流式中断、重复片段和部分结果修订设计幂等与界面策略。
运营判断:本次更新让低延迟转录与语音生成可以在同一厂商产品线上评估。对语音产品团队,建议先做一组真实对话的端到端试点,再根据误识率和完整会话成本决定切换范围。

参考资料

本文依据以下资料整理,版本与接口信息请以来源页面的现行说明为准。

  1. 01Microsoft AI:MAI-Transcribe-2-Streaming 官方发布公告(10 月 1 日)microsoft.ai
  2. 02Microsoft Foundry:模型目录与当前可用性ai.azure.com
阅读至此返回学习中心