← 返回 2026-10-03 简报

微软AI发布面向语音代理的新型转录与文本转语音模型

Microsoft AI releases new transcription and text-to-speech models for voice agents

语音播报
摘要
事件:微软发布MAI-Transcribe-2-Streaming实时转录模型及MAI-Voice-2.1语音合成模型。 要点:转录支持60种语言,首字延迟超100毫秒;TTS支持23种语言同音色,延迟150毫秒。 影响:低延迟与高拟真度使语音代理能中途打断交互,大幅降低开发门槛,推动实时语音AI应用落地。

微软人工智能部门发布了MAI-Transcribe-2-Streaming,这是一款用于实时转录的新模型。微软表示,该模型在Artificial Analysis的准确性排名中位列第一。该模型支持60种语言的转录,并能在一百多毫秒内输出首个部分结果。微软称,这使得语音代理能够在用户尚未说完一句话时就做出响应。到今年年底,按入门价格计算,一小时音频的费用为0.54美元。

微软还发布了两个新的文本转语音模型。MAI-Voice-2.1旨在以同一种声音讲述23种语言,并在每种语言中保持地道的口音。据微软介绍,MAI-Voice-2.1-Flash变体的延迟低至150毫秒,每百万字符的费用为15美元,而非之前的22美元。

这两款语音模型仅需几秒钟的参考音频即可克隆声音,内置的安全措施旨在防止滥用。这些模型可通过Microsoft Foundry和MAI Playground等平台获取,两款语音模型也在OpenRouter上提供。在一次测试中,约4,000名参与者中的一半认为这些声音来自真人。

去伪存真的人工智能新闻——由人类精心策划

订阅THE DECODER,享受无广告阅读、每周人工智能通讯、每年六次的独家“AI雷达”前沿报告、完整档案访问权限以及评论区的参与资格。

立即订阅

本条评分 10.3 score-v1
  • 来源权威 8
    注册表 priority=8(The Decoder)
  • 时效 2.328
    发布 13.2 小时前,衰减到 2.33/3.0
  • 多源印证 0
    只有 1 家在报(无旁证)
  • 社区信号 0
    无社区数据(本管线走 RSS,HN 的 hn_fetcher 未接入)

首次收录 · 2026-10-03 · 10.33 分

原文链接:https://the-decoder.com/microsoft-ai-releases-new-transcription-and-text-to-speech-models-for-voice-agents/
来源:The Decoder
以上内容由 AI 自动翻译,仅供参考。
← 返回简报