ithome
财经
科技
采集 2026-09-04T04:17:20+00:00
微软推出AI语音转文字模型MAI-Transcribe-2
原始标题:微软最强转录 AI 模型:MAI-Transcribe-2 登场,60 语种平均词错误率 5.2%
来源
ithome
发布时间
2026-09-04T00:11:05
采集批次
2026-09-04-04
字数
791
URL 指纹
76869e54ffe3982a
📌 AI 总结(227 字)
微软发布新一代AI语音转文字模型MAI-Transcribe-2,主打更快、更准、更便宜。在FLEURS测试中,其平均词错误率为5.2%,优于GPT-Transcribe和Whisper v3-Large等主流模型。速度方面较GPT-Transcribe快10倍,较Scribe v2快7倍。限时定价0.10美元/小时。新增说话人分离、逐词时间戳、可配置转写风格等功能,支持60种语言及自动语种检测,已在Microsoft Foundry等平台开放调用。
📄 正文(791 字)
IT之家9月4日消息,微软昨日(9月3日)发布博文,宣布推出MAI-Transcribe-2,宣称是其最快、最准确、最便宜的AI语音转文字模型。 在定价方面,MAI-Transcribe-2上市时限时收费0.10美元(IT之家注:现汇率约合0.67元人民币)/小时,优惠持续至2026年年底。 性能方面,MAI-Transcribe-2是微软最强的转录模型,相比较市场上其它主流模型,在准确率、速度和价格方面存在优势。 在FLEURS测试集中,MAI-Transcribe-2支持强制指定语言和自动推断语言两种模式,平均词错误率均为5.2%。同一测试中,Gemini 3.1 Pro的两项结果分别为5.3%和5.8%;GPT-Transcribe为10.4%和10.6%;Whisper v3-Large为22.8%和23.5%。 速度方面,微软援引Artificial Analysis评测称,MAI-Transcribe-2比GPT-Transcribe快10倍,比Scribe v2快7倍,比Gemini 3.5 Transcribe快5倍。 功能方面,MAI-Transcribe-2新增说话人分离功能,可在一段录音内区分不同发言者,并将文字归属到对应说话人。逐词时间戳可为每个词标注精确位置,便于音频检索、导航、编辑和字幕对齐。 风格方面,模型提供可配置转写风格。verbatim模式保留语气词和口误,面向合规与分析工作;clean模式删除语气词,以生成更易读的字幕、笔记和发布文本。模型还支持关键词偏置、自动语言识别、语言切换和噪声环境转写。 模型支持60种语言,并支持自然混用语言的对话,用户无需预先指定语言,模型可自动检测录音语言。目前,开发者可在Microsoft Foundry、MAI Playground和OpenRouter调用或试用该模型。