ithome
时政
财经
科技
采集 2026-09-02T04:16:51+00:00
Meta发布实时音频转写模型
原始标题:Meta 发布首个实时音频感知 AI 模型,支持 20 余人分轨转写
来源
ithome
发布时间
2026-09-02T00:23:26
采集批次
2026-09-02-04
字数
560
URL 指纹
01e32a1d96ce66e1
📌 AI 总结(155 字)
Meta推出Muse Voice Transcribe实时音频感知模型,可通过Model API为开发者提供同步转写、说话人分离和语音结束检测服务。每千分钟音频收费3美元,支持20余名说话者分轨、转写超过1小时的多语言音频。模型以自适应延迟机制平衡识别速度与准确度,Meta称其在流式语音转文字测试中排名第一。
📄 正文(560 字)
Meta推出Muse Voice Transcribe实时音频感知模型。开发者可通过Meta Model API调用该能力,每处理1000分钟音频收费3美元,约合每小时0.18美元。 该模型将流式自动语音识别、说话人分离与端点检测整合到同一流程中。用户说话时,系统可持续同步输出文字,无需等待录音结束后再处理,适用于实时听写、会议记录和通话字幕等场景。 Muse Voice Transcribe能够从包含20余名说话者的录音中分离不同发言者,并判断一段发言是否结束,以自动确定转写内容的边界。模型训练覆盖70余种语言,其中25种语言在发布时完成验证。 该模型支持长度超过1小时的音频,以及句内或句间的自然语言切换。开发者还可通过语言、关键词和上下文偏置,提升特定语言、专业术语或特定场景下的识别效果。 为兼顾实时响应与识别准确度,Meta引入自适应延迟机制。系统不会对所有词语采用固定的延迟策略,而是根据每个词的识别难度,动态决定是否需要接收更多前后音频再输出结果。容易识别的语音会更快提交转写结果,发音不清、术语较多或语境复杂的词语则会利用更多上下文。 Meta表示,截至2026年9月1日,Muse Voice Transcribe在Artificial Analysis流式语音转文本排行榜中排名第一。