🌀 AIBB-Flywheel

新闻数据飞轮
← 返回文章列表
ithome 时政 国际 科技 采集 2026-07-31T04:32:19+00:00

阿里发布Qwen-Audio-3.0-ASR-Flash语音识别大模型

原始标题:阿里发布 Qwen-Audio-3.0-ASR-Flash 语音识别大模型,让 AI 更好听懂专业词汇

来源
ithome
发布时间
2026-07-31T03:57:20
采集批次
2026-07-31-04
字数
521
URL 指纹
8c5973537b941f48

📌 AI 总结(232 字)

阿里巴巴发布语音识别大模型Qwen-Audio-3.0-ASR-Flash,聚焦专业词汇识别能力提升。该模型在上下文一致性、行业词识别和热词定制化三方面做了优化,并具备语音润色能力。团队从医疗、IT编程、股票等领域构建高质量词库,医疗场景听中率突破95.36%,此前该系列以1.7%错字率拿下AI评测平台全球第一。新模型已在会议纪要、实时字幕、教育录播、智能客服等场景落地,并通过阿里云百炼平台开放Flash、Filetrans、Streaming三个版本供调用。
📄 正文(521 字)
阿里巴巴今日发布语音识别大模型Qwen-Audio-3.0-ASR-Flash,核心目标是让AI更好地听懂专业词汇。

Qwen-Audio-3.0-ASR-Flash主要在上下文一致性、行业词识别和热词定制化三个维度做了系统性优化,同时让模型具备语音润色能力,可直接输出结构化文本。

研究团队持续从医疗、IT编程、股票、社会名人等领域挖掘专业词汇,建成了覆盖多行业的高质量词库,加强模型对专业术语和冷门词的识别能力。在最新的行业词汇内部评测中,新模型对各行业专业词的听中率都有明显提升,其中医疗场景更是突破了95.36%。

目前,Qwen-Audio-ASR-Flash系列已经在会议纪要整理、实时字幕、教育录播、智能客服等场景中得到验证,曾在AI评测平台Artificial Analysis上以1.7%的错字率拿下全球第一。

Qwen-Audio-3.0-ASR现已通过阿里云百炼平台开放调用,提供三个版本:

Qwen-Audio-3.0-ASR-Flash:语音识别,最长5分钟

Qwen-Audio-3.0-ASR-Filetrans:离线文件转写

Qwen-Audio-3.0-ASR-Streaming:实时语音识别