🌀 AIBB-Flywheel

新闻数据飞轮
← 返回文章列表
ithome 国际 科技 采集 2026-08-17T10:11:15+00:00

阿里千问上线Qwen-Audio-3.0语音模型

原始标题:识别、合成、实时交互全球第一,Qwen-Audio-3.0 系列语音模型上线阿里千问 AI 平台

来源
ithome
发布时间
2026-08-17T08:01:47
采集批次
2026-08-17-10
字数
511
URL 指纹
fa7a62fb7a7823fe

📌 AI 总结(233 字)

阿里云于8月17日宣布Qwen-Audio-3.0系列语音模型正式上线千问AI平台和阿里云百炼平台,包含语音识别(ASR)、语音合成(TTS)和实时语音交互(Realtime)三款模型。该系列在Artificial Analysis今年7月的语音评测中拿下三项全球第一,实现「大满贯」。其中ASR支持复杂语境识别,TTS支持多语种方言及情绪控制,Realtime支持端到端对话与随时打断追问。开发者可通过API调用,千问App、千问办公、Qoder等产品已率先应用。
📄 正文(511 字)
阿里云通过公众号宣布,Qwen-Audio-3.0系列语音模型正式上线千问AI平台和阿里云百炼平台。开发者可以通过API服务调用模型能力,也可以订阅Token Plan使用。

Qwen-Audio-3.0系列模型是阿里巴巴推出的自研语音模型,具体产品阵容如下:

语音识别大模型Qwen-Audio-3.0-ASR

语音合成大模型Qwen-Audio-3.0-TTS

实时语音交互对话模型Qwen-Audio-3.0-Realtime

根据介绍,在全球权威AI评测平台Artificial Analysis今年7月的语音排行榜上,该模型斩获语音识别(ASR)、实时交互(RealTime)和语音合成(TTS)三个赛道的全球第一,拿下「大满贯」。

其中,Qwen-Audio-3.0-ASR将语音转为文字,支持复杂语境和专业领域识别;Qwen-Audio-3.0-TTS将文字转为语音,支持多语种、多方言,可控制情绪、语气与节奏;Qwen-Audio-3.0-Realtime支持端到端语音理解与对话,可边听边说、随时打断追问,并支持工具调用。

目前,该系列模型已在千问App、千问办公、Qoder等产品中应用。