ithome
科技
采集 2026-09-16T10:11:33+00:00
讯飞发布语音基座大模型Spark-Audio-1.0-Preview
原始标题:基于全国产化算力训练,讯飞星火语音基座大模型 Spark-Audio-1.0-Preview 上线
来源
ithome
发布时间
2026-09-16T08:44:34
采集批次
2026-09-16-10
字数
880
URL 指纹
7325dfa4d22f647b
📌 AI 总结(156 字)
科大讯飞近日上线基于全国产化算力训练的语音基座大模型Spark-Audio-1.0-Preview。该模型采用端到端方案,可一次性理解人声、环境音、音乐等,并支持语音转写、多语言翻译、情感分析等。它在复杂场景高噪声、小音量等真实应用任务上明显领先,支持99种语言及202种方言识别,模型已在讯飞开放平台开放体验。
📄 正文(880 字)
科大讯飞今日宣布Spark-Audio-1.0-Preview上线,这是一款基于全国产化算力训练的语音基座大模型。 过去,大模型处理音频大多采用级联方案:先把语音转成文字,再交给大模型理解。这种做法存在两个明显短板:一是信息丢失,文字只能记录说了什么,会丢掉语音里自带的语气、情绪,还有背景环境音等关键信息;二是链路割裂,把语音转写、声纹识别、语音翻译等能力拆成独立模块串联运行,模块之间存在断点,容易累积错误,并出现延迟、卡顿。 语音基座大模型直接理解语音,一次性听懂人声、环境音、音乐等,还能理解声音里的语义、情绪和场景。 此次首发的Spark-Audio-1.0-Preview采用0.65B( Dense结构)的音频编码器,搭配30B-A3B( MoE结构)的大语言模型,使用了1300万小时音频以及大量文本数据,基于纯国产算力集群训练完成;在同一个模型中可输入文本和语音两个模态,支持语音转写、多语言翻译、多方言识别、环境音识别、说话人识别、情感分析以及复杂的音频问答等任务。 官方称,Spark-Audio-1.0-Preview在各项语音评测任务上效果整体相当、部分超过,尤其在复杂场景高噪声、小声说等偏真实应用类任务上明显领先;与尺寸更大的闭源语音基座模型相比,表现也十分接近。Spark-Audio-1.0-Preview可支持99种语言及202种方言的识别,在多语言、多方言语音识别上较同尺寸的Qwen3.5-omni-flash(35B-A3B)有优势,接近尺寸高一个数量级的Qwen3.5-omni-plus。在Fleurs中文测试集中,Spark-Audio-1.0-Preview取得了SOTA。 在复杂场景的高噪声、小音量等条件下,Spark-Audio-1.0-Preview的语音识别评测也具有较为明显的领先优势。在通用知识、数学与代码等任务上没有出现明显降智,同时在指令遵循、对话、音频理解等任务上仍有进步空间。 目前,Spark-Audio-1.0-Preview已正式开放体验,API后续将上线讯飞开放平台。