🌀 AIBB-Flywheel

新闻数据飞轮
← 返回文章列表
ithome 国际 科技 采集 2026-07-28T16:07:37+00:00

全球第一,智元 WITA-Omni Preview 具身大模型登顶 DailyOmni 全模态理解榜单

来源
ithome
发布时间
2026-07-28T11:08:34
采集批次
2026-07-28-16
字数
748
URL 指纹
7f78fb8425465b5f

📌 AI 总结(253 字)

近日,具身全模态理解权威榜单DailyOmni最新评测结果揭晓,智元自研的具身原生全模态大模型WITA-Omni Preview以85.21分综合成绩登顶,超过千问、Gemini、豆包、英伟达等国内外领先模型,并在八项细分指标中的六项取得第一。WITA-Omni采用Thinker–Talker–Actor架构,将物理动作和表情提升为与语音并列的一级输出,用原生端到端模型统一驱动感知、决策与表达。该模型依托千万小时级多模态数据和面向真实交互的高质量数据集训练而成,在音视频联合理解与时序推理方面表现领先。
📄 正文(748 字)
IT之家7月28日消息,据智元AGIBOT微信公众号消息,近日,具身全模态理解权威榜单DailyOmni最新评测结果揭晓,智元自研的具身原生全模态大模型WITA-Omni Preview,凭借领先的音视频联合理解与时序推理能力,以85.21分综合成绩登顶榜首,超过千问、Gemini、豆包、英伟达等国内外领先模型,并在八项细分指标中的六项取得第一。

据IT之家了解,DailyOmni是行业公认的检验音视频时序对齐、跨模态联合推理能力的权威第三方榜单。不同于面向图文、短视频的常规评测任务,该榜单大量采用真实开放环境音视频素材,核心考验模型融合视觉画面、环境音频信息,精准识别声画对应关系、事件先后顺序及跨模态语义的综合能力,高度贴合人形机器人在真实物理空间开展人机交互所需的核心感知能力。

官方称,WITA-Omni领先的关键,在于它并不是简单地把聊天模型「装进」机器人,而是将物理动作和表情提升为与语音并列的一级输出,用一个原生端到端模型统一驱动感知、决策与表达,从Thinker–Talker范式上进一步扩展出面向具身输出的Thinker–Talker–Actor架构。

WITA-Omni的领先并非单纯依靠模型规模,而是来自一套围绕具身全模态交互构建的分层数据体系与针对性训练方法。在中训练阶段,WITA-Omni使用总计千万小时级的开源和自有多模态数据,将强文本、视觉底座进一步升级为能够「听得见、看得懂,并进行音画联合推理」的全模态模型。

此外,公开音视频数据通常缺少真实交互中的轮次切换、响应时机、动作和表情信息,难以直接训练端到端具身交互模型。为此,智元构建了以人为中心、面向真实交互场景的大规模高质量全模态数据集,完整保留声音、画面、语言、动作和表情之间天然的时序关系。