🌀 AIBB-Flywheel

新闻数据飞轮
← 返回文章列表
ithome 科技 采集 2026-09-09T04:15:33+00:00

蚂蚁开源原生多模态大模型Ling-3.0-flash-VL

原始标题:蚂蚁百灵系列首个原生多模态模型 Ling-3.0-flash-VL 发布开源,引入视觉反馈闭环机制

来源
ithome
发布时间
2026-09-09T01:23:17
采集批次
2026-09-09-04
字数
857
URL 指纹
166c030a0cf6906b

📌 AI 总结(316 字)

蚂蚁集团发布并开源百灵系列首个原生多模态大模型Ling-3.0-flash-VL,基于Ling-3.0-flash的MoE架构拓展,总参数124B、单次推理激活5.5B。该模型核心创新在于引入视觉反馈闭环机制,将任务推进为观察、行动、验证、修正的持续闭环,可应用于医疗报告解读、前端代码生成及GUI自动化等场景。在Artificial Analysis Intelligence Index v4.1.1评估中较纯文本版本提升4分,在Image-to-WebDev Arena评测中得分高于GPT-5.4。目前模型已在Ling Studio上线并免费体验,BF16和FP8版本已在Hugging Face及ModelScope开源。
📄 正文(857 字)
IT之家9月9日消息,蚂蚁集团今日宣布推出并开源百灵系列首个原生多模态大模型Ling-3.0-flash-VL。

该模型基于Ling-3.0-flash的MoE(混合专家)架构拓展,总参数量为124B,单次推理激活5.5B参数,原生支持图像、文本与视频输入,上下文窗口达到256K Token。

模型围绕「更可靠、更高效完成真实任务」的方向,引入了视觉反馈闭环机制。不同于一次性的「看图生成」,该机制将任务推进为「观察→行动→验证→修正」的持续闭环,使模型在医疗报告解读、前端代码生成及GUI自动化等场景中能够基于视觉反馈持续修正执行结果。

在训练层面,蚂蚁集团表示,通过原生多模态联合训练,视觉信息的引入对模型的文本能力带来了正向提升。在Artificial Analysis Intelligence Index v4.1.1评估中,Ling-3.0-flash-VL较纯文本版本(Ling-3.0-Flash)提升了4分。

在实际应用测试中,该模型在图片转网页任务中可理解布局与组件关系并生成代码,且能通过渲染结果对比进行自我修正。在Image-to-WebDev Arena官方评测中,模型(代号linthium)的评测得分高于GPT-5.4。作为GUI Agent时,模型可识别界面结构并完成跨工具操作;在医疗报告解读场景中,模型支持跨文档数据整合与风险标识。

Ling-3.0-flash-VL引入了任意分辨率视觉编码器与VideoRoPE,语言主干沿用42层混合架构(IT之家注:交替排列KDA与Gated MLA,比例5:1),在124B总参数下单次推理仅激活5.5B参数。在实时视频对话、多轮视觉交互及长时任务中可保持低延迟响应,其256K上下文窗口支持长文档与长视频分析。

目前,Ling-3.0-flash-VL已在Ling Studio上线并提供免费体验。模型的BF16和FP8版本已在Hugging Face及ModelScope平台开源,FP4和INT4版本计划于近期发布。