ithome
其他
采集 2026-08-31T16:14:44+00:00
DeepSeek开源V4-Flash-Vision-Exp多模态模型
原始标题:DeepSeek-V4-Flash-Vision-Exp 模型已开源,多模态 Agent 能力接近 Opus-4.8
来源
ithome
发布时间
2026-08-31T11:35:24
采集批次
2026-08-31-16
字数
599
URL 指纹
6cc138158814157b
📌 AI 总结(257 字)
DeepSeek于8月底在Hugging Face开源了V4系列首款多模态视觉模型DeepSeek-V4-Flash-Vision-Exp,采用MIT协议,涵盖模型文件、Tokenizer及核心模块的PyTorch推理实现。该模型原生支持图片输入,可用于图像描述、截图文字识别和图表分析,支持JPEG、PNG、GIF、WebP格式。官方称其在纯文本任务上与V4-Flash正式版持平,在视觉理解Agent基准测试中大幅提升,多模态Agent能力接近Opus-4.8,已于8月21日上线DeepSeek API平台。
📄 正文(599 字)
DeepSeek V4 首个多模态模型 DeepSeek-V4-Flash-Vision-Exp 已在 Hugging Face 上线,采用 MIT License 开源。公开内容包括模型文件、Tokenizer、Prompt Encoding 参考实现,以及最小化 PyTorch 推理实现,覆盖视觉编码器、Aligner、DFlash Attention、MoE、Hyper-Connections 与 DSpark 等核心模块。 DeepSeek-V4-Flash-Vision-Exp 是 DeepSeek V4 系列首款原生支持图片输入的视觉模型,官方明确标注为「Exp」实验版本,于 8 月 21 日上线 DeepSeek API 平台。 该模型支持在文本之外输入图片,可以让模型描述图片、识别截图中的文字、分析图表等。支持的图片格式包括 JPEG、PNG、GIF、WebP。 深度求索官方表示,V4-Flash-Vision-Exp 在各类 Agent 框架内展现出了较好的多模态适配能力,能够有效支持用户借助多样化的 Agent 工具解锁更多实用的工作场景。在 Agent、推理、世界知识等纯文本任务上与 V4-Flash 正式版持平,原有优势完整保留。在需要视觉理解的 Agent 基准测试中较 V4-Flash 大幅提升,多模态 Agent 能力已接近 Opus-4.8。