ithome
其他
采集 2026-08-21T10:12:18+00:00
DeepSeek V4-Flash-Vision-Exp上线:开启多模态API服务
原始标题:DeepSeek V4-Flash-Vision-Exp 上线:开启多模态 API 服务,Agent 能力接近 Opus-4.8
来源
ithome
发布时间
2026-08-21T09:21:20
采集批次
2026-08-21-10
字数
820
URL 指纹
3527f0577876bac3
📌 AI 总结(289 字)
深度求索(DeepSeek)于8月21日宣布推出多模态视觉理解模型DeepSeek-V4-Flash-Vision-Exp,并在DeepSeek API平台上线。该模型支持图片输入,可实现图片描述、截图文字识别、图表分析等功能,兼容JPEG、PNG、GIF、WebP格式。在纯文本能力上与V4-Flash正式版持平,在视觉理解Agent测试中表现大幅提升,多模态Agent能力接近Opus-4.8。API调用中图片转为token计费,单图最多占384tokens,费用与V4-Flash一致。同步上线的Files API支持用户先上传图片再通过file_id引用,无需重复传输。
📄 正文(820 字)
IT之家8月21日消息,深度求索官方宣布全新的多模态视觉理解模型DeepSeek-V4-Flash-Vision-Exp上线DeepSeek API平台。 该模型支持在文本之外输入图片,可以让模型描述图片、识别截图中的文字、分析图表等。支持的图片格式包括JPEG、PNG、GIF、WebP。 深度求索官方表示,V4-Flash-Vision-Exp在各类Agent框架内展现出了较好的多模态适配能力,能够有效支持用户借助多样化的Agent工具解锁更多实用的工作场景。 这是一个实验性质的模型,用户可以通过设置model='deepseek-v4-flash-vision-exp'访问该模型。 据介绍,在纯文本能力(Agent、推理、世界知识等)方面,DeepSeek-V4-Flash-Vision-Exp与DeepSeek-V4-Flash正式版持平;在需要视觉理解的Agent Benchmark上,DeepSeek-V4-Flash-Vision-Exp相比DeepSeek-V4-Flash实现了大幅跃升,多模态Agent能力已接近Opus-4.8。 用户可以通过设置model='deepseek-v4-flash-vision-exp'来访问V4-Flash-Vision-Exp模型的API。在API服务中,图片会转换成token后按token计费,一张图片最多占384tokens,计费价格与V4-Flash模型一致。 多模态API支持Chat Completions、Messages、Responses三种格式调用,可以方便接入各类Agent工具中使用,支持图文混合输入,支持base64内联、外部URL、Files API三种图片传入方式。 Files API现已开放,该API不收费,用户可先将图片上传到平台,再在请求中通过file_id引用,从而节省请求带宽(同一张图片在多个请求中无需重复上传)。