🌀 AIBB-Flywheel

新闻数据飞轮
← 返回文章列表
ithome 其他 采集 2026-08-21T10:12:18+00:00

DeepSeek V4-Flash-Vision-Exp上线:开启多模态API服务

原始标题:DeepSeek V4-Flash-Vision-Exp 上线:开启多模态 API 服务,Agent 能力接近 Opus-4.8

来源
ithome
发布时间
2026-08-21T09:21:20
采集批次
2026-08-21-10
字数
820
URL 指纹
3527f0577876bac3

📌 AI 总结(289 字)

深度求索(DeepSeek)于8月21日宣布推出多模态视觉理解模型DeepSeek-V4-Flash-Vision-Exp,并在DeepSeek API平台上线。该模型支持图片输入,可实现图片描述、截图文字识别、图表分析等功能,兼容JPEG、PNG、GIF、WebP格式。在纯文本能力上与V4-Flash正式版持平,在视觉理解Agent测试中表现大幅提升,多模态Agent能力接近Opus-4.8。API调用中图片转为token计费,单图最多占384tokens,费用与V4-Flash一致。同步上线的Files API支持用户先上传图片再通过file_id引用,无需重复传输。
📄 正文(820 字)
IT之家8月21日消息,深度求索官方宣布全新的多模态视觉理解模型DeepSeek-V4-Flash-Vision-Exp上线DeepSeek API平台。

该模型支持在文本之外输入图片,可以让模型描述图片、识别截图中的文字、分析图表等。支持的图片格式包括JPEG、PNG、GIF、WebP。

深度求索官方表示,V4-Flash-Vision-Exp在各类Agent框架内展现出了较好的多模态适配能力,能够有效支持用户借助多样化的Agent工具解锁更多实用的工作场景。

这是一个实验性质的模型,用户可以通过设置model='deepseek-v4-flash-vision-exp'访问该模型。

据介绍,在纯文本能力(Agent、推理、世界知识等)方面,DeepSeek-V4-Flash-Vision-Exp与DeepSeek-V4-Flash正式版持平;在需要视觉理解的Agent Benchmark上,DeepSeek-V4-Flash-Vision-Exp相比DeepSeek-V4-Flash实现了大幅跃升,多模态Agent能力已接近Opus-4.8。

用户可以通过设置model='deepseek-v4-flash-vision-exp'来访问V4-Flash-Vision-Exp模型的API。在API服务中,图片会转换成token后按token计费,一张图片最多占384tokens,计费价格与V4-Flash模型一致。

多模态API支持Chat Completions、Messages、Responses三种格式调用,可以方便接入各类Agent工具中使用,支持图文混合输入,支持base64内联、外部URL、Files API三种图片传入方式。

Files API现已开放,该API不收费,用户可先将图片上传到平台,再在请求中通过file_id引用,从而节省请求带宽(同一张图片在多个请求中无需重复上传)。