V4 FLASH · VISION EXPHiDeepSeek / Open Infra
$ text + image → agent action
MULTIMODAL APIOPEN SOURCE
资讯追踪DeepSeek V4Vision多模态 API
DeepSeek V4 Flash Vision 实验模型上线:API、Files 与多模态 Agent 要点
H
HiDeepSeek 编辑部阅读大约 7 分钟
DeepSeek 于 2026 年 8 月 21 日在 API 平台上线 deepseek-v4-flash-vision-exp。它是实验性多模态视觉理解模型,官方称其纯文本能力与 V4 Flash 相当,并面向包含截图、图表和视觉环境的 Agent 任务扩展输入能力。
一、接口支持范围
官方发布说明列出 Chat Completions、Messages 与 Responses 三种接口。图片可以通过外部 URL、Base64 或 Files API 传入。若同一图片会被多次使用,先上传再以 file_id 引用,可以减少重复传输。
const response = await client.responses.create({
model: 'deepseek-v4-flash-vision-exp',
input: [
{
role: 'user',
content: [
{ type: 'input_text', text: '指出截图中的错误状态。' },
{ type: 'input_image', image_url: 'https://example.com/screen.png' },
],
},
],
});
二、图片同样计入成本
官方说明图片会被 Token 化计费,每张最多按 384 Token 计算,并沿用 V4 Flash 的价格。业务评估不能只统计文本 Token,还要记录每个请求的图片数、尺寸、重复率和 Files API 复用情况。
三、最适合验证的场景
- 网页或桌面截图理解与操作建议。
- 图表、仪表盘和错误状态诊断。
- 带视觉输入的代码 Agent 与自动化任务。
- 图片和文本共同约束的检索、审核流程。
四、实验模型的生产边界
Exp 表示实验版本。上线前应测试图片格式、超时、错误码、视觉幻觉、文字识别和模型升级后的输出漂移。对合同、财务、医疗和真实操作指令,仍需人工确认或规则校验。
五、评测时不要混淆文本与视觉增益
比较 V4 Flash 与 Vision Exp 时,应把纯文本任务和必须看图的任务分开。官方部分 Agent 基准使用 DeepSeek Harness minimal 模式与指定采样设置,复现数字时必须保留 Harness、effort、temperature 和 top-p。
Vision Exp 的意义不是给每个请求都附一张图,而是让 Agent 在确实需要视觉证据时拥有新的输入通道。
参考资料
本文按下列官方资料核验。模型能力、价格与接口可能调整,请以最新文档为准。