HiDeepSeekDev
高峰时段
V4 FLASH · VISION EXPHiDeepSeek / Open Infra

$ text + image → agent action

MULTIMODAL APIOPEN SOURCE
资讯追踪DeepSeek V4Vision多模态 API

DeepSeek V4 Flash Vision 实验模型上线:API、Files 与多模态 Agent 要点

H
HiDeepSeek 编辑部
阅读大约 7 分钟

DeepSeek 于 2026 年 8 月 21 日在 API 平台上线 deepseek-v4-flash-vision-exp。它是实验性多模态视觉理解模型,官方称其纯文本能力与 V4 Flash 相当,并面向包含截图、图表和视觉环境的 Agent 任务扩展输入能力。

一、接口支持范围

官方发布说明列出 Chat Completions、Messages 与 Responses 三种接口。图片可以通过外部 URL、Base64 或 Files API 传入。若同一图片会被多次使用,先上传再以 file_id 引用,可以减少重复传输。

const response = await client.responses.create({
  model: 'deepseek-v4-flash-vision-exp',
  input: [
    {
      role: 'user',
      content: [
        { type: 'input_text', text: '指出截图中的错误状态。' },
        { type: 'input_image', image_url: 'https://example.com/screen.png' },
      ],
    },
  ],
});

二、图片同样计入成本

官方说明图片会被 Token 化计费,每张最多按 384 Token 计算,并沿用 V4 Flash 的价格。业务评估不能只统计文本 Token,还要记录每个请求的图片数、尺寸、重复率和 Files API 复用情况。

三、最适合验证的场景

  • 网页或桌面截图理解与操作建议。
  • 图表、仪表盘和错误状态诊断。
  • 带视觉输入的代码 Agent 与自动化任务。
  • 图片和文本共同约束的检索、审核流程。

四、实验模型的生产边界

Exp 表示实验版本。上线前应测试图片格式、超时、错误码、视觉幻觉、文字识别和模型升级后的输出漂移。对合同、财务、医疗和真实操作指令,仍需人工确认或规则校验。

五、评测时不要混淆文本与视觉增益

比较 V4 Flash 与 Vision Exp 时,应把纯文本任务和必须看图的任务分开。官方部分 Agent 基准使用 DeepSeek Harness minimal 模式与指定采样设置,复现数字时必须保留 Harness、effort、temperature 和 top-p。

Vision Exp 的意义不是给每个请求都附一张图,而是让 Agent 在确实需要视觉证据时拥有新的输入通道。

参考资料

本文按下列官方资料核验。模型能力、价格与接口可能调整,请以最新文档为准。