HiDeepSeekDev
空闲特惠
DEEPSEEK-OCR · VISIONHiDeepSeek / Open Infra

$ document image → Markdown

DOCUMENT INTELLIGENCEOPEN SOURCE
评测对比DeepSeek-OCR文档解析多模态

DeepSeek-OCR 开源项目实战:文档转 Markdown 前先了解这五件事

H
HiDeepSeek 编辑部
阅读大约 9 分钟

DeepSeek-OCR 的目标不只是识别图片里的文字。第一代项目把文档图像视为对长文本的二维光学压缩;DeepSeek-OCR 2 又引入 Visual Causal Flow,让视觉编码更关注复杂文档中的阅读顺序。它因此同时吸引了 OCR、RAG 和长上下文研究者。

一、先判断你的文档难点

纯文本扫描件、双栏论文、表格、公式、票据和带图注的报告是不同任务。模型在普通文字上的观感很好,不代表它能可靠恢复跨页表格或公式语义。选型前应建立自己的文档类型清单。

二、第一代与 OCR 2 的关注点不同

  • DeepSeek-OCR:强调 Contexts Optical Compression,探索用视觉 Token 表示更长文本上下文。
  • DeepSeek-OCR 2:通过 Visual Causal Flow 改进复杂布局中的视觉阅读顺序。

如果业务主要是规整页面,升级不应只看新版本名称;如果错序、跨栏和版面结构是主要错误来源,OCR 2 的设计更值得优先验证。

三、官方环境不是轻量桌面应用

git clone https://github.com/deepseek-ai/DeepSeek-OCR.git
conda create -n deepseek-ocr python=3.12.9 -y
conda activate deepseek-ocr

第一代仓库给出的参考环境包含 CUDA 11.8、PyTorch 2.6、特定 vLLM wheel 与 FlashAttention。部署前要核对 GPU、驱动和依赖版本;社区转换版本可以降低门槛,但输出一致性与许可证仍需单独验证。

四、文档转 Markdown 不能只看字符正确率

  1. 文字:字符错误率、漏字与幻觉。
  2. 顺序:多栏、脚注、图注是否按人类阅读顺序输出。
  3. 结构:标题层级、列表、表格、公式是否可解析。
  4. 效率:每页延迟、显存、视觉 Token 和失败重试率。
  5. 可追溯性:输出能否映射回原页或区域,便于人工复核。

五、生产链路仍需要护栏

建议保留原始文件与页码,为低置信度页面进入人工队列,对表格和金额做规则校验,并在进入 RAG 前去除页眉页脚与重复内容。涉及合同、财务或医疗文档时,不能把模型输出直接视为原文。

DeepSeek-OCR 最有价值的评估单位不是一张漂亮 Demo,而是一批真实文档经过解析、校验和检索后的端到端可用率。

参考资料

本文按下列官方资料核验。模型能力、价格与接口可能调整,请以最新文档为准。