HiDeepSeekDev
空闲特惠
算力与基础设施
MetaStone 称软件优化令 DeepSeek V4.1 Flash 的 PCIe 推理吞吐提升近 7 倍
HiDeepSeekDeveloper Guide
算力与基础设施DeepSeek V4.1 Flash推理优化GPU 算力

MetaStone 称软件优化令 DeepSeek V4.1 Flash 的 PCIe 推理吞吐提升近 7 倍

H
HiDeepSeek 编辑部
核验于 2026/9/25
阅读大约 4 分钟

快速结论

案例说明内核、通信和并行策略优化可能显著影响特定硬件上的推理吞吐;采购与容量规划仍需按自身模型、负载和成本做可复现测试。报道数字来自厂商自测。

  • 报道于 9 月 24 日发布,来源注明为量子位授权转载。
  • MetaStone 称,在一套 8 张 PCIe 卡的环境中,输入吞吐从 1,932 tok/s 提升至 13,274 tok/s。
  • 数字是厂商针对特定环境的自报结果,不是独立评测,也不代表输出速度、延迟、模型能力或其他硬件表现。

本次更新:整理厂商披露的 V4.1 Flash 推理优化案例,标明测试口径和独立验证限制。

核验时间:2026 年 9 月 25 日;原报道日期:9 月 24 日。量子位授权转载的一篇报道介绍了 MetaStone 对 DeepSeek V4.1 Flash 的推理优化。公司称,在一套仅使用 8 张 PCIe 卡的测试环境中,输入吞吐从社区 Day0 基线 1,932 token/s 提升至 5,850 token/s,进一步优化后达到 13,274 token/s,较基线约为 6.87 倍。

一、数字的适用范围

这组数值来自 MetaStone 对其自研 Meta-Infer 软件栈的介绍,属于厂商提供的测试结果,当前没有独立复现依据。它描述的是特定硬件和软件配置下的输入吞吐,不能代表输出 token 速度、端到端延迟、模型质量、功耗或所有 PCIe 服务器的表现,也不意味着模型本身能力提升。

二、为什么软件优化会影响吞吐

推理系统的内核实现、算子融合、通信开销、并行切分、缓存策略和调度都会影响硬件利用率。对于长上下文和高并发工作负载,系统优化可能带来显著差异;但单一吞吐指标不足以说明线上体验或单位成本一定更好。

三、团队如何复核这类数据

在采购或容量规划前,应要求供应方披露输入与输出长度、并发和批大小、量化精度、软件版本、功耗、显存占用及完整测试脚本,并在相同请求集上记录首 token 延迟、端到端延迟、输出吞吐、质量和每百万 token 成本。厂商结果适合作为测试线索,不能替代业务负载下的验证。

运营观察:这条消息更值得关注的是“软件栈优化能改变硬件利用率”。如果你的业务考虑 PCIe 加速卡,可先用代表性提示词和并发量做小规模基准,再比较成本与服务质量。

参考资料

以下资料用于支持本文中的版本、价格和接口说明。相关信息可能调整,请以来源页面的现行内容为准。