HiDeepSeekDev
空闲特惠
3FS · RDMA + NVMEHiDeepSeek / Open Infra

$ compute ⇄ shared storage

AI DATA INFRAOPEN SOURCE
教程指南3FS分布式存储AI Infra

DeepSeek 3FS 是什么:为大模型训练与推理设计的分布式文件系统

H
HiDeepSeek 编辑部
阅读大约 10 分钟

3FS 的全称是 Fire-Flyer File System,是面向 AI 训练与推理负载的高性能分布式文件系统。它使用现代 NVMe SSD 和 RDMA 网络,把多台存储节点聚合成共享存储层,让计算节点无需关心数据具体位于哪块盘。

一、AI 集群的存储压力来自哪里

  • 数据准备会产生大量中间文件和目录元数据操作。
  • 训练 DataLoader 需要多节点并发、随机读取海量样本。
  • 大模型 checkpoint 体积巨大,保存过慢会拉低训练利用率。
  • 推理侧的 KV Cache 可能需要比 GPU 显存更大、更便宜的容量层。

二、3FS 的设计重点

3FS 采用计算与存储解耦架构,通过 RDMA 使用远端 SSD;元数据服务是无状态的,后端依赖事务型键值存储;数据复制采用 CRAQ 方案以提供强一致性。对应用仍提供熟悉的文件接口,并支持 FUSE 和原生客户端。

三、官方性能数字该怎么看

官方仓库展示了大规模集群的聚合读取、GraySort 和 KV Cache 测试。这些结果证明架构的扩展潜力,但测试使用了大量存储节点、NVMe SSD 与高速 InfiniBand。评估自己的环境时,应先按单节点、单客户端、多客户端三个层次逐步测量,而不是按节点数线性外推。

四、部署门槛比普通文件服务高

git clone https://github.com/deepseek-ai/3fs
cd 3fs
git submodule update --init --recursive
./patches/apply.sh

正式部署涉及 RDMA/RoCE、FoundationDB、ClickHouse、元数据服务、管理服务、存储服务和客户端。官方 Setup Guide 示例本身就是六节点配置,因此它更适合有专职存储与网络工程能力的团队。

五、PoC 应该验证什么

  1. 真实数据集下的随机读吞吐和训练 GPU 等待时间。
  2. 并发 checkpoint 对前台训练读取的影响。
  3. 节点、SSD、网卡故障时的恢复与尾延迟。
  4. 监控、容量规划、升级兼容性和日常运维成本。
3FS 是把高速网络和 SSD 组织成 AI 数据底座的系统工程。它的吸引力来自规模化能力,而不是低门槛。

参考资料

本文按下列官方资料核验。模型能力、价格与接口可能调整,请以最新文档为准。