3FS · RDMA + NVMEHiDeepSeek / Open Infra
$ compute ⇄ shared storage
AI DATA INFRAOPEN SOURCE
教程指南3FS分布式存储AI Infra
DeepSeek 3FS 是什么:为大模型训练与推理设计的分布式文件系统
H
HiDeepSeek 编辑部阅读大约 10 分钟
3FS 的全称是 Fire-Flyer File System,是面向 AI 训练与推理负载的高性能分布式文件系统。它使用现代 NVMe SSD 和 RDMA 网络,把多台存储节点聚合成共享存储层,让计算节点无需关心数据具体位于哪块盘。
一、AI 集群的存储压力来自哪里
- 数据准备会产生大量中间文件和目录元数据操作。
- 训练 DataLoader 需要多节点并发、随机读取海量样本。
- 大模型 checkpoint 体积巨大,保存过慢会拉低训练利用率。
- 推理侧的 KV Cache 可能需要比 GPU 显存更大、更便宜的容量层。
二、3FS 的设计重点
3FS 采用计算与存储解耦架构,通过 RDMA 使用远端 SSD;元数据服务是无状态的,后端依赖事务型键值存储;数据复制采用 CRAQ 方案以提供强一致性。对应用仍提供熟悉的文件接口,并支持 FUSE 和原生客户端。
三、官方性能数字该怎么看
官方仓库展示了大规模集群的聚合读取、GraySort 和 KV Cache 测试。这些结果证明架构的扩展潜力,但测试使用了大量存储节点、NVMe SSD 与高速 InfiniBand。评估自己的环境时,应先按单节点、单客户端、多客户端三个层次逐步测量,而不是按节点数线性外推。
四、部署门槛比普通文件服务高
git clone https://github.com/deepseek-ai/3fs
cd 3fs
git submodule update --init --recursive
./patches/apply.sh
正式部署涉及 RDMA/RoCE、FoundationDB、ClickHouse、元数据服务、管理服务、存储服务和客户端。官方 Setup Guide 示例本身就是六节点配置,因此它更适合有专职存储与网络工程能力的团队。
五、PoC 应该验证什么
- 真实数据集下的随机读吞吐和训练 GPU 等待时间。
- 并发 checkpoint 对前台训练读取的影响。
- 节点、SSD、网卡故障时的恢复与尾延迟。
- 监控、容量规划、升级兼容性和日常运维成本。
3FS 是把高速网络和 SSD 组织成 AI 数据底座的系统工程。它的吸引力来自规模化能力,而不是低门槛。
参考资料
本文按下列官方资料核验。模型能力、价格与接口可能调整,请以最新文档为准。