快速结论
Clef 不是用来替代通用对话模型的聊天助手,而是给 Agent 工作流补上结构化决策步骤:输入上下文与问题,输出类型明确的分类或概率。Cloudflare 称模型可处理图像、上下文长度为 64K Token,并报告 Clef-flash 中位延迟约 39 毫秒;团队仍应按自己的分类质量、误路由成本和部署路径实测。
- Cloudflare 于 2026 年 10 月 1 日发布 Clef 和 Clef-flash,托管于 Workers AI。
- Cloudflare 将其定位为有限结构化输出决策模型,并称具备视觉编码器、64K 上下文。
- 权重以 Apache 2.0 许可开源;Cloudflare 同时公布用于定制 Clef 的强化学习微调产品。
- 基准表和延迟结果由 Cloudflare 公布,适合形成测试假设,不能视为独立第三方排名。
本次更新:依据 Cloudflare 官方博客和 Workers AI 文档整理决策模型用途、开放许可、评测数据来源及适用场景。
发布日:2026 年 10 月 1 日;核验时间:10 月 2 日。Cloudflare 发布 Clef 与 Clef-flash 两款决策模型,并介绍配套的强化学习微调产品。模型旨在为 Agent 增加较轻量的结构化判断步骤,例如将工单分配到团队、识别紧急程度、选择工具或对风险打分。
一、决策模型做什么
通用大语言模型可以生成开放式文本、计划和工具调用;决策模型则围绕预先定义的问题返回类型明确的答案与置信度。运营系统可以用这些结果路由任务、触发升级或交给人工,而不必先从长篇自然语言回复中解析一个类别。
Cloudflare 称 Clef 支持视觉输入和 64K 上下文,Clef-flash 侧重速度。官方公布的评测中 Clef-flash 中位延迟约 39 毫秒,Clef 约 209 毫秒;这些数字来自 Cloudflare 自行开展的基准测试,不保证其他硬件、网络与输入分布下的结果。
二、开源和托管选择
模型已托管在 Workers AI,Cloudflare 同时以 Apache 2.0 许可开放模型权重,允许团队自行实验和部署。公司还推出强化学习微调方案,用于让模型适应特定业务判断。选择托管或自部署时,应核对输入数据路径、GPU/推理成本、版本管理和更新责任。
三、哪些业务值得试
- 客服工单:判断紧急程度、产品线和是否需要人工升级。
- 安全运营:对域名、告警或事件摘要做多标签分类与队列分派。
- Agent 编排:根据任务状态决定调用哪个工具、是否补充信息或停止执行。
在高影响流程中,模型输出应被视作决策信号而非最终授权。建议为置信度低、结果冲突和高成本操作设置人工复核;把漏报、误报、延迟、人工改判率和每千次任务成本纳入同一份评测。
四、如何读 Cloudflare 的比较数据
Cloudflare 在公告中比较 Clef 与其他决策模型及通用模型,并分享内部域名分类工作流的速度数据。这些材料说明厂商希望模型承担 Agent 的热路径分类环节,但并非独立审计。不同基准集、提示模板、输出 schema 和硬件会影响排名与时延,选型应先对齐自己的标签和误判代价。
运营判断:决策模型适合作为成熟流程中的小型分类和路由节点。若团队已有稳定标签、处置规则和人工复核机制,Clef 可以进入离线回放和影子测试;没有评测集时,先补数据再上线自动动作。
参考资料
本文依据以下资料整理,版本与接口信息请以来源页面的现行说明为准。