先说几个判断:
第一,Cloudflare 这次发布的不是又一个聊天模型,而是一类叫“决策模型”的东西。它不生成句子,只针对你给的状态和问题,给每个选项一个概率。
第二,它瞄准的是一个很具体却长期被忽略的场景——低延迟的结构化决策,比如给请求做路由、给工单做分类、给 Agent 加护栏。这些事过去要么写死规则,要么让大模型吐文本再解析,两头都不舒服。
第三,它直接兼容 TypeSafe 的 Jev 接口,权重以 Apache 2.0 开源。这不只是“开源一个模型”,更像是在“决策模型”这条还没完全成形的赛道上抢标准、抢生态。
第四,速度确实快。官方给出的中位数延迟,Clef 约 209 毫秒,更小的 Clef-flash 约 39 毫秒,比同类的 Jev 分别快约 2.5 倍和 13 倍。不过这些数字来自 Cloudflare 自己的基准,实际表现仍取决于你的部署方式和负载。
下面把这些点展开说一说。
一、事件描述
2026 年 10 月 1 日,Cloudflare 在开发者变更日志发布 Clef 与 Clef-flash,称其为 Workers AI 团队训练的首批模型,也是 Cloudflare 第一个开源的“决策模型”(decision models)。官方把这类模型归到“System One”家族,与 TypeSafe 的 Jev 属同一品类。
这里有个命名上的小彩蛋:System One 这个名字借用了认知心理学里“系统一 / 系统二”的说法——系统一快速、直觉、自动化,系统二慢速、理性、费脑力。决策模型想做的,正是把“系统一”式的快速判断变成可调用的模型能力,而不是每次都调动一个会写长文的“系统二”大模型。
下面这张表整理了官方发布里能确认的关键事实:
| 事项 | 官方已确认内容 | 口径说明 |
|---|---|---|
| 发布时间与主体 | 2026-10-01,Cloudflare Workers AI 团队 | 来源为官方变更日志 |
| 模型定位 | 首批决策模型,Cloudflare 第一个开源决策模型 | 归入 System One 家族 |
| 开源与许可 | 权重以 Apache 2.0 发布于 Hugging Face | 仓库为 Cloudflare/clef 与 Cloudflare/clef-flash |
| 接口兼容性 | 与 TypeSafe 的 Jev 直接兼容(drop-in) | 现有 Jev 集成改端点和模型名即可切换 |
| 上下文窗口 | 两款均为 64K tokens | 官方页面标注 |
| 单次请求问题数 | 最多 64 个类型化问题 | 官方页面标注 |
表:Cloudflare Clef 系列官方发布要点(依据 Cloudflare 官方变更日志与定价页整理)
二、决策模型到底和“大模型”有什么不同
我们习惯的大语言模型,是给你一段提示词,它吐出一段文本。你需要从中读出“它到底想让我做什么”。决策模型换了一种思路:你给它一个“状态”(state,比如当前请求的数据、几张图、一段上下文),再给它一组“类型化问题”(questions),它直接给每个允许的答案返回一个概率。
这意味着 Agent 拿到的不是一段需要解析的自由文本,而是一组结构化的选项概率。没有等待推理 token 的过程,输出天然就是可排序、可阈值化、可直接拿去执行的。
用一个表格把两者摆在一起看更清楚:
| 维度 | 生成式大模型 | Clef 决策模型 |
|---|---|---|
| 输出形态 | 自由文本 / token 流 | 每个选项的概率值 |
| 典型用法 | 写文章、答问答、写代码 | 路由、分类、评分、护栏 |
| 解析成本 | 需要后处理提取意图 | 输出即结构化结果 |
| 延迟预期 | 通常更高 | 官方称中位 39–209 毫秒 |
| 是否适合热路径 | 一般要谨慎 | 设计上可放在请求路径里 |
表:生成式大模型与决策模型的能力边界对照(依据官方说明整理)
要注意的是,这并不是说决策模型“更好”或“更高级”。它只是更适合一类明确、可枚举、要快的任务。写诗、做规划、写代码这类开放任务,仍然是生成式模型的天下。
三、两个型号,以及一个视觉编码器
Clef 系列目前有两款,参数和定位拉开了档位:
| 型号 | 参数量 | 上下文 | 定价(每百万输入 token) | 中位延迟 | P95 延迟 |
|---|---|---|---|---|---|
| @cf/cloudflare/clef | 27B | 64K | 0.240 美元 | 209.3 毫秒 | 238.6 毫秒 |
| @cf/cloudflare/clef-flash | 9B | 64K | 0.090 美元 | 38.8 毫秒 | 122.4 毫秒 |
表:Clef 与 Clef-flash 规格与官方定价(定价来自 Cloudflare Workers AI 定价页,延迟为官方 43 次基准运行的中位数与 P95)
有个容易被忽略的点:Clef(27B 那款)带了一个视觉编码器,可以随状态一起传入最多四张图像,做视觉分类。也就是说它不只是文本决策,还能“看图下判断”。Clef-flash 的页面说明里没有强调视觉能力,定位更偏向延迟敏感的纯文本热路径决策。
价格方面,官方定价页只列出了“每百万输入 token”的单价,没有列出输出 token 单价。这和它的使用方式一致——决策模型的“输出”是几个概率值,计费主要按你喂进去的状态和问题的规模走。对比一下体量:Clef 的输入单价是 Clef-flash 的约 2.7 倍,和两者参数量、精度的落差大致对应。
四、延迟到底差多少:一张对比图
光看数字不够直观,把三款模型在官方基准里的中位数延迟画成条形会更清楚:
图:三款决策模型中位数延迟对比(数据来源:Cloudflare 官方基准,43 次运行的中位数,单位毫秒;条形按真实数值线性映射)
Jev ████████████████████████████████████████████████ 524.1
Clef ██████████████████████████ 209.3
Clef-flash ████ 38.8
说明:条形长度按各模型中位数延迟的真实数值线性缩放,最长条对应 Jev 的 524.1 毫秒。可以看到 Clef-flash 的延迟条几乎贴着底线,约为 Jev 的十三分之一;Clef 约为 Jev 的 40%。这组数字来自 Cloudflare 自家基准,落到真实业务里请以你自己的压测为准。
官方还给了 P95 延迟:Clef 238.6 毫秒、Clef-flash 122.4 毫秒、Jev 536.0 毫秒。P95 比中位数高,说明长尾请求会明显变慢,但 Clef 系列整体仍明显快于 Jev。快的来源,官方解释是模型跑在 Cloudflare 全球网络的 GPU 上,请求离用户近、网络往返短,可以放在代理的请求路径里实时做决策。
五、输出长什么样:三种问题类型
决策模型不是只回答“是或否”。官方定义了三种类型化问题,单次请求最多可问 64 个:
- noul(是非型):问一个“是 / 否”问题,返回答案为“是”的概率。比如“这条请求该被拦截吗”。
- choice(选择型):从你定义的选项集合里选一个,返回所选选项、每个选项的概率,以及一个置信度值。比如“这条工单该分给哪个团队”。
- score(评分型):按你给定的有序 rubric 评级,返回概率加权后的分数,以及每个级别的概率。比如“这条内容按我们的政策该打几分”。
这三类基本覆盖了“做判断”这件事的主要形态:二分类、多选一、打分排序。对工程来说,最省心的是输出天然结构化——你不用再写正则去抠大模型吐出来的句子,也不用在延迟里等它把理由洋洋洒洒写完。
六、开源与兼容:Cloudflare 在抢什么
把权重以 Apache 2.0 发布到 Hugging Face,并且做到和 TypeSafe 的 Jev “直接兼容、改个端点就能换”,这两步值得玩味。
先看基准。官方称在 10 个决策基准里,Clef 系列在 7 个上拿了最高分;在 TypeSafe 自己的工作流评估里,Clef 在发票处理、客户服务、安全事件三个领域击败 Jev(四项里赢三项)。这些数字当然是 Cloudflare 自己公布的,是否经第三方独立复现,目前还需要观望。
但兼容 Jev 这件事,战略意味比“跑分”更重。Jev 是 System One 这条赛道里已有的玩家,Clef 选择“接口对齐”,等于告诉已经接了 Jev 的开发者:你几乎不用改代码就能换到我这里,还能顺手拿到开源权重和更低的延迟。这是一种用兼容性换生态的打法——先把“决策模型该怎么调用”的事实标准往自己这边拉。
七、能用在哪里:几个真实场景
官方列了几个落地场景,挑几个说:
- 工单分诊(support triage):判断工单紧急程度并分给对应团队,无需人工介入。
- 威胁情报(threat intelligence):给网站做分类。配合 Browser Run,Clef 抓取、渲染并分类一个域名只要约 2.2 秒;同一工作流里 gpt-oss-120b 需要约 4.7 秒。
- 信任与安全(trust and safety):按你自定义的政策 rubric 给内容打分,再按概率决定是否执行动作。
- Agent 护栏(agent guardrails):在 Agent 调用工具之前,用几十毫秒判断“这一步该不该做”,把风险挡在动作发生前。
- 视觉分类(visual classification):随状态传入最多四张图像做分类,靠的就是 Clef 的视觉编码器。
这些场景有个共同点:决策要在“请求的路上”实时发生,且结果必须结构化、可被执行。这恰好是写死规则会僵化、调用大模型会太慢的中间地带。
八、结语
Cloudflare 把 Clef 和 Clef-flash 摆上 Workers AI,本质上是把“做决策”从大模型的附庸里拎出来,做成一个独立的模型品类。它会读状态、问类型化问题、吐概率,不写句子,不跟你绕弯子。27B 的 Clef 求精度,9B 的 Clef-flash 求速度;权重 Apache 2.0 开源,接口对齐 Jev,延迟按官方基准比 Jev 快 2.5 到 13 倍。
值得冷静看待的是:所有跑分和延迟都来自 Cloudflare 自己的基准,是否经独立复现仍需时间检验;决策模型也不是要替掉生成式大模型,它只是补齐了“快速、结构化、可枚举判断”这块拼图。对开发者而言,真正有意思的不是“又一个模型”,而是“决策”开始被当作一种可调用、可开源、可标准化的基础设施原语——这件事,可能比单次发布的参数更值得盯着看。