📄

Cloudflare 开源决策模型 Clef:不写文字,只给概率

2026-10-05 09:44 👁 4 阅读

🏷️ 标签

https://developers.cloudflare.com/changelog/post/2026-10-01-clef-workers-ai/

先说几个判断:

第一,Cloudflare 这次发布的不是又一个聊天模型,而是一类叫“决策模型”的东西。它不生成句子,只针对你给的状态和问题,给每个选项一个概率。

第二,它瞄准的是一个很具体却长期被忽略的场景——低延迟的结构化决策,比如给请求做路由、给工单做分类、给 Agent 加护栏。这些事过去要么写死规则,要么让大模型吐文本再解析,两头都不舒服。

第三,它直接兼容 TypeSafe 的 Jev 接口,权重以 Apache 2.0 开源。这不只是“开源一个模型”,更像是在“决策模型”这条还没完全成形的赛道上抢标准、抢生态。

第四,速度确实快。官方给出的中位数延迟,Clef 约 209 毫秒,更小的 Clef-flash 约 39 毫秒,比同类的 Jev 分别快约 2.5 倍和 13 倍。不过这些数字来自 Cloudflare 自己的基准,实际表现仍取决于你的部署方式和负载。

下面把这些点展开说一说。

一、事件描述

2026 年 10 月 1 日,Cloudflare 在开发者变更日志发布 Clef 与 Clef-flash,称其为 Workers AI 团队训练的首批模型,也是 Cloudflare 第一个开源的“决策模型”(decision models)。官方把这类模型归到“System One”家族,与 TypeSafe 的 Jev 属同一品类。

这里有个命名上的小彩蛋:System One 这个名字借用了认知心理学里“系统一 / 系统二”的说法——系统一快速、直觉、自动化,系统二慢速、理性、费脑力。决策模型想做的,正是把“系统一”式的快速判断变成可调用的模型能力,而不是每次都调动一个会写长文的“系统二”大模型。

下面这张表整理了官方发布里能确认的关键事实:

事项 官方已确认内容 口径说明
发布时间与主体 2026-10-01,Cloudflare Workers AI 团队 来源为官方变更日志
模型定位 首批决策模型,Cloudflare 第一个开源决策模型 归入 System One 家族
开源与许可 权重以 Apache 2.0 发布于 Hugging Face 仓库为 Cloudflare/clef 与 Cloudflare/clef-flash
接口兼容性 与 TypeSafe 的 Jev 直接兼容(drop-in) 现有 Jev 集成改端点和模型名即可切换
上下文窗口 两款均为 64K tokens 官方页面标注
单次请求问题数 最多 64 个类型化问题 官方页面标注

表:Cloudflare Clef 系列官方发布要点(依据 Cloudflare 官方变更日志与定价页整理)

二、决策模型到底和“大模型”有什么不同

我们习惯的大语言模型,是给你一段提示词,它吐出一段文本。你需要从中读出“它到底想让我做什么”。决策模型换了一种思路:你给它一个“状态”(state,比如当前请求的数据、几张图、一段上下文),再给它一组“类型化问题”(questions),它直接给每个允许的答案返回一个概率。

这意味着 Agent 拿到的不是一段需要解析的自由文本,而是一组结构化的选项概率。没有等待推理 token 的过程,输出天然就是可排序、可阈值化、可直接拿去执行的。

用一个表格把两者摆在一起看更清楚:

维度 生成式大模型 Clef 决策模型
输出形态 自由文本 / token 流 每个选项的概率值
典型用法 写文章、答问答、写代码 路由、分类、评分、护栏
解析成本 需要后处理提取意图 输出即结构化结果
延迟预期 通常更高 官方称中位 39–209 毫秒
是否适合热路径 一般要谨慎 设计上可放在请求路径里

表:生成式大模型与决策模型的能力边界对照(依据官方说明整理)

要注意的是,这并不是说决策模型“更好”或“更高级”。它只是更适合一类明确、可枚举、要快的任务。写诗、做规划、写代码这类开放任务,仍然是生成式模型的天下。

三、两个型号,以及一个视觉编码器

Clef 系列目前有两款,参数和定位拉开了档位:

型号 参数量 上下文 定价(每百万输入 token) 中位延迟 P95 延迟
@cf/cloudflare/clef 27B 64K 0.240 美元 209.3 毫秒 238.6 毫秒
@cf/cloudflare/clef-flash 9B 64K 0.090 美元 38.8 毫秒 122.4 毫秒

表:Clef 与 Clef-flash 规格与官方定价(定价来自 Cloudflare Workers AI 定价页,延迟为官方 43 次基准运行的中位数与 P95)

有个容易被忽略的点:Clef(27B 那款)带了一个视觉编码器,可以随状态一起传入最多四张图像,做视觉分类。也就是说它不只是文本决策,还能“看图下判断”。Clef-flash 的页面说明里没有强调视觉能力,定位更偏向延迟敏感的纯文本热路径决策。

价格方面,官方定价页只列出了“每百万输入 token”的单价,没有列出输出 token 单价。这和它的使用方式一致——决策模型的“输出”是几个概率值,计费主要按你喂进去的状态和问题的规模走。对比一下体量:Clef 的输入单价是 Clef-flash 的约 2.7 倍,和两者参数量、精度的落差大致对应。

四、延迟到底差多少:一张对比图

光看数字不够直观,把三款模型在官方基准里的中位数延迟画成条形会更清楚:

图:三款决策模型中位数延迟对比(数据来源:Cloudflare 官方基准,43 次运行的中位数,单位毫秒;条形按真实数值线性映射)

Jev         ████████████████████████████████████████████████  524.1
Clef        ██████████████████████████                         209.3
Clef-flash  ████                                                 38.8

说明:条形长度按各模型中位数延迟的真实数值线性缩放,最长条对应 Jev 的 524.1 毫秒。可以看到 Clef-flash 的延迟条几乎贴着底线,约为 Jev 的十三分之一;Clef 约为 Jev 的 40%。这组数字来自 Cloudflare 自家基准,落到真实业务里请以你自己的压测为准。

官方还给了 P95 延迟:Clef 238.6 毫秒、Clef-flash 122.4 毫秒、Jev 536.0 毫秒。P95 比中位数高,说明长尾请求会明显变慢,但 Clef 系列整体仍明显快于 Jev。快的来源,官方解释是模型跑在 Cloudflare 全球网络的 GPU 上,请求离用户近、网络往返短,可以放在代理的请求路径里实时做决策。

五、输出长什么样:三种问题类型

决策模型不是只回答“是或否”。官方定义了三种类型化问题,单次请求最多可问 64 个:

  • noul(是非型):问一个“是 / 否”问题,返回答案为“是”的概率。比如“这条请求该被拦截吗”。
  • choice(选择型):从你定义的选项集合里选一个,返回所选选项、每个选项的概率,以及一个置信度值。比如“这条工单该分给哪个团队”。
  • score(评分型):按你给定的有序 rubric 评级,返回概率加权后的分数,以及每个级别的概率。比如“这条内容按我们的政策该打几分”。

这三类基本覆盖了“做判断”这件事的主要形态:二分类、多选一、打分排序。对工程来说,最省心的是输出天然结构化——你不用再写正则去抠大模型吐出来的句子,也不用在延迟里等它把理由洋洋洒洒写完。

六、开源与兼容:Cloudflare 在抢什么

把权重以 Apache 2.0 发布到 Hugging Face,并且做到和 TypeSafe 的 Jev “直接兼容、改个端点就能换”,这两步值得玩味。

先看基准。官方称在 10 个决策基准里,Clef 系列在 7 个上拿了最高分;在 TypeSafe 自己的工作流评估里,Clef 在发票处理、客户服务、安全事件三个领域击败 Jev(四项里赢三项)。这些数字当然是 Cloudflare 自己公布的,是否经第三方独立复现,目前还需要观望。

但兼容 Jev 这件事,战略意味比“跑分”更重。Jev 是 System One 这条赛道里已有的玩家,Clef 选择“接口对齐”,等于告诉已经接了 Jev 的开发者:你几乎不用改代码就能换到我这里,还能顺手拿到开源权重和更低的延迟。这是一种用兼容性换生态的打法——先把“决策模型该怎么调用”的事实标准往自己这边拉。

七、能用在哪里:几个真实场景

官方列了几个落地场景,挑几个说:

  • 工单分诊(support triage):判断工单紧急程度并分给对应团队,无需人工介入。
  • 威胁情报(threat intelligence):给网站做分类。配合 Browser Run,Clef 抓取、渲染并分类一个域名只要约 2.2 秒;同一工作流里 gpt-oss-120b 需要约 4.7 秒。
  • 信任与安全(trust and safety):按你自定义的政策 rubric 给内容打分,再按概率决定是否执行动作。
  • Agent 护栏(agent guardrails):在 Agent 调用工具之前,用几十毫秒判断“这一步该不该做”,把风险挡在动作发生前。
  • 视觉分类(visual classification):随状态传入最多四张图像做分类,靠的就是 Clef 的视觉编码器。

这些场景有个共同点:决策要在“请求的路上”实时发生,且结果必须结构化、可被执行。这恰好是写死规则会僵化、调用大模型会太慢的中间地带。

八、结语

Cloudflare 把 Clef 和 Clef-flash 摆上 Workers AI,本质上是把“做决策”从大模型的附庸里拎出来,做成一个独立的模型品类。它会读状态、问类型化问题、吐概率,不写句子,不跟你绕弯子。27B 的 Clef 求精度,9B 的 Clef-flash 求速度;权重 Apache 2.0 开源,接口对齐 Jev,延迟按官方基准比 Jev 快 2.5 到 13 倍。

值得冷静看待的是:所有跑分和延迟都来自 Cloudflare 自己的基准,是否经独立复现仍需时间检验;决策模型也不是要替掉生成式大模型,它只是补齐了“快速、结构化、可枚举判断”这块拼图。对开发者而言,真正有意思的不是“又一个模型”,而是“决策”开始被当作一种可调用、可开源、可标准化的基础设施原语——这件事,可能比单次发布的参数更值得盯着看。