Cloudflare Clef:能读文本、图片和视频的开源 Jev 替代模型

Cloudflare Clef 和 Clef-Flash 是能读文本、图片和视频的开源决策模型。本页汇总基准测试、Workers AI 价格、部署方法,以及和 Jev、Laya 的对比。

最后更新: 2026/10/2

Cloudflare Clef 是 Cloudflare 推出的开源决策模型。你给它一段输入(称为 state,可以是文本、JSON、图片或视频)和一组类型化问题,Clef 一次前向计算就返回每个问题每个选项的概率,不生成文字,也不用解析输出。Cloudflare 在 2026 年 10 月 1 日发布了两个版本:Clef(27B)和更快的 Clef-Flash(9B),都以 Apache 2.0 许可开源在 Hugging Face 上,同时上线了 Workers AI。

Clef 和 TypeSafe 的 Jev、开源的 Laya 属于同一类:System One 模型,负责快速、有边界的判断,慢思考交给大模型。Clef 的请求和返回格式沿用 Jev,而且和 Jev、Laya 不同,它除了文本还能读图片和视频。本页汇总 Cloudflare 公布的信息、Clef 的用法,以及它和 Jev、Laya 和同一周发布的其他模型的对比。

Cloudflare Clef 一览

ClefClef-Flash
发布日期2026 年 10 月 1 日2026 年 10 月 1 日
基础模型Qwen3.8-27BQwen3.5-9B
参数量27B9B
下载大小约 55 GB约 19 GB
许可证Apache 2.0Apache 2.0
输入文本、JSON、图片、视频文本、JSON、图片、视频
问题类型choice(多选一)、score(打分)、noul(是/否)同左
Workers AI 价格每百万 input token $0.24每百万 input token $0.09
Workers AI 限制上下文 65,536 token,每次 1 到 64 个问题,最多 4 张图片同左
中位延迟209.3 毫秒38.8 毫秒

来源:Clef 和 Clef-Flash 模型卡、Workers AI 模型页、Cloudflare 官方博客。延迟是 Cloudflare 在自己的基准测试上测的。

Clef 是怎么工作的

Clef 保留了 Qwen 主干(包括视觉编码器),在后面加了一个小的联合决策头(joint schema head)。它读取主干最后一层的隐藏状态,把输入里的证据分配给每个问题,再把所有问题的所有选项一起打分。输出是每个选项一个 logit,对每个问题做 softmax 就得到概率。

所以 Clef 对同一段输入问多个问题时只需要读一遍,而不是每个问题读一遍。据官方博客介绍,Cloudflare 冻结了主干,只训练决策头和低秩适配器,用交叉熵和 Brier 损失,再加一步叫 RLCD(Reinforcement Learning for Calibrated Decisions,Jev 和 Laya 也用这套训练思路)的强化学习,让概率和实际准确率对得上。

Cloudflare 说,Clef 最初是为自己大量的判断类工作做的,比如内容安全审核、客服工单分流和机器人流量识别。

基准测试:Cloudflare 公布的结果

Cloudflare 自己跑了一遍 Decision Index 测试集(40 多个任务),参测的有 Clef、Clef-Flash、Jev、Kev 9B、Laya 等。部分结果:

基准ClefClef-FlashJevLaya
BANKING77(macro-F1)94.290.979.714.3
CLINC150 + 范围外意图(macro-F1)97.466.889.33.2
BFCL(完全正确率)98.598.895.838.1
ContractNLI(macro-F1)81.484.371.729.0
RAGTruth(幻觉检测 F1)79.435.676.548.8
MMLU(准确率)90.391.891.730.7
GPQA Diamond(准确率)48.051.078.327.6
BBH(准确率)73.768.992.934.1
ForecastBench(Brier,越低越好)13.910.617.441.1
中位延迟(毫秒)209.338.8524.15.8
p95 延迟(毫秒)238.6122.4536.0222.5

在 Typesafe Evals 的 4 个端到端业务流程上,Clef 在发票处理(主要动作 86.2 对 83.1)和安全事件(62.9 对 61.7)上超过 Jev,客服略高(76.3 对 76.0),智能体链路观测上落后(68.5 对 71.6)。

怎么看这些数字:

  • 都是 Cloudflare 自测的。 所有模型都由 Cloudflare 自己跑,还没有独立复现。
  • 难推理题还是 Jev 强。 GPQA Diamond、BBH、MMLU-Pro 上 Jev 都明显领先。
  • Clef-Flash 不只是「弱一点的 Clef」。 很多任务上它比 27B 的 Clef 还好,但个别任务会大幅掉分(带范围外意图的 CLINC150、RAGTruth),上线前要用自己的数据测。
  • Laya 准确率差得多,速度快得多。 Laya 是 421M 的编码器,MMLU、GPQA 这类需要世界知识的任务本来就不擅长;Cloudflare 也没说明用的是哪个 checkpoint 和什么设置。它 5.8 毫秒的中位延迟是全表最快。所有模型问同样问题、针对日常决策任务的测试,见我们的 System One 基准测试。

怎么用 Cloudflare Clef

在 Workers AI 上调用

Workers AI 上的模型名是 @cf/cloudflare/clef 和 @cf/cloudflare/clef-flash。在 Worker 里:

const response = await env.AI.run('@cf/cloudflare/clef', {
  model: 'clef',
  state: 'Checkout has been failing for every customer for the last hour.',
  questions: {
    urgent: { type: 'noul', instructions: 'Is this support request urgent?' },
    team: {
      type: 'choice',
      instructions: 'Which team should handle this request?',
      criteria: {
        billing: 'Payments, invoices, and refunds',
        technical: 'Outages, errors, and configuration',
      },
    },
    severity: {
      type: 'score',
      instructions: 'How severe is the customer impact?',
      criteria: ['No impact', 'Minor', 'Major', 'Critical'],
    },
  },
});

在其他环境里,用 Cloudflare API token 调 REST 接口:

curl https://api.cloudflare.com/client/v4/accounts/$ACCOUNT_ID/ai/run/@cf/cloudflare/clef-flash \
  -H "Authorization: Bearer $CLOUDFLARE_AUTH_TOKEN" \
  -d '{"model": "clef-flash", "state": "...", "questions": {"spam": {"type": "noul", "instructions": "Is this message spam?"}}}'

请求体就是 Jev 那套 state + questions,另外可以加 images 列表。接口地址和鉴权是 Cloudflare 的,所以自己拼 Jev 请求体的代码只要换地址和 token;如果用的是 Jev SDK,先确认它能不能指向这个地址。

在自己的 GPU 上运行

权重和推理代码都在 Hugging Face 上。Cloudflare 在单张 H200 上用 torch 2.11、transformers 5.10.2 测试过。systemone 函数接收 Jev 格式的请求、返回 Jev 格式的结果:

import sys
from huggingface_hub import snapshot_download

path = snapshot_download('Cloudflare/clef-flash')
sys.path.insert(0, path)
from joint_schema_model import load_release_model, systemone

model, processor = load_release_model(path, device='cuda')
response = systemone(model, processor, {
    'model': 'clef-flash',
    'state': '结账页面开始报错,订单都下不了。',
    'questions': {
        'outage': {'type': 'noul', 'instructions': '是否有服务宕机?'},
    },
})
print(response['answers'])

硬件:Clef 的权重约 55 GB,需要一张 80 GB 级别的 GPU,比如 H100 或 H200。Clef-Flash 约 19 GB,至少需要 24 GB 显存的 GPU(按文件大小估算,未计入推理时的额外占用)。两者都不适合用 CPU 跑。如果要在 CPU、笔记本或浏览器里做判断,Laya 大约 3 GB 内存就能运行。

Clef 和 Jev、Laya 以及同期新模型的对比

Clef 发布的这一周很热闹:9 月 30 日到 10 月 1 日,Perplexity 和 AWS 也各自开源了决策模型。

Cloudflare Clef / Clef-FlashTypeSafe JevPerplexity pplx-decider-v1-27bAWS Strands Decider 2BLaya
权重开源,Apache 2.0闭源开源,Apache 2.0开源,Apache 2.0(LoRA 适配器)开源,Apache 2.0
大小27B / 9B未公开27B2B421M / 322M
输入文本、JSON、图片、视频文本文本、图片文本文本、JSON
托管服务Workers AI,每百万 input token $0.24 / $0.09TypeSafe,每百万 input token $0.042Perplexity API无托管 Laya API 或自己部署
自己部署的硬件80 GB / 24 GB 显存 GPU不能自己部署权重约需 49 GiB 显存小显存 GPU(2B 底座)CPU、GPU 或 Apple Silicon
Jev 请求格式兼容原版自有 Decider 类未说明兼容,通过 laya-serve

这一类模型的准确率目前都是各家自测、测试集也不一样。完整列表见 System One 模型汇总。

该选哪个?

  • 判断时要看图片或视频(截图、小票、商品图):选 Clef 或 Clef-Flash,Jev 和 Laya 只读文本。
  • 业务已经在 Cloudflare 上:Workers AI 上的 Clef-Flash 最省事,不用管 GPU。
  • 想要开源权重、接近 Jev 的准确率,而且有大显存 GPU:选 Clef,并和 pplx-decider 在自己的标注数据上对比。
  • 要最低延迟和成本,或者根本没有 GPU:选 Laya。它在 CPU 上几毫秒出结果,还能用自己的标注数据微调,在单一任务上能补回不少准确率。
  • 要把最难的推理题答对:按 Cloudflare 自己的数据,GPQA、BBH、MMLU-Pro 上仍是 Jev 领先。

常见问题

Cloudflare Clef 开源吗?

开源。Clef 和 Clef-Flash 都以 Apache 2.0 许可发布在 Hugging Face 上,包括权重、联合决策头和推理代码。

Cloudflare Clef 免费吗?

权重可以免费下载、在自己的硬件上运行。在 Workers AI 上按 input token 收费:Clef 每百万 $0.24,Clef-Flash 每百万 $0.09。

Clef 兼容 Jev API 吗?

请求和返回的结构沿用 Jev:一个 state,choice、score、noul 三种问题,返回带概率的答案。但在 Workers AI 上,接口地址和鉴权是 Cloudflare 的,要换的是地址和 token,不只是模型名。

Clef 和 Clef-Flash 有什么区别?

Clef 是 27B,基于 Qwen3.8-27B;Clef-Flash 是 9B,基于 Qwen3.5-9B。Clef-Flash 大约快 5 倍(Cloudflare 测试中位延迟 38.8 毫秒对 209.3 毫秒),在 Workers AI 上也更便宜,很多基准上和 Clef 持平甚至更好,但在少数任务(比如识别范围外意图)上会大幅掉分。

该用 Clef 还是 Laya?

各类任务的准确率、或者图片输入更重要,而且你有大显存 GPU 或用 Workers AI,就选 Clef。需要在普通硬件上几毫秒出结果、不用 GPU 也能把数据留在自己机器上,或者打算用自己的标注数据微调一个小模型,就选 Laya。