Cloudflare Clef:能读文本、图片和视频的开源 Jev 替代模型
Cloudflare Clef 和 Clef-Flash 是能读文本、图片和视频的开源决策模型。本页汇总基准测试、Workers AI 价格、部署方法,以及和 Jev、Laya 的对比。
Cloudflare Clef 是 Cloudflare 推出的开源决策模型。你给它一段输入(称为 state,可以是文本、JSON、图片或视频)和一组类型化问题,Clef 一次前向计算就返回每个问题每个选项的概率,不生成文字,也不用解析输出。Cloudflare 在 2026 年 10 月 1 日发布了两个版本:Clef(27B)和更快的 Clef-Flash(9B),都以 Apache 2.0 许可开源在 Hugging Face 上,同时上线了 Workers AI。
Clef 和 TypeSafe 的 Jev、开源的 Laya 属于同一类:System One 模型,负责快速、有边界的判断,慢思考交给大模型。Clef 的请求和返回格式沿用 Jev,而且和 Jev、Laya 不同,它除了文本还能读图片和视频。本页汇总 Cloudflare 公布的信息、Clef 的用法,以及它和 Jev、Laya 和同一周发布的其他模型的对比。
Cloudflare Clef 一览
| Clef | Clef-Flash | |
|---|---|---|
| 发布日期 | 2026 年 10 月 1 日 | 2026 年 10 月 1 日 |
| 基础模型 | Qwen3.8-27B | Qwen3.5-9B |
| 参数量 | 27B | 9B |
| 下载大小 | 约 55 GB | 约 19 GB |
| 许可证 | Apache 2.0 | Apache 2.0 |
| 输入 | 文本、JSON、图片、视频 | 文本、JSON、图片、视频 |
| 问题类型 | choice(多选一)、score(打分)、noul(是/否) | 同左 |
| Workers AI 价格 | 每百万 input token $0.24 | 每百万 input token $0.09 |
| Workers AI 限制 | 上下文 65,536 token,每次 1 到 64 个问题,最多 4 张图片 | 同左 |
| 中位延迟 | 209.3 毫秒 | 38.8 毫秒 |
来源:Clef 和 Clef-Flash 模型卡、Workers AI 模型页、Cloudflare 官方博客。延迟是 Cloudflare 在自己的基准测试上测的。
Clef 是怎么工作的
Clef 保留了 Qwen 主干(包括视觉编码器),在后面加了一个小的联合决策头(joint schema head)。它读取主干最后一层的隐藏状态,把输入里的证据分配给每个问题,再把所有问题的所有选项一起打分。输出是每个选项一个 logit,对每个问题做 softmax 就得到概率。
所以 Clef 对同一段输入问多个问题时只需要读一遍,而不是每个问题读一遍。据官方博客介绍,Cloudflare 冻结了主干,只训练决策头和低秩适配器,用交叉熵和 Brier 损失,再加一步叫 RLCD(Reinforcement Learning for Calibrated Decisions,Jev 和 Laya 也用这套训练思路)的强化学习,让概率和实际准确率对得上。
Cloudflare 说,Clef 最初是为自己大量的判断类工作做的,比如内容安全审核、客服工单分流和机器人流量识别。
基准测试:Cloudflare 公布的结果
Cloudflare 自己跑了一遍 Decision Index 测试集(40 多个任务),参测的有 Clef、Clef-Flash、Jev、Kev 9B、Laya 等。部分结果:
| 基准 | Clef | Clef-Flash | Jev | Laya |
|---|---|---|---|---|
| BANKING77(macro-F1) | 94.2 | 90.9 | 79.7 | 14.3 |
| CLINC150 + 范围外意图(macro-F1) | 97.4 | 66.8 | 89.3 | 3.2 |
| BFCL(完全正确率) | 98.5 | 98.8 | 95.8 | 38.1 |
| ContractNLI(macro-F1) | 81.4 | 84.3 | 71.7 | 29.0 |
| RAGTruth(幻觉检测 F1) | 79.4 | 35.6 | 76.5 | 48.8 |
| MMLU(准确率) | 90.3 | 91.8 | 91.7 | 30.7 |
| GPQA Diamond(准确率) | 48.0 | 51.0 | 78.3 | 27.6 |
| BBH(准确率) | 73.7 | 68.9 | 92.9 | 34.1 |
| ForecastBench(Brier,越低越好) | 13.9 | 10.6 | 17.4 | 41.1 |
| 中位延迟(毫秒) | 209.3 | 38.8 | 524.1 | 5.8 |
| p95 延迟(毫秒) | 238.6 | 122.4 | 536.0 | 222.5 |
在 Typesafe Evals 的 4 个端到端业务流程上,Clef 在发票处理(主要动作 86.2 对 83.1)和安全事件(62.9 对 61.7)上超过 Jev,客服略高(76.3 对 76.0),智能体链路观测上落后(68.5 对 71.6)。
怎么看这些数字:
- 都是 Cloudflare 自测的。 所有模型都由 Cloudflare 自己跑,还没有独立复现。
- 难推理题还是 Jev 强。 GPQA Diamond、BBH、MMLU-Pro 上 Jev 都明显领先。
- Clef-Flash 不只是「弱一点的 Clef」。 很多任务上它比 27B 的 Clef 还好,但个别任务会大幅掉分(带范围外意图的 CLINC150、RAGTruth),上线前要用自己的数据测。
- Laya 准确率差得多,速度快得多。 Laya 是 421M 的编码器,MMLU、GPQA 这类需要世界知识的任务本来就不擅长;Cloudflare 也没说明用的是哪个 checkpoint 和什么设置。它 5.8 毫秒的中位延迟是全表最快。所有模型问同样问题、针对日常决策任务的测试,见我们的 System One 基准测试。
怎么用 Cloudflare Clef
在 Workers AI 上调用
Workers AI 上的模型名是 @cf/cloudflare/clef 和 @cf/cloudflare/clef-flash。在 Worker 里:
const response = await env.AI.run('@cf/cloudflare/clef', {
model: 'clef',
state: 'Checkout has been failing for every customer for the last hour.',
questions: {
urgent: { type: 'noul', instructions: 'Is this support request urgent?' },
team: {
type: 'choice',
instructions: 'Which team should handle this request?',
criteria: {
billing: 'Payments, invoices, and refunds',
technical: 'Outages, errors, and configuration',
},
},
severity: {
type: 'score',
instructions: 'How severe is the customer impact?',
criteria: ['No impact', 'Minor', 'Major', 'Critical'],
},
},
});
在其他环境里,用 Cloudflare API token 调 REST 接口:
curl https://api.cloudflare.com/client/v4/accounts/$ACCOUNT_ID/ai/run/@cf/cloudflare/clef-flash \
-H "Authorization: Bearer $CLOUDFLARE_AUTH_TOKEN" \
-d '{"model": "clef-flash", "state": "...", "questions": {"spam": {"type": "noul", "instructions": "Is this message spam?"}}}'
请求体就是 Jev 那套 state + questions,另外可以加 images 列表。接口地址和鉴权是 Cloudflare 的,所以自己拼 Jev 请求体的代码只要换地址和 token;如果用的是 Jev SDK,先确认它能不能指向这个地址。
在自己的 GPU 上运行
权重和推理代码都在 Hugging Face 上。Cloudflare 在单张 H200 上用 torch 2.11、transformers 5.10.2 测试过。systemone 函数接收 Jev 格式的请求、返回 Jev 格式的结果:
import sys
from huggingface_hub import snapshot_download
path = snapshot_download('Cloudflare/clef-flash')
sys.path.insert(0, path)
from joint_schema_model import load_release_model, systemone
model, processor = load_release_model(path, device='cuda')
response = systemone(model, processor, {
'model': 'clef-flash',
'state': '结账页面开始报错,订单都下不了。',
'questions': {
'outage': {'type': 'noul', 'instructions': '是否有服务宕机?'},
},
})
print(response['answers'])
硬件:Clef 的权重约 55 GB,需要一张 80 GB 级别的 GPU,比如 H100 或 H200。Clef-Flash 约 19 GB,至少需要 24 GB 显存的 GPU(按文件大小估算,未计入推理时的额外占用)。两者都不适合用 CPU 跑。如果要在 CPU、笔记本或浏览器里做判断,Laya 大约 3 GB 内存就能运行。
Clef 和 Jev、Laya 以及同期新模型的对比
Clef 发布的这一周很热闹:9 月 30 日到 10 月 1 日,Perplexity 和 AWS 也各自开源了决策模型。
| Cloudflare Clef / Clef-Flash | TypeSafe Jev | Perplexity pplx-decider-v1-27b | AWS Strands Decider 2B | Laya | |
|---|---|---|---|---|---|
| 权重 | 开源,Apache 2.0 | 闭源 | 开源,Apache 2.0 | 开源,Apache 2.0(LoRA 适配器) | 开源,Apache 2.0 |
| 大小 | 27B / 9B | 未公开 | 27B | 2B | 421M / 322M |
| 输入 | 文本、JSON、图片、视频 | 文本 | 文本、图片 | 文本 | 文本、JSON |
| 托管服务 | Workers AI,每百万 input token $0.24 / $0.09 | TypeSafe,每百万 input token $0.042 | Perplexity API | 无 | 托管 Laya API 或自己部署 |
| 自己部署的硬件 | 80 GB / 24 GB 显存 GPU | 不能自己部署 | 权重约需 49 GiB 显存 | 小显存 GPU(2B 底座) | CPU、GPU 或 Apple Silicon |
| Jev 请求格式 | 兼容 | 原版 | 自有 Decider 类 | 未说明 | 兼容,通过 laya-serve |
这一类模型的准确率目前都是各家自测、测试集也不一样。完整列表见 System One 模型汇总。
该选哪个?
- 判断时要看图片或视频(截图、小票、商品图):选 Clef 或 Clef-Flash,Jev 和 Laya 只读文本。
- 业务已经在 Cloudflare 上:Workers AI 上的 Clef-Flash 最省事,不用管 GPU。
- 想要开源权重、接近 Jev 的准确率,而且有大显存 GPU:选 Clef,并和 pplx-decider 在自己的标注数据上对比。
- 要最低延迟和成本,或者根本没有 GPU:选 Laya。它在 CPU 上几毫秒出结果,还能用自己的标注数据微调,在单一任务上能补回不少准确率。
- 要把最难的推理题答对:按 Cloudflare 自己的数据,GPQA、BBH、MMLU-Pro 上仍是 Jev 领先。
常见问题
Cloudflare Clef 开源吗?
开源。Clef 和 Clef-Flash 都以 Apache 2.0 许可发布在 Hugging Face 上,包括权重、联合决策头和推理代码。
Cloudflare Clef 免费吗?
权重可以免费下载、在自己的硬件上运行。在 Workers AI 上按 input token 收费:Clef 每百万 $0.24,Clef-Flash 每百万 $0.09。
Clef 兼容 Jev API 吗?
请求和返回的结构沿用 Jev:一个 state,choice、score、noul 三种问题,返回带概率的答案。但在 Workers AI 上,接口地址和鉴权是 Cloudflare 的,要换的是地址和 token,不只是模型名。
Clef 和 Clef-Flash 有什么区别?
Clef 是 27B,基于 Qwen3.8-27B;Clef-Flash 是 9B,基于 Qwen3.5-9B。Clef-Flash 大约快 5 倍(Cloudflare 测试中位延迟 38.8 毫秒对 209.3 毫秒),在 Workers AI 上也更便宜,很多基准上和 Clef 持平甚至更好,但在少数任务(比如识别范围外意图)上会大幅掉分。
该用 Clef 还是 Laya?
各类任务的准确率、或者图片输入更重要,而且你有大显存 GPU 或用 Workers AI,就选 Clef。需要在普通硬件上几毫秒出结果、不用 GPU 也能把数据留在自己机器上,或者打算用自己的标注数据微调一个小模型,就选 Laya。