Laya vs Kev:开放权重、准确率、速度与取舍
对比 Laya vs Kev 的架构、开放权重、自托管、准确率、校准、延迟、微调与选型建议。
Laya 和 Kev 都是开放权重、可自托管的 System One 模型,但走的是两条不同路线:Laya 是带决策头的小型编码器,Kev 则是一系列微调过的解码器大模型(基于 Qwen),参数量从 0.8B 到 27B 不等。本文从架构、准确率、校准、延迟和硬件成本几个方面对比两者,每个数字都标注了来源。
快速对比
| Laya | Kev | |
|---|---|---|
| 出品方 | ConvAI Innovations | Jared Palmer |
| 架构 | 编码器(ModernBERT、mmBERT)+ 决策头 | 微调解码器大模型(Qwen3.5 / Qwen3.8) |
| 权重 | 开放 | 开放 |
| 许可证 | Apache 2.0 | Apache 2.0 |
| 尺寸 | 322M / 421M | 0.8B、4B、9B、27B |
| 部署方式 | 本地 / 自托管 | 本地 / 自托管 |
| Jev 兼容 API | 支持,通过 laya-serve | 支持,POST /v1/systemone |
| 微调 | 官方 RLCD 流程 | 官方训练脚本,--init_from 已发布的 checkpoint |
| 类型化原语 | choice、score、noul | choice、score、noul |
| CPU 推理 | 支持,见 Laya 在 CPU 上多快 | 不是目标场景,Mac 上要数百毫秒 |
我们的实测:Laya vs Kev-0.8B
Kev 发布了四个尺寸;我们自己的 System One 基准测试只测了最小的 Kev-0.8B,和 Laya 用同样的问题、同样的样本对比,都没有微调:
| 测试 | Kev-0.8B | Laya(英文版) | Laya(多语言版) | Jev 1.13 |
|---|---|---|---|---|
| SST-2 情感判断,2 个标签 | 0.920 | 0.920 | 0.857 | 0.963 |
| TREC 问题分类,6 个标签 | 0.953 † | 0.773 | 0.860 | 0.927 |
| Banking77 意图,77 个标签 | 0.823 † | 0.363 | 0.367 | 0.813 |
| MASSIVE,7 种非英文语言平均 | 0.656 | 0.307 | 0.544 | 0.872 |
| 校准误差(ECE),SST-2 | 0.032 | 0.015 | 0.101 | 0.020 |
| 校准误差(ECE),Banking77 | 0.128 | 0.506 | 0.439 | 0.083 |
| 单次请求延迟中位数(本地,Apple M5 Pro) | 22.6–68.9 ms | 18.5–54.2 ms | 10.9–24.5 ms | 约 410 ms(托管) |
† Kev 的模型卡说明训练数据里包含 Banking77、TREC 和 SST-5(和 SST-2 是同一批句子);我们测的是留出的测试集和验证集,但 Kev 已经见过这类文本和这些标签集合。完整方法和每一条原始预测见 System One 基准测试。
这说明:
- Kev-0.8B 是我们测过的英文分类任务里最强的开源模型,在 TREC 和 Banking77 上都领先 Laya——不过上面提到的训练数据重叠意味着这个优势有一部分是在 Kev 自己的主场上取得的。
- 在非英文输入上 Kev-0.8B 也超过了 Laya 多语言版(0.656 对 0.544),尽管 Kev 的模型卡并没有说明支持多语言,而 Laya 明确发布了面向 100+ 种语言的专用 checkpoint。
- Laya 本地更快、在大标签集上校准更好。Laya 多语言版单次回答只要 11–25 毫秒,Kev-0.8B 要 23–69 毫秒;在 Banking77 的 77 个标签上,Kev 的校准误差远低于 Laya(0.128 对 0.439–0.506),意味着标签越多,Kev 给出的概率越值得信任。
- 在简单的两标签情感判断上,Laya 英文版和 Kev-0.8B 打成平手(都是 0.920)。
0.8B 之外:更大的 Kev checkpoint 表现如何
我们的基准测试只覆盖了 Kev-0.8B。Kev 项目自己公布了更大 checkpoint 对比 Jev 的数据,测试题目在训练时被留出:
| 模型 | 准确率(开发集 / 测试集) | Brier 分数(越低越好) |
|---|---|---|
| Kev-0.8B | 0.648 / 0.697 | 0.481 / 0.416 |
| Kev-4B | 0.817 / 0.838 | 0.269 / 0.242 |
| Kev-9B | 0.822 / 0.852 | 0.286 / 0.237 |
| Kev-27B | 0.848 / 0.896 | 0.236 / 0.164 |
| Jev(托管) | 0.857 / – | 0.211 / – |
来源:Kev 模型卡。这是 Kev 自己的测试结果,题目集和上面我们的基准测试不同,两张表不能直接混用。规律符合预期:Kev 的 checkpoint 越大,和 Jev 的差距越小,但需要的硬件也大得多(见下文)。Kev 在知识密集型问题上也偏弱:Kev-9B 在 MMLU 上得分 0.74,Jev 是 0.90,因为 Kev 只能根据你给的文本做判断,而 Jev 能调用更多通用知识。
硬件:小型编码器 vs 解码器大模型
Laya 的两个 checkpoint(322M、421M)在 CPU 上就能舒服地跑。Kev 的尺寸范围更宽,对硬件的最低要求也更高:
| Laya | Kev | |
|---|---|---|
| 最小 | 322M(多语言版),约 1.3 GB 内存 | 0.8B,需要 Apple Silicon Mac 或 NVIDIA L4 |
| 纯 CPU | 可以,见 Laya 运行要求 | 不是目标场景 |
| 最大 | 421M | 27B,需要 80 GB 级别的 GPU(H100、H200 或 B200) |
| Mac 支持 | 全部 checkpoint | 仅 Kev-0.8B;27B 完全没有 Mac 方案 |
如果你需要最小的体积或者纯 CPU 部署,两者里只有 Laya 能满足。如果你能拿出一块 GPU、想要更接近 Jev 的准确率,更大的 Kev checkpoint 是更直接的路径。
微调
两个项目都建议你针对自己的业务微调,而不是依赖 zero-shot 的准确率:
- Laya 提供一个可以在 Kaggle 免费 2×T4 上跑的 RLCD Notebook;官方 benchmark 显示微调后的
laya-typed-decisionscheckpoint 在其 typed-decisions benchmark 上从 0.362 提升到 0.766。见微调 Laya。 - Kev 用 JSONL 数据集训练,通过
--init_from从已发布的 checkpoint 开始;项目报告说直接从基础模型训练在其评估集上只有 0.33 分,而从已发布的 Kev-4B checkpoint 开始能到 0.84 分。还有一个kev-finetuneagent skill,可以在 Modal 上用大约 1 美元的 H100 时长完成训练。
两者之间怎么切换
两者都提供同样兼容 Jev 的 POST /v1/systemone 接口,大部分客户端代码只需要换个 base URL。但以下几点不会自动适配:
- 置信度阈值。Laya 的
answer_confidence和 Kev 的置信度分数校准方式不同,切换后要用自己的标注数据重新拟合阈值。 - 选项数量。Laya 的决策头在一个
choice问题里,所有选项共享固定的 token 预算(192–256 token);Kev 基于完整大模型,没有同样的限制。 - 硬件。从 Laya 换成 0.8B 以上的任何 Kev checkpoint,都意味着要准备一块你现在可能还用不上的 GPU。
该评估哪一个?
以下情况优先看 Laya:
- 需要纯 CPU 部署或最小的体积;
- 本地低延迟比多几个百分点的准确率更重要;
- 想要一个明确支持 100+ 种语言的多语言 checkpoint;
- 打算在有限的 GPU 预算(2×T4)上微调。
以下情况优先看 Kev:
- 有 GPU 可用,想要更接近 Jev 的准确率,尤其是英文场景;
- 问题依赖通用或世界知识(解码器大模型能覆盖到的范围);
- 想要一整个尺寸家族,随着业务增长在准确率和成本之间取舍。
真要上生产环境,请用你打算部署的具体 Kev 尺寸,在自己有代表性的数据集上和 Laya 对比——上面的表格只覆盖了 Kev-0.8B。
常见问题
Kev 比 Laya 好吗?
要看尺寸和任务。在我们的测试里,最小的 Kev(0.8B)在英文分类和非英文输入上打平或超过了 Laya,而且在选项多的任务上校准明显更好。Laya 本地更快、支持 CPU,多语言 checkpoint 明确覆盖 100+ 种语言。更大的 Kev checkpoint(4B–27B)分数还会更高,接近 Jev,但需要更多 GPU 显存。
Kev 能像 Laya 一样跑在 CPU 上吗?
不太行。Kev 项目面向 GPU 和 Apple Silicon;在 Mac 上回答要数百毫秒,而不是 Laya 的几十毫秒,Kev-27B 需要 80 GB 级别的 GPU,完全没有 Mac 方案。如果纯 CPU 部署很重要,Laya 更合适。
该拿哪个尺寸的 Kev 和 Laya 比?
从 Kev-0.8B 开始,它的体积最接近 Laya,也是我们上面基准测试用的尺寸。如果 GPU 预算充足,Kev-4B 在官方数据里已经比 Jev 接近很多。
还有一个也叫"Kev"的项目吗?
有,而且和这篇讲的 Kev 没有关系。开发者 arjun988 做的 NotJev : Kev 是一个独立的开源项目:一套 TypeScript SDK、服务端和命令行工具,把你已有的大模型(Ollama、vLLM 或任意 OpenAI 兼容 API)包装成 Jev 风格的类型化决策接口。它自己不带任何训练好的模型——用项目自己的话说,"智能取决于你指向哪个模型"——所以它在分类上更接近 AnyJev 这类"训练无关的包装层",而不是本文对比的这个微调过的 Kev 系列。如果不确定一个链接指的是哪个"Kev",检查一下 GitHub 地址就清楚了。
Laya 和 Kev 都免费吗?
是的。两者都是 Apache 2.0 协议,没有按请求收费,只需要承担运行它们的硬件成本。相比之下,TypeSafe 托管的 Jev 是按 token 计费的。
相关阅读
- Kev 模型指南:尺寸、部署与微调
- System One 基准测试:Jev、Kev、Laya、Von、GLiNER 用同样的问题实测
- Laya vs Jev:开放权重、速度、准确率与取舍
- System One 模型对比:所有模型放在一起看
- Jev 替代品:可以自托管的开源 System One 模型
最后核实:2026 年 9 月 29 日。