Laya vs Kev:开放权重、准确率、速度与取舍

对比 Laya vs Kev 的架构、开放权重、自托管、准确率、校准、延迟、微调与选型建议。

最后更新: 2026/9/29

Laya 和 Kev 都是开放权重、可自托管的 System One 模型,但走的是两条不同路线:Laya 是带决策头的小型编码器,Kev 则是一系列微调过的解码器大模型(基于 Qwen),参数量从 0.8B 到 27B 不等。本文从架构、准确率、校准、延迟和硬件成本几个方面对比两者,每个数字都标注了来源。

快速对比

LayaKev
出品方ConvAI InnovationsJared Palmer
架构编码器(ModernBERT、mmBERT)+ 决策头微调解码器大模型(Qwen3.5 / Qwen3.8)
权重开放开放
许可证Apache 2.0Apache 2.0
尺寸322M / 421M0.8B、4B、9B、27B
部署方式本地 / 自托管本地 / 自托管
Jev 兼容 API支持,通过 laya-serve支持,POST /v1/systemone
微调官方 RLCD 流程官方训练脚本,--init_from 已发布的 checkpoint
类型化原语choice、score、noulchoice、score、noul
CPU 推理支持,见 Laya 在 CPU 上多快不是目标场景,Mac 上要数百毫秒

我们的实测:Laya vs Kev-0.8B

Kev 发布了四个尺寸;我们自己的 System One 基准测试只测了最小的 Kev-0.8B,和 Laya 用同样的问题、同样的样本对比,都没有微调:

测试Kev-0.8BLaya(英文版)Laya(多语言版)Jev 1.13
SST-2 情感判断,2 个标签0.9200.9200.8570.963
TREC 问题分类,6 个标签0.953 †0.7730.8600.927
Banking77 意图,77 个标签0.823 †0.3630.3670.813
MASSIVE,7 种非英文语言平均0.6560.3070.5440.872
校准误差(ECE),SST-20.0320.0150.1010.020
校准误差(ECE),Banking770.1280.5060.4390.083
单次请求延迟中位数(本地,Apple M5 Pro)22.6–68.9 ms18.5–54.2 ms10.9–24.5 ms约 410 ms(托管)

† Kev 的模型卡说明训练数据里包含 Banking77、TREC 和 SST-5(和 SST-2 是同一批句子);我们测的是留出的测试集和验证集,但 Kev 已经见过这类文本和这些标签集合。完整方法和每一条原始预测见 System One 基准测试。

这说明:

  • Kev-0.8B 是我们测过的英文分类任务里最强的开源模型,在 TREC 和 Banking77 上都领先 Laya——不过上面提到的训练数据重叠意味着这个优势有一部分是在 Kev 自己的主场上取得的。
  • 在非英文输入上 Kev-0.8B 也超过了 Laya 多语言版(0.656 对 0.544),尽管 Kev 的模型卡并没有说明支持多语言,而 Laya 明确发布了面向 100+ 种语言的专用 checkpoint。
  • Laya 本地更快、在大标签集上校准更好。Laya 多语言版单次回答只要 11–25 毫秒,Kev-0.8B 要 23–69 毫秒;在 Banking77 的 77 个标签上,Kev 的校准误差远低于 Laya(0.128 对 0.439–0.506),意味着标签越多,Kev 给出的概率越值得信任。
  • 在简单的两标签情感判断上,Laya 英文版和 Kev-0.8B 打成平手(都是 0.920)。

0.8B 之外:更大的 Kev checkpoint 表现如何

我们的基准测试只覆盖了 Kev-0.8B。Kev 项目自己公布了更大 checkpoint 对比 Jev 的数据,测试题目在训练时被留出:

模型准确率(开发集 / 测试集)Brier 分数(越低越好)
Kev-0.8B0.648 / 0.6970.481 / 0.416
Kev-4B0.817 / 0.8380.269 / 0.242
Kev-9B0.822 / 0.8520.286 / 0.237
Kev-27B0.848 / 0.8960.236 / 0.164
Jev(托管)0.857 / –0.211 / –

来源:Kev 模型卡。这是 Kev 自己的测试结果,题目集和上面我们的基准测试不同,两张表不能直接混用。规律符合预期:Kev 的 checkpoint 越大,和 Jev 的差距越小,但需要的硬件也大得多(见下文)。Kev 在知识密集型问题上也偏弱:Kev-9B 在 MMLU 上得分 0.74,Jev 是 0.90,因为 Kev 只能根据你给的文本做判断,而 Jev 能调用更多通用知识。

硬件:小型编码器 vs 解码器大模型

Laya 的两个 checkpoint(322M、421M)在 CPU 上就能舒服地跑。Kev 的尺寸范围更宽,对硬件的最低要求也更高:

LayaKev
最小322M(多语言版),约 1.3 GB 内存0.8B,需要 Apple Silicon Mac 或 NVIDIA L4
纯 CPU可以,见 Laya 运行要求不是目标场景
最大421M27B,需要 80 GB 级别的 GPU(H100、H200 或 B200)
Mac 支持全部 checkpoint仅 Kev-0.8B;27B 完全没有 Mac 方案

如果你需要最小的体积或者纯 CPU 部署,两者里只有 Laya 能满足。如果你能拿出一块 GPU、想要更接近 Jev 的准确率,更大的 Kev checkpoint 是更直接的路径。

微调

两个项目都建议你针对自己的业务微调,而不是依赖 zero-shot 的准确率:

  • Laya 提供一个可以在 Kaggle 免费 2×T4 上跑的 RLCD Notebook;官方 benchmark 显示微调后的 laya-typed-decisions checkpoint 在其 typed-decisions benchmark 上从 0.362 提升到 0.766。见微调 Laya。
  • Kev 用 JSONL 数据集训练,通过 --init_from 从已发布的 checkpoint 开始;项目报告说直接从基础模型训练在其评估集上只有 0.33 分,而从已发布的 Kev-4B checkpoint 开始能到 0.84 分。还有一个 kev-finetune agent skill,可以在 Modal 上用大约 1 美元的 H100 时长完成训练。

两者之间怎么切换

两者都提供同样兼容 Jev 的 POST /v1/systemone 接口,大部分客户端代码只需要换个 base URL。但以下几点不会自动适配:

  1. 置信度阈值。Laya 的 answer_confidence 和 Kev 的置信度分数校准方式不同,切换后要用自己的标注数据重新拟合阈值。
  2. 选项数量。Laya 的决策头在一个 choice 问题里,所有选项共享固定的 token 预算(192–256 token);Kev 基于完整大模型,没有同样的限制。
  3. 硬件。从 Laya 换成 0.8B 以上的任何 Kev checkpoint,都意味着要准备一块你现在可能还用不上的 GPU。

该评估哪一个?

以下情况优先看 Laya:

  • 需要纯 CPU 部署或最小的体积;
  • 本地低延迟比多几个百分点的准确率更重要;
  • 想要一个明确支持 100+ 种语言的多语言 checkpoint;
  • 打算在有限的 GPU 预算(2×T4)上微调。

以下情况优先看 Kev:

  • 有 GPU 可用,想要更接近 Jev 的准确率,尤其是英文场景;
  • 问题依赖通用或世界知识(解码器大模型能覆盖到的范围);
  • 想要一整个尺寸家族,随着业务增长在准确率和成本之间取舍。

真要上生产环境,请用你打算部署的具体 Kev 尺寸,在自己有代表性的数据集上和 Laya 对比——上面的表格只覆盖了 Kev-0.8B。

常见问题

Kev 比 Laya 好吗?

要看尺寸和任务。在我们的测试里,最小的 Kev(0.8B)在英文分类和非英文输入上打平或超过了 Laya,而且在选项多的任务上校准明显更好。Laya 本地更快、支持 CPU,多语言 checkpoint 明确覆盖 100+ 种语言。更大的 Kev checkpoint(4B–27B)分数还会更高,接近 Jev,但需要更多 GPU 显存。

Kev 能像 Laya 一样跑在 CPU 上吗?

不太行。Kev 项目面向 GPU 和 Apple Silicon;在 Mac 上回答要数百毫秒,而不是 Laya 的几十毫秒,Kev-27B 需要 80 GB 级别的 GPU,完全没有 Mac 方案。如果纯 CPU 部署很重要,Laya 更合适。

该拿哪个尺寸的 Kev 和 Laya 比?

从 Kev-0.8B 开始,它的体积最接近 Laya,也是我们上面基准测试用的尺寸。如果 GPU 预算充足,Kev-4B 在官方数据里已经比 Jev 接近很多。

还有一个也叫"Kev"的项目吗?

有,而且和这篇讲的 Kev 没有关系。开发者 arjun988 做的 NotJev : Kev 是一个独立的开源项目:一套 TypeScript SDK、服务端和命令行工具,把你已有的大模型(Ollama、vLLM 或任意 OpenAI 兼容 API)包装成 Jev 风格的类型化决策接口。它自己不带任何训练好的模型——用项目自己的话说,"智能取决于你指向哪个模型"——所以它在分类上更接近 AnyJev 这类"训练无关的包装层",而不是本文对比的这个微调过的 Kev 系列。如果不确定一个链接指的是哪个"Kev",检查一下 GitHub 地址就清楚了。

Laya 和 Kev 都免费吗?

是的。两者都是 Apache 2.0 协议,没有按请求收费,只需要承担运行它们的硬件成本。相比之下,TypeSafe 托管的 Jev 是按 token 计费的。

相关阅读

最后核实:2026 年 9 月 29 日。