laya-typed-decisions:微调版 Laya Checkpoint(准确率 0.766)
laya-typed-decisions 是什么:用 RLCD 在四类 typed-decisions 工作流上微调的 Laya,0.766 的 benchmark 结果与 Jev 对比、分工作流得分,以及它为什么是专用模型。
最后更新: 2026/9/24
convaiinnovations/laya-typed-decisions 是在 typed-decisions 工作流上微调过的英文 Laya checkpoint。Laya 被引用最多的那个数字——0.766 准确率——就来自它。它是一个专用模型。
| Hugging Face | convaiinnovations/laya-typed-decisions |
| 微调自 | laya(ModernBERT-large) |
| 参数量 | 421M |
| 默认上下文 | 1,024 token(题目和选项占 256) |
| 语言 | 仅英文 |
| 训练数据 | typed-decisions benchmark 的 1,200 条训练集(6,000 个决策) |
| 许可证 | Apache 2.0 |
资料来源:模型卡。除特别说明外,数据均为上游实测。
Benchmark
官方测试集,400 个案例、2,000 个决策:
| 模型 | 准确率 | Soft acc | Brier | ECE | Score MAE |
|---|---|---|---|---|---|
| laya-typed-decisions | 0.766 | 0.471 | 0.062 | 0.213 | 0.242 |
| TypeSafe Jev 1.13.0(公开数据) | 0.727 | 0.580 | 0.148 | 0.144 | 0.391 |
| 教师自一致性上限 | 0.735 | ||||
| ModernBERT-base 专用模型(公开数据) | 0.646 | ||||
laya(未微调) | 0.362 | 0.332 | 0.316 | 0.175 | 0.694 |
| 随机猜测 | 0.318 |
上游特别说明:Jev 的数据是第三方公开数据,不是 Laya 项目自己测的,样本量和 prompt 都不同,对比只能作为参考。
分工作流
| 工作流 | 准确率 |
|---|---|
| 发票处理 | 0.804 |
| 安全事件 | 0.766 |
| 客户服务 | 0.764 |
| Agent trace 观测 | 0.730 |
分题型
| 题型 | 准确率 | ECE | n |
|---|---|---|---|
noul | 0.857 | 0.192 | 600 |
choice | 0.733 | 0.255 | 600 |
score | 0.723 | 0.199 | 800 |
如何理解 0.766
- 这是在该 benchmark 自带训练集上微调后的结果,不是基础 Laya 的 zero-shot 准确率。基础 checkpoint 在同一测试集上只有 0.342–0.362。
- 它在 argmax 准确率、Brier 和 score MAE 上优于 Jev,但在 soft accuracy 和 ECE 上落后于 Jev。
- 它证明 Laya 很适合微调——这正是你应该读一读 微调教程 的原因。
使用方式
import laya
agent = laya.load("convaiinnovations/laya-typed-decisions")
result = agent.predict(state, questions)
或者显式路由到它:
from laya import Router
router = Router()
router.predict(state, questions, model="typed-decisions")
除非用 auto_task_detection=True 构造,Router 不会自动选择这个 checkpoint——它不应该成为悄无声息的默认选项。如果它在热路径上,用 router.preload(["typed-decisions"]) 让它常驻内存。
限制
- 它是专用模型。 在这四类工作流之外,表现大概率和基础
laya差不多,甚至更差。 - 把它的置信度当作未校准。 继承来的
temperature_by_options会覆盖为它拟合的分题型温度,而这些分题型温度又是在训练样本上拟合的(#186)。设阈值之前请在留出数据上重新拟合。 - 仅支持英文,其他语言请用 laya-multilingual。
- 单个
choice题控制在约 20 个选项以内。
家族对比
| Checkpoint | Encoder | 参数量 | 上下文 | 适用场景 |
|---|---|---|---|---|
| laya | ModernBERT-large | 421M | 512 | 英文 |
| laya-multilingual | mmBERT-base | 322M | 1024 | 100+ 种语言 |
| laya-typed-decisions | ModernBERT-large | 421M | 1024 | 四类 typed-decisions 工作流 |
另见 Laya vs Jev 与 Benchmark 追踪。
最后核实:2026 年 9 月 24 日。