laya-typed-decisions:微调版 Laya Checkpoint(准确率 0.766)

laya-typed-decisions 是什么:用 RLCD 在四类 typed-decisions 工作流上微调的 Laya,0.766 的 benchmark 结果与 Jev 对比、分工作流得分,以及它为什么是专用模型。

最后更新: 2026/9/24

convaiinnovations/laya-typed-decisions 是在 typed-decisions 工作流上微调过的英文 Laya checkpoint。Laya 被引用最多的那个数字——0.766 准确率——就来自它。它是一个专用模型。

Hugging Faceconvaiinnovations/laya-typed-decisions
微调自laya(ModernBERT-large)
参数量421M
默认上下文1,024 token(题目和选项占 256)
语言仅英文
训练数据typed-decisions benchmark 的 1,200 条训练集(6,000 个决策)
许可证Apache 2.0

资料来源:模型卡。除特别说明外,数据均为上游实测。

Benchmark

官方测试集,400 个案例、2,000 个决策:

模型准确率Soft accBrierECEScore MAE
laya-typed-decisions0.7660.4710.0620.2130.242
TypeSafe Jev 1.13.0(公开数据)0.7270.5800.1480.1440.391
教师自一致性上限0.735
ModernBERT-base 专用模型(公开数据)0.646
laya(未微调)0.3620.3320.3160.1750.694
随机猜测0.318

上游特别说明:Jev 的数据是第三方公开数据,不是 Laya 项目自己测的,样本量和 prompt 都不同,对比只能作为参考。

分工作流

工作流准确率
发票处理0.804
安全事件0.766
客户服务0.764
Agent trace 观测0.730

分题型

题型准确率ECEn
noul0.8570.192600
choice0.7330.255600
score0.7230.199800

如何理解 0.766

  • 这是在该 benchmark 自带训练集上微调后的结果,不是基础 Laya 的 zero-shot 准确率。基础 checkpoint 在同一测试集上只有 0.342–0.362。
  • 它在 argmax 准确率、Brier 和 score MAE 上优于 Jev,但在 soft accuracy 和 ECE 上落后于 Jev
  • 它证明 Laya 很适合微调——这正是你应该读一读 微调教程 的原因。

使用方式

import laya

agent = laya.load("convaiinnovations/laya-typed-decisions")
result = agent.predict(state, questions)

或者显式路由到它:

from laya import Router

router = Router()
router.predict(state, questions, model="typed-decisions")

除非用 auto_task_detection=True 构造,Router 不会自动选择这个 checkpoint——它不应该成为悄无声息的默认选项。如果它在热路径上,用 router.preload(["typed-decisions"]) 让它常驻内存。

限制

  • 它是专用模型。 在这四类工作流之外,表现大概率和基础 laya 差不多,甚至更差。
  • 把它的置信度当作未校准。 继承来的 temperature_by_options 会覆盖为它拟合的分题型温度,而这些分题型温度又是在训练样本上拟合的(#186)。设阈值之前请在留出数据上重新拟合。
  • 仅支持英文,其他语言请用 laya-multilingual
  • 单个 choice 题控制在约 20 个选项以内。

家族对比

CheckpointEncoder参数量上下文适用场景
layaModernBERT-large421M512英文
laya-multilingualmmBERT-base322M1024100+ 种语言
laya-typed-decisionsModernBERT-large421M1024四类 typed-decisions 工作流

另见 Laya vs JevBenchmark 追踪

最后核实:2026 年 9 月 24 日。