laya 英文 Checkpoint:ModernBERT-large 421M、实测数据与限制
Hugging Face 上 Laya 默认的英文 checkpoint:ModernBERT-large、4.21 亿参数、512 token 上下文,附实测速度与准确率、校准情况,以及不适用的场景。
最后更新: 2026/9/24
convaiinnovations/laya 是 Laya 家族默认的英文 checkpoint,也是该家族 Hugging Face 仓库的根目录。
| Hugging Face | convaiinnovations/laya |
| Encoder | ModernBERT-large |
| 参数量 | 421M |
| 默认上下文 | 512 token(题目和选项占 192,state 约 320) |
| 下载体积 | 约 808 MB |
| 语言 | 英文 |
| 许可证 | Apache 2.0 |
资料来源:模型卡 与 上游 README。除特别说明外,以下数据均为上游实测。
加载方式
import laya
agent = laya.load("convaiinnovations/laya")
result = agent.predict(state, questions)
也可以交给 Router,英文输入会被自动送到这里:
from laya import Router
router = Router(preload=True)
result = router.predict(state, questions) # 英文文本 -> "english" checkpoint
实测表现
速度(Tesla T4): 1 个问题 39.5 ms,5 个 84.5 ms,10 个 158.6 ms(每题 15.9 ms),50 个 771 ms。
英文任务:
| 任务 | 准确率 | 备注 |
|---|---|---|
| AG News | 0.947 | 在训练数据中 |
| BoolQ | 0.830 | 在训练数据中 |
| XNLI(英文) | 0.860 | |
| MASSIVE intent(英文,20 个选项) | 0.783 | |
| DAIR Emotion | 0.573 | 留出集 |
| prompt-injections | 0.698 | 留出集,n=116 |
| SST-5(ordinal) | 0.372 | 留出集 |
typed-decisions benchmark(zero-shot): 0.362——高于 0.318 的随机基线,但低于 0.461 的多数类基线。这个 benchmark 上的高分属于微调过的 laya-typed-decisions。
不适用的场景
- 非英文内容。 在 51 种语言上,这个 checkpoint 的 MASSIVE intent 宏平均只有 0.227,只有 23/51 种语言超过随机的 3 倍。高棉语上是 0.000 准确率、0.952 置信度——错的时候依然很自信,所以靠置信度门控拦不住。中文等非英文文本请交给 laya-multilingual。
- 大标签集。 head 预算只有 192 token,77 个选项的题目每个标签只能分到几个 token(Banking77:0.425)。单个
choice题控制在约 20 个选项以内,或调大head_max_len,或使用predict_shortlist。 - 未经验证就用
noul做敏感决策。 上游记录了在这个 checkpoint 上,noul可能跟着false:/true:标签走而不是看 state(#156)。请在自己的数据上验证,或者使用labels覆盖,或改成两个中性 key 的choice题。
校准
这个 checkpoint 发布时偏过度自信。在留出数据上为每个(题型, 选项数)重新拟合温度后,平均 ECE 从 0.466 降到 0.081。详见 Laya 微调教程。
家族对比
| Checkpoint | Encoder | 参数量 | 上下文 | 适用场景 |
|---|---|---|---|---|
| laya | ModernBERT-large | 421M | 512 | 英文 |
| laya-multilingual | mmBERT-base | 322M | 1024 | 100+ 种语言 |
| laya-typed-decisions | ModernBERT-large | 421M | 1024 | 四类 typed-decisions 工作流 |
返回 模型总览。
最后核实:2026 年 9 月 24 日。