laya 英文 Checkpoint:ModernBERT-large 421M、实测数据与限制

Hugging Face 上 Laya 默认的英文 checkpoint:ModernBERT-large、4.21 亿参数、512 token 上下文,附实测速度与准确率、校准情况,以及不适用的场景。

最后更新: 2026/9/24

convaiinnovations/laya 是 Laya 家族默认的英文 checkpoint,也是该家族 Hugging Face 仓库的根目录。

Hugging Faceconvaiinnovations/laya
EncoderModernBERT-large
参数量421M
默认上下文512 token(题目和选项占 192,state 约 320)
下载体积约 808 MB
语言英文
许可证Apache 2.0

资料来源:模型卡上游 README。除特别说明外,以下数据均为上游实测。

加载方式

import laya

agent = laya.load("convaiinnovations/laya")
result = agent.predict(state, questions)

也可以交给 Router,英文输入会被自动送到这里:

from laya import Router

router = Router(preload=True)
result = router.predict(state, questions)   # 英文文本 -> "english" checkpoint

实测表现

速度(Tesla T4): 1 个问题 39.5 ms,5 个 84.5 ms,10 个 158.6 ms(每题 15.9 ms),50 个 771 ms。

英文任务:

任务准确率备注
AG News0.947在训练数据中
BoolQ0.830在训练数据中
XNLI(英文)0.860
MASSIVE intent(英文,20 个选项)0.783
DAIR Emotion0.573留出集
prompt-injections0.698留出集,n=116
SST-5(ordinal)0.372留出集

typed-decisions benchmark(zero-shot): 0.362——高于 0.318 的随机基线,但低于 0.461 的多数类基线。这个 benchmark 上的高分属于微调过的 laya-typed-decisions

不适用的场景

  • 非英文内容。 在 51 种语言上,这个 checkpoint 的 MASSIVE intent 宏平均只有 0.227,只有 23/51 种语言超过随机的 3 倍。高棉语上是 0.000 准确率、0.952 置信度——错的时候依然很自信,所以靠置信度门控拦不住。中文等非英文文本请交给 laya-multilingual
  • 大标签集。 head 预算只有 192 token,77 个选项的题目每个标签只能分到几个 token(Banking77:0.425)。单个 choice 题控制在约 20 个选项以内,或调大 head_max_len,或使用 predict_shortlist
  • 未经验证就用 noul 做敏感决策。 上游记录了在这个 checkpoint 上,noul 可能跟着 false: / true: 标签走而不是看 state(#156)。请在自己的数据上验证,或者使用 labels 覆盖,或改成两个中性 key 的 choice 题。

校准

这个 checkpoint 发布时偏过度自信。在留出数据上为每个(题型, 选项数)重新拟合温度后,平均 ECE 从 0.466 降到 0.081。详见 Laya 微调教程

家族对比

CheckpointEncoder参数量上下文适用场景
layaModernBERT-large421M512英文
laya-multilingualmmBERT-base322M1024100+ 种语言
laya-typed-decisionsModernBERT-large421M1024四类 typed-decisions 工作流

返回 模型总览

最后核实:2026 年 9 月 24 日。