laya-multilingual:支持中文等 100+ 语言的 Laya 多语言模型
Laya 多语言 checkpoint:mmBERT-base、3.22 亿参数、1024 token 上下文,支持中文等 100+ 种语言且比英文模型更快,附实测数据、校准方法与已知限制。
最后更新: 2026/9/24
convaiinnovations/laya-multilingual 是 Laya 用于所有非英文内容(包括中文)的 checkpoint,也是两个通用 checkpoint 中速度更快的那个。
| Hugging Face | convaiinnovations/laya-multilingual |
| Encoder | mmBERT-base(22 层,hidden 768,25.6 万词表) |
| 参数量 | 322M(encoder 307M + 决策头) |
| 默认上下文 | 1,024 token(题目和选项占 256);encoder 最高支持 8,192 |
| 下载体积 | 约 647 MB |
| 语言 | 100+ 种(模型卡列出 51 种评测语言,含中文、日文、韩文、阿拉伯文、印地文) |
| 许可证 | Apache 2.0 |
资料来源:模型卡 与 上游 README。除特别说明外,数据均为上游实测。
加载方式
import laya
agent = laya.load("convaiinnovations/laya-multilingual")
result = agent.predict(
{"body": "同一张发票被扣了两次款,请今天退款。"},
{"department": {"type": "choice",
"instructions": "Which team should handle this?",
"criteria": {"billing": "invoices, payments, refunds",
"technical": "bugs and outages"}}},
)
使用 Router 时,非英文输入会被自动送到这里,路由判断在前向计算之前根据文字脚本和语言完成。如果你的流量大部分不是英文,可以设置 Router(default="multilingual"),让很短、难以判断语言的拉丁字母文本也走这里;也可以用 lang_guess= 传入你自己的语言识别结果。
为什么需要它
在全部 51 种 MASSIVE 语言上(意图分类,20 个选项,随机 = 0.050):
laya(英文) | laya-multilingual | |
|---|---|---|
| 宏平均准确率 | 0.227 | 0.366 |
| 宏平均 ECE(越低越好) | 0.733 | 0.387 |
| 超过随机 3 倍的语言数 | 23 / 51 | 45 / 51 |
| XNLI,14 种非英文语言 | 0.521 | 0.731 |
模型卡给出的分语言例子:阿拉伯语 0.110 → 0.400,印地语 0.100 → 0.387,韩语 0.110 → 0.490,土耳其语 0.140 → 0.437。
速度(Tesla T4)
| 每次调用的问题数 | laya | laya-multilingual |
|---|---|---|
| 1 | 39.5 ms | 32.8 ms |
| 10 | 158.6 ms | 72.3 ms |
| 50 | 771 ms | 337 ms |
上游报告单张 T4 上 batch 吞吐可达每秒 103–332 个问题。
已知限制
- 发布时未校准。 温度全部为 1.0,系统性地过度自信。在留出数据上重新拟合后,平均 ECE 从 0.314 降到 0.106。使用概率之前一定要先做这一步,见 Laya 微调教程。
- 英文比英文 checkpoint 弱(英文测试集宏平均 0.619 vs 0.684)。应该做路由,而不是全部替换。
- 低资源语言表现较弱:斯瓦希里语 0.210、泰米尔语 0.250、阿姆哈拉语 0.110。
score题存在位置偏差:几乎不会选第一个等级,任何语言都是如此(#131)。英文score题请用英文 checkpoint,其他语言先在自己的数据上验证。noul可能低估"true"(#156)。用两个中性 key(A/B)的choice题交叉验证是个好办法。- typed-decisions zero-shot 接近随机(0.342),特定工作流需要微调。
- 单个
choice题控制在约 20 个选项以内。
中文场景怎么用
模型卡的语言列表包含中文(zh),夹带英文品牌名的中日韩文本也会被路由到这里。上游还链接了一个社区做的中文职场决策诊断(飞书风格)。和其他语言一样,上线前请先在自己的中文数据上测准确率和校准。
家族对比
| Checkpoint | Encoder | 参数量 | 上下文 | 适用场景 |
|---|---|---|---|---|
| laya | ModernBERT-large | 421M | 512 | 英文 |
| laya-multilingual | mmBERT-base | 322M | 1024 | 100+ 种语言 |
| laya-typed-decisions | ModernBERT-large | 421M | 1024 | 四类 typed-decisions 工作流 |
返回 模型总览。
最后核实:2026 年 9 月 24 日。