RLCD 是什么?面向校准决策的强化学习详解

RLCD(面向校准决策的强化学习)详解:Jev 和 Laya 如何训练、RLCD 与 RLHF、RLVR 的区别、严格恰当评分规则,以及校准在实际中能保证什么。

最后更新: 2026/9/26

RLCD 是 Reinforcement Learning for Calibrated Decisions 的缩写,意思是"面向校准决策的强化学习"。TypeSafe 的 Jev 和开源的 Laya 这类 System One 决策模型,都是用它训练的。RLCD 不教模型写出人爱看的文字,而是教它给出一个决策,同时附上诚实的概率:经 RLCD 训练的模型说有 80% 把握时,大约八成应该是对的。

本文介绍 RLCD 是什么、和 RLHF、RLVR 有什么区别、在 Laya 的开源实现里怎么运作,以及它在实际使用中能保证什么、不能保证什么。资料来源:提出这个概念的 TypeSafe AI 入门文档,以及记录了 Laya 训练方法的 Laya 模型卡。

RLCD、RLHF 与 RLVR 的区别

TypeSafe 把 RLCD 和塑造了当今大模型的两种后训练方法放在一起比较:

方法全称训练模型去典型产物
RLHF基于人类反馈的强化学习生成人们更喜欢的回答聊天助手
RLVR基于可验证奖励的强化学习得出可以验证的答案,比如数学题推理模型
RLCD面向校准决策的强化学习给出决策和校准过的概率,不生成文字System One 决策模型

TypeSafe 的观点是:RLHF 优化的是"人听着顺耳"。这很适合聊天机器人,但也可能奖励那些听起来很自信的错误;当软件无人值守、直接根据答案行动时,这就成了问题。RLCD 优化的则是"概率与实际相符"。

为什么校准很重要

如果一个模型报出的概率和它实际答对的频率一致,就说它是校准良好的。在大量预测中,给出 0.2 的事情应该大约 20% 发生,给出 0.8 的大约 80% 发生。

校准让概率可以直接被代码使用:

  • 按阈值自动处理:置信度高时自动执行,其余交给人工。
  • 排序比较:按概率给选项、文档或工单排序,并且可以信任这个顺序。
  • 组合多个答案:在自己的逻辑里对多个问题的概率做乘法或加权。

光看准确率做不到这些。一个模型 90% 的时候是对的,但每次都说自己有 99% 把握,你就没办法找出那 10% 的错误。

RLCD 是怎么工作的

TypeSafe 没有公开 Jev 的训练细节。Laya 的模型卡描述了它自己的 RLCD 做法:

  1. 模型输出一个分布:对每个问题,给每个选项一个概率,而不是只给一个答案。
  2. 探索:训练时在模型的 logits 上加入零均值高斯噪声,让它尝试略有不同的分布。
  3. 奖励是严格恰当评分规则(strictly proper scoring rule):Laya 用对数得分加球面得分;对有序的 score 题再加上排序概率得分(RPS)。
  4. 策略梯度更新:用带组均值基线的 REINFORCE 更新,类似 GRPO。多轮对话用前缀切片上的 TD(λ=1.0)。

关键在于严格恰当评分规则:在这类规则下,想让期望奖励最大,唯一的办法就是报告真实的判断。以对数得分为例,奖励是正确答案所得概率的对数。答错时,报得越自信,惩罚越重;答对时,报得太保守又会少拿奖励。于是模型学会的不只是选对标签,而是说出自己真正"相信"的概率。

RLCD 在 Jev 和 Laya 中的应用

JevLaya
出品方TypeSafe AIConvAI Innovations
是否用 RLCD 训练是(TypeSafe 官方说明)是(模型卡说明)
训练细节是否公开否是:评分规则、探索方式和更新方法都已公开
能否自己训练不能,所有账号共用一套权重可以,用微调 Notebook 在免费的 Kaggle GPU 上训练

Laya 的微调 Notebook 覆盖了完整的 RLCD 流程:构建数据集、用恰当评分规则作为奖励进行训练、在留出集上拟合校准温度、评估,然后发布 checkpoint。

RLCD 能保证概率一定准吗?

不能。RLCD 让模型朝校准的方向训练,但效果好坏取决于具体的 checkpoint、任务和选项数量。在我们的 System One 基准测试里:

  • Jev 1.13 是校准最好的模型:SST-2 上期望校准误差(ECE)为 0.020,77 个意图的 Banking77 上为 0.083。
  • Laya 在两个标签的情感判断上校准得更好(ECE 0.015),但在 Banking77 上严重过度自信(ECE 0.506)。

Laya 项目自己也承认,两个基础 checkpoint 发布时都偏过度自信。在留出数据上按问题类型和选项数量重新拟合温度后,平均 ECE 从 0.466 降到了 0.081。

实际使用时:

  1. 先在自己的标注数据上测一测校准,再决定信不信某个阈值。
  2. 如果概率偏差较大,在留出集上拟合温度(见微调 Laya)。
  3. 更换 checkpoint、精度或问题写法后,重新拟合一次。

常见问题

RLCD 是什么的缩写?

Reinforcement Learning for Calibrated Decisions,即面向校准决策的强化学习:训练模型输出决策和诚实、校准良好的概率,而不是生成文字。

RLCD 是谁提出的?

这个名称来自 Jev 背后的公司 TypeSafe AI。TypeSafe 提到,其联合创始人 Diogo Almeida 是 RLHF 的共同发明者之一。独立开源项目 Laya 也把自己的训练方法称为 RLCD,并公开了细节。

RLCD 和 RLHF 一样吗?

不一样。RLHF 奖励人们更喜欢的回答;RLCD 通过严格恰当评分规则奖励校准良好的概率,而且模型根本不生成文字。

我能用 RLCD 训练自己的模型吗?

可以,从 Laya 开始。它的微调 Notebook 用恰当评分规则作为奖励,在两张免费的 Kaggle T4 GPU 上训练;项目给出的耗时约为 4 个 epoch、约 3 万个问题需要 4–5 小时。

哪些模型使用 RLCD?

TypeSafe Jev 和 Laya 的各个 checkpoint(laya、laya-multilingual、laya-typed-decisions)。Kev、Von 等其他 System One 模型记录了各自的训练方法,没有把它们称为 RLCD,详见 System One 模型对比。

相关阅读

最后对照 TypeSafe 官方文档和 Laya 模型卡核实:2026 年 9 月 26 日。