模型对齐 · 偏好数据
对齐计划 · RLHF
设计偏好标注准则与奖励信号,组织上万条对比样本,让对话模型在有用性与无害性之间找到更稳的平衡。
- 年份
- 2025
- 类别
- 模型对齐 · 偏好数据
- 角色
- 偏好数据设计 · 标注准则制定
对话模型最难的,不是答得对,而是答得「得体」。我接手这个对齐项目时,模型正卡在一个尴尬的状态:要么过度谨慎,连正常问题都频繁拒答,把用户挡在门外;要么为了显得乐于助人,越过了不该越的安全红线。这两种失衡,都会让用户失去信任。
RLHF 的核心是偏好数据——让人来判断「两个回答里哪个更好」,再用这些判断去塑造模型的奖励信号。听起来简单,真正落地时才发现,每个标注员心里的「好」都不一样:有人看重信息量,有人看重语气,有人在安全问题上格外敏感。如果不把「好」定义清楚,收上来的就是一堆互相打架的判断。
所以我做的第一步,是把「哪个更好」拆成可操作的维度:正确性、完整性、安全性、语气。每个维度给出权重,并明确优先级——安全永远压倒一切,哪怕一个回答更详细,只要它触碰红线,就必须判为更差。维度和优先级写进准则,标注员之间的分歧才有了可以对齐的依据。
第二步是认真对待分歧。在偏好标注里,高分歧的样本恰恰最有价值,它们往往落在模型行为的边界上。我没有用简单的多数票把它们盖过去,而是单独拎出来复盘:能补进准则的就补,确实是主观题的就如实记录,避免把噪声当成信号灌进模型。
第三步是把标注和训练接成闭环。我参与了奖励信号的回灌与坏例复盘——模型反复犯的同一类错误,会被整理成新的对比样本,重新进入标注。这样每一轮迭代,数据都在针对模型当前的弱点补强,而不是泛泛地多标一些。
为了保证数据可靠,我把一致性校验做成常规动作,让偏好标注的一致性稳定在 0.85 以上。偏好数据的价值完全取决于它有多稳定,一旦标注本身飘忽,后面再精巧的算法都白搭。
最终,模型的无意义拒答率明显下降,有用性和无害性的评分能够同步提升,而不再是按下葫芦浮起瓢。这件事让我更确信:对齐不是某个算法的胜利,而是一套清晰准则加上持续闭环的结果。
成果 / Outcomes
- 01无意义拒答率明显下降
- 02有用性与无害性评分同步提升
- 03偏好标注一致性稳定在 0.85+
- 04坏例闭环回流训练
其他项目 / More work