RLHF 里的偏好标注,到底在标什么
“哪个回答更好”看似简单,落到准则、分歧处理与一致性校验时,全是细节。
「这两个回答,哪个更好?」这是 RLHF 里出现频率最高的一句话,也是最容易被低估的一句。它看起来凭直觉就能回答,可真正大规模标起来,你会发现每个人心里的「好」都长得不一样,而这些不一样,会被模型一字不差地学走。
所以标注的第一步,从来不是「标」,而是「定义」。在让任何人开始判断之前,我会先把「好」拆成几个可以分别衡量的维度:正确性,有没有事实错误;完整性,有没有答全;安全性,有没有触碰红线;语气,符不符合场景。然后给这些维度排出优先级——比如安全永远压倒一切,一个再详细、再热情的回答,只要越界,就必须判为更差。维度和优先级写清楚了,标注员之间的分歧才有了可以对齐的坐标系。
第二步是认真对待分歧。新手常把高分歧样本当成麻烦,急着用多数票抹平。但恰恰是这些样本最有信息量——它们落在模型行为的边界上,是最值得教给模型的地方。我的做法是把高分歧样本单独拎出来复盘:如果是准则没写清,就补充准则;如果确实是见仁见智的主观题,就如实记录下来,而不是硬塞一个标准答案。把主观题伪装成客观题,只会给模型灌进噪声。
第三步是一致性校验。偏好数据的全部价值,建立在它的稳定之上。如果同一个标注员今天和下周对相似样本给出相反判断,或者不同标注员之间长期对不齐,那么再精巧的奖励模型也只是在拟合噪声。我会定期抽样做一致性测试,把它当成数据质量的体温计——一旦掉下来,就说明准则或培训出了问题,得回头修。
还有一点常被忽略:偏好标注不是一锤子买卖。模型反复犯的同一类错误,应该被收集起来,构造成新的对比样本重新进入标注,形成闭环。这样每一轮,数据都在针对模型当下的弱点补强,而不是泛泛地再标一批。
说到底,RLHF 里的偏好标注,标的从来不只是「哪个更好」,而是「我们希望模型成为什么样」。准则是价值观的具体化,分歧处理是对复杂性的尊重,一致性校验是对可靠的坚持。把这三件事做扎实,对齐才不会跑偏。
其他文章 / More writing