评测 · Benchmark
可信评测基准
为行业模型设计一套覆盖事实性、安全与拒答的评测基准,配套 LLM-as-judge 与人工双盲复核,让“变好了”有据可依。
- 年份
- 2025
- 类别
- 评测 · Benchmark
- 角色
- 评测维度设计 · 评审一致性校准
每一次模型迭代,团队都会说「这版变好了」。但「变好」到底指什么?过去我们只盯着一个准确率,数字涨了零点几就上线,结果用户的真实体验并没有同步改善。问题出在评测本身——它没测到那些真正影响体验的东西。
我接下这个项目,目标是建立一套让人愿意相信的评测基准。第一步是把笼统的「好」拆成可以分别衡量的维度。我设计了四个维度:事实性,回答有没有编造;安全性,会不会输出有害内容;拒答,该拒的有没有拒、不该拒的有没有误伤;以及风格,语气是否符合产品定位。每个维度单独打分,模型在哪一类问题上退步,一眼就能看见,而不会被一个平均分掩盖。
光有维度还不够,每个维度都要配上贴近真实场景的用例。我从线上真实问题里采样,刻意保留那些刁钻的、容易出错的边角情况,因为评测集如果只有简单题,分数再高也说明不了问题。
规模大了,纯靠人工评测既慢又贵。于是我引入 LLM-as-judge 做初筛,让大模型先快速过一遍,再由人工对关键样本做双盲终判。这里最关键的,是持续校准机器评审和人工评审的一致性——当两者开始频繁分歧,往往不是谁错了,而是评测标准本身出现了模糊,需要回头修订。
我特别强调评测结果要「可复现」。同一个模型、同一套题,今天测和下周测应该得到稳定的结论,否则评测就成了掷骰子。为此我固定了采样、固定了评审提示词、固定了打分口径,把随机性压到最低。
评测的终点不是给模型颁个分数,而是给下一轮训练指方向。每个维度的退步,我都要求能直接翻译成「下一步该补什么数据」。比如事实性掉了,就去补对应领域的高质量语料;拒答误伤多了,就回到偏好数据里调整边界。
上线后,评测维度从 1 个扩展到 4 个,LLM 评审与人工的一致率稳定在 0.9 左右,迭代决策第一次有了扎实、可复现的依据。「变好了」这三个字,终于不再是一句感觉。
成果 / Outcomes
- 01评测维度从 1 个扩展到 4 个
- 02LLM 评审与人工一致率约 0.9
- 03结论可复现、迭代有据
- 04退步可直接定位到数据
其他项目 / More work