Yuki
评测2026年2月20日· 8 分钟

如何设计一套可信的评测基准

只看准确率会骗自己。谈谈事实性、拒答、安全维度,以及 LLM 评审与人工复核怎么配合。

评测最大的陷阱,是用一个漂亮的总分让自己安心。准确率涨了零点几个百分点,大家就觉得这版更好了,于是放心上线。可用户的体验并没有变好——因为那个总分,根本没测到真正影响体验的东西。一套会骗人的评测,比没有评测更危险,因为它给了你虚假的信心。

要让评测可信,第一件事是把笼统的「好」拆开。我至少会把它分成事实性、安全、拒答和风格四个维度。模型完全可能在事实题上进步,却在该拒答时变得话痨,或者语气越来越油滑——这些此消彼长,混在一个平均分里就被悄悄抵消了。只有按维度分开看,你才知道它到底好在哪、又在哪里偷偷退步。

第二件事是用例要贴近真实,而且要敢留难题。如果评测集里全是简单、清晰、模型早就会的题目,那分数再高也只是自我安慰。我会从真实场景里采样,刻意保留那些刁钻的、含糊的、容易触发错误的边角情况,因为模型真正的差距,都藏在这些地方。

第三件事,是处理好规模和成本。题目一多,纯人工评测既慢又贵。我的办法是分工:让 LLM-as-judge 做初筛,快速过一遍大批样本;再由人工对关键的、机器拿不准的样本做双盲终判。这里的核心动作,是持续校准机器评审和人工评审的一致性——当两者开始频繁分歧,通常不是谁错了,而是评测标准本身变模糊了,该回去修订标准。

第四件事是可复现。同一个模型、同一套题,今天测和下周测,应该得到稳定的结论,否则评测就成了掷骰子。为此要把采样、评审提示词、打分口径都固定下来,把随机性压到最低。一个结论如果换个人、换个时间就变了,它就不配用来做决策。

最后,也是最重要的:好的评测不是给模型打分,而是给下一轮训练指方向。每一个维度的退步,都应该能直接翻译成一句「下一步该补什么数据」。事实性掉了,就去补对应领域的高质量语料;拒答误伤多了,就回到偏好数据里重调边界。当评测和训练形成闭环,模型才会真正地、可验证地越来越好。

其他文章 / More writing