Yuki
数据2026年5月18日· 7 分钟

数据质量,比换更大的模型更重要

大多数“模型不行”的问题,根子在数据。聊聊标注一致性、噪声与长尾,怎么决定了上限。

每当模型表现不及预期,团队的第一反应几乎总是同一个:换个更大的底座。仿佛只要参数量再翻一倍,问题就会自动消失。但在我经手的项目里,绝大多数「模型不行」的问题,最后都指回同一个地方——数据。

先说标注一致性。监督信号是模型学习的依据,如果两个标注员对同一条样本给出相反的标签,模型收到的就是自相矛盾的指令。它没办法同时满足两个相反的要求,只能学出一个模糊的折中。再大的参数量,也消化不了本身就矛盾的数据。所以在投算力之前,我总会先问:我的标注,自己跟自己一致吗?把一致性指标做起来、把高分歧样本捞出来对齐口径,常常比调模型更立竿见影。

再说噪声。脏数据不会大张旗鼓地报错,它只是悄悄地把模型的上限往下压。一批混进了错误标签、重复内容、低质文本的数据,训练时看不出异常,评测时却处处掣肘。清噪声是件枯燥但回报极高的事——它不会让你的指标突然暴涨,但会让后面每一步都更扎实。

还有长尾。很多数据集看起来量很大,其实高度集中在少数几种常见情况上,真实世界里那些零散、罕见但重要的场景几乎没有覆盖。模型在测试集上分数漂亮,一上线就水土不服,正是因为它没见过长尾。有意识地去补长尾,让训练分布贴近真实使用,往往比单纯堆数据量更有用。

这三件事——一致性、噪声、长尾——共同决定了数据的质量,而数据的质量,决定了模型能达到的上限。换更大的模型,是在抬高「天花板」;而提升数据质量,是在让模型真正够得着那个天花板。两者不矛盾,但顺序很重要。

我的经验是:在掏钱买更多算力之前,先老老实实问一句——我的数据,配得上一个更大的模型吗?如果答案是否定的,那么再大的模型,也只是把同样的问题学得更熟练而已。

其他文章 / More writing