Yuki

数据标注 · 质量体系

多模态标注体系

为多模态大模型搭建图文标注规范与质检流程,把标注一致性(IAA)从 0.62 提升到 0.89,返工率下降一半。

年份
2024
类别
数据标注 · 质量体系
角色
标注规范设计 · 质检流程负责人

这个项目要为一个图文多模态大模型准备训练数据。模型需要看懂图片、理解图文之间的关系,并给出准确的描述与判断。但当我接手时,团队的标注还停留在「凭感觉写一句话」的阶段——同一张图,不同的标注员可能写出完全不同的描述,有人关注主体,有人关注背景,有人甚至加入了图片里根本不存在的推测。这样的数据喂给模型,等于让它在互相矛盾的信号里学习,再大的参数量也消化不了。

我做的第一件事,是把「标注」这个模糊的动作拆开。我把一张图的标注分成三层:第一层是客观描述,只写画面里确实存在的元素,不允许任何推断;第二层是属性判断,比如场景类型、主体数量、图文是否一致,每一项都给出明确的判定标准和正反例;第三层才是带主观性的倾向判断,并且明确告诉标注员「这一层允许有分歧,重要的是写清理由」。三层分开后,标注员终于知道每一步该做什么、不该做什么。

光有规范还不够,规范写完就锁死,很快就会和真实数据脱节。于是我设计了一套质检流程:每条样本默认双人盲标,两人结果不一致的,进入第三人仲裁;同时我用标注一致性指标(IAA)做每周抽检,一旦某个类别的一致性掉下来,就说明规范在那里出现了歧义。

为了让分歧不被埋没,我搭了一个轻量的复盘看板,自动把高分歧样本汇总出来。每周我们花一小时集中过这些样本,要么补充规范里漏掉的边角情况,要么承认这是主观题、记录下不同口径。规范因此是「活」的,每周都在收敛,而不是一份写完就没人看的文档。

我也很在意标注员的体验。判定标准写得越清楚,他们的心理负担越小,速度反而越快。我把常见的疑难案例整理成一份「判例集」,新人上手时先看判例,遇到拿不准的直接对照,省去了大量来回沟通。

三个月后,标注一致性从 0.62 提升到 0.89,返工率下降了大约一半,新人从入职到能独立产出合格数据的周期也缩短了一半。更重要的是,下游模型在图文一致性判断上的表现有了肉眼可见的提升——这印证了一个朴素的道理:模型的上限,往往是被数据质量悄悄决定的。

成果 / Outcomes

  • 01标注一致性 IAA 0.62 → 0.89
  • 02返工率下降约 50%
  • 03新人上手周期缩短一半
  • 04下游图文一致性判断明显提升
数据标注质量体系标注规范

其他项目 / More work