数据工程 · 语料
行业语料库建设
为金融与医疗场景清洗、去重、脱敏并结构化百万级语料,建立可追溯的数据血缘,支撑领域模型的持续微调。
- 年份
- 2023
- 类别
- 数据工程 · 语料
- 角色
- 语料清洗 · 数据血缘设计
金融和医疗是两个对「专业」和「合规」都极其苛刻的领域。要训练能在这两个场景下用的领域模型,第一道坎不是算法,而是数据:来源杂、格式乱、噪声多,还夹着大量个人隐私和敏感信息。直接拿原始语料训练,既不合规,也只会把模型带偏。
我负责把这堆原始语料变成可用的训练数据,搭了一条清洗—去重—脱敏—结构化的流水线。清洗阶段,先用规则过滤明显的乱码、广告和模板化垃圾文本,再用人工抽检兜住规则覆盖不到的情况,避免「清过头」把有用内容也删掉。
去重是个容易被低估的环节。大量语料其实是同一篇内容的不同副本,重复样本会让模型在某些表达上过拟合,也会虚增数据量造成「数据很多」的错觉。我用近似去重把高度相似的文本归并,让数据的有效信息密度真正提上来。
脱敏是这个项目里最不能出错的一步。我对个人信息做了分级处理:姓名、身份证、银行卡、病历号等强标识一律替换或掩码,弱标识根据上下文判断,并保留必要的语义结构,让脱敏后的文本仍然可用于训练。整个过程做到敏感信息零泄漏。
我还为每一条数据保留了来源和处理记录,建立起可追溯的数据血缘。这意味着任何一条训练样本,都能回答「它从哪来、经过了哪些处理」。一旦后续发现某个来源有问题,可以精确地把受影响的数据定位并剔除,而不是推倒重来。
结构化之后,我把语料按主题和难度分层。这样后续做领域微调时,可以按需采样——想加强某个子领域,就从对应分层里取数据,而不必每次都从百万级原始库里大海捞针。
最终这套语料库处理了百万级文本,重复样本大幅下降,敏感信息全程可控可追溯,成为后续多轮领域微调稳定的底座。这个项目让我深刻体会到:数据工程虽然不性感,却是领域模型能不能落地的真正分水岭。
成果 / Outcomes
- 01处理百万级语料
- 02近似去重显著降低重复
- 03敏感信息零泄漏、全程可追溯
- 04按主题/难度分层,便于按需采样
其他项目 / More work