Works
精选项目,2023—2026
围绕数据、对齐与评测的部分实践,记录于此
全部项目
6 个01
多模态标注体系
2024为多模态大模型搭建图文标注规范与质检流程,把标注一致性(IAA)从 0.62 提升到 0.89,返工率下降一半。
数据标注质量体系标注规范
02
对齐计划 · RLHF
2025设计偏好标注准则与奖励信号,组织上万条对比样本,让对话模型在有用性与无害性之间找到更稳的平衡。
RLHF偏好标注对齐
03
可信评测基准
2025为行业模型设计一套覆盖事实性、安全与拒答的评测基准,配套 LLM-as-judge 与人工双盲复核,让“变好了”有据可依。
评测基准设计LLM 评审
04
行业语料库建设
2023为金融与医疗场景清洗、去重、脱敏并结构化百万级语料,建立可追溯的数据血缘,支撑领域模型的持续微调。
数据工程清洗去重脱敏
05
提示工程规范
2024把“凭感觉写提示词”沉淀为可复用的模板库与 A/B 流程,让团队的提示词像代码一样可版本化、可评测、可交接。
提示工程模板库A/B 测试
06
模型安全红队
2024组织对抗性测试与越狱探测,建立风险用例库与分级处置流程,在上线前把模型的“危险话”尽量提前堵住。
安全红队越狱测试风险分级