Writing
训练模型之外,我也写一点东西——数据、对齐、评测,以及怎么让模型既聪明又可信
大多数“模型不行”的问题,根子在数据。聊聊标注一致性、噪声与长尾,怎么决定了上限。
“哪个回答更好”看似简单,落到准则、分歧处理与一致性校验时,全是细节。
只看准确率会骗自己。谈谈事实性、拒答、安全维度,以及 LLM 评审与人工复核怎么配合。
把提示词当代码:模板化、版本化、可评测。分享我团队在用的一套流程。