安全 · 红队
模型安全红队
组织对抗性测试与越狱探测,建立风险用例库与分级处置流程,在上线前把模型的“危险话”尽量提前堵住。
- 年份
- 2024
- 类别
- 安全 · 红队
- 角色
- 红队用例设计 · 风险分级
模型上线后,最让人担心的往往不是答错一道题,而是被人有意诱导,说出不该说的话。常规的功能测试只覆盖「正常使用」,根本碰不到那些被刻意构造出来的攻击话术。要在上线前堵住这些风险,需要一支专门「找茬」的红队。
我负责组织这件事。第一步是系统性地收集攻击方式。我把常见的诱导手法归类,比如角色扮演绕过、分步拆解、用假设语境包装、利用多语言或编码混淆等等,然后围绕每一类构造大量探测用例,主动去试模型的底线在哪里。
探测不能是一次性的热闹。我把发现的问题沉淀成一个分级的风险用例库:按危害程度和触发难度给每条用例打上等级,高危的优先处置,低危的持续观察。等级清楚了,资源就能投在最该投的地方,而不是被一堆零散的个案牵着走。
对每一类风险,我都定义了明确的处置优先级和回归测试。这一点很重要——安全问题最怕的是「这次修好了,下个版本又冒出来」。每发现一类新攻击,我就把它写成用例放进回归集,让同样的问题不可能在下一轮迭代里悄悄复活。
红队不是为了证明模型不安全,而是为了让它更安全。我会把探测结果反馈给数据和训练环节:哪类诱导最容易得手,就针对性地补充对抗样本和拒答数据,从源头降低模型「上当」的概率,而不是只靠事后打补丁。
我也注意把握分寸。安全和可用是一对需要平衡的目标,红队的目的不是把模型逼成什么都不敢答,而是让它在真正危险的地方稳住底线,在正常请求上依然好用。所以每条安全策略,我都会回头看它有没有误伤正常使用。
这套机制运转起来后,我们建立了分级的风险用例库,高危越狱用例能在上线前被拦截,且因为有回归集兜底,安全问题不再反复复发。把危险尽量挡在上线之前,是我认为一个负责任的 AI 产品最基本的底线。
成果 / Outcomes
- 01建立分级风险用例库
- 02高危越狱用例上线前拦截
- 03安全问题可回归、不复发
- 04探测结果回流训练,从源头降险
其他项目 / More work