
资讯
论文《Beyond Average Safety》:用机会约束改写安全微调
一句话:9 月 24 日 arXiv 论文提出「机会约束(chance-constrained)」安全微调,限制安全样本退化的比例,以可靠性约束视角替代平均风险正则。
背景
- 微调常在新目标上提升能力,却可能让少数安全关键样本严重退化;平均安全损失会掩盖罕见但严重的失败。
核心要点
- 论文提出机会约束形式,限制相对参考模型退化超过阈值的「安全样本比例」。
- 对不连续的违反指示引入可微松弛,得到易处理的保守约束。
- 约束感知梯度下降把松弛约束视作参数空间的安全集,最小化修正微调方向。
- 在三类任务、三个模型的有害微调实验中稳定优于现有安全保留方法。
为什么重要
- 把安全保留从「平均风险正则」升级为「可靠性约束优化」,更贴合真实部署对尾部失败零容忍的要求。
关键事实速记
- 论文:arXiv 2609.29960(2026-09-24)
- 方法:机会约束安全微调
- 机制:可微松弛 + 安全集梯度
- 结论:有害微调上优于基线
📂 原文链接:查看原文 →
← 返回资讯列表
AI8899 · 内容仅供学习参考