← 资讯列表
资讯

论文《Beyond Average Safety》:用机会约束改写安全微调

📅 2026/9/24 08:00:00👁 1 阅读⏱ 约 2 分钟

一句话:9 月 24 日 arXiv 论文提出「机会约束(chance-constrained)」安全微调,限制安全样本退化的比例,以可靠性约束视角替代平均风险正则。

背景

  • 微调常在新目标上提升能力,却可能让少数安全关键样本严重退化;平均安全损失会掩盖罕见但严重的失败。

核心要点

  • 论文提出机会约束形式,限制相对参考模型退化超过阈值的「安全样本比例」。
  • 对不连续的违反指示引入可微松弛,得到易处理的保守约束。
  • 约束感知梯度下降把松弛约束视作参数空间的安全集,最小化修正微调方向。
  • 在三类任务、三个模型的有害微调实验中稳定优于现有安全保留方法。

为什么重要

  • 把安全保留从「平均风险正则」升级为「可靠性约束优化」,更贴合真实部署对尾部失败零容忍的要求。

关键事实速记

  • 论文:arXiv 2609.29960(2026-09-24)
  • 方法:机会约束安全微调
  • 机制:可微松弛 + 安全集梯度
  • 结论:有害微调上优于基线

📂 原文链接:查看原文 →

← 返回资讯列表 AI8899 · 内容仅供学习参考