
主题从内在机理出发大模型的安全对齐与知识更新时间北京时间2026.03.21 (周六) 11:00-12:00美东时间2026.03.20 (周五) 23:00-24:00美西时间2026.03.20 (周五) 20:00-21:00直播平台微信视频号分享内容一基于零空间约束的原则性拒绝引导学习时间11:00-11:30内容介绍激活引导Activation Steering是一种在推理时增强大型语言模型LLM安全性的方法。其核心思路是将一个预定义的“拒绝方向向量”注入模型的内部激活中使模型在面对恶意提示如越狱攻击时产生拒绝行为。然而这种方法存在一个根本性的矛盾——同一个引导向量在拒绝恶意提示的同时也会误伤正常提示导致模型“过度拒绝”over-refusal和通用能力下降。现有的缓解策略无论是向量校准还是条件引导大多基于启发式设计缺乏理论保障在鲁棒性和泛化性上存在隐忧。在此工作中我们提出了 AlphaSteer一种基于零空间约束Null-Space Constraint的、具有理论基础的激活引导方法。AlphaSteer 将激活引导重新定义为一个可学习的过程通过一个可训练的变换矩阵 Δ根据输入的激活动态构造引导向量。对于正常提示零空间约束从数学上保证引导向量趋近于零使激活保持不变效用保持对于恶意提示通过带正则化的最小二乘法学习将激活映射到拒绝方向从而诱导拒绝行为安全增强。整个方法具有 closed-form 解训练仅需约 90 秒无需额外微调。实验结果表明AlphaSteer 在 Llama-3.1-8B、Qwen2.5-7B、Gemma-2-9b 三个模型上面对七种主流越狱攻击平均防御成功率均超过 90%同时在指令遵循、数学推理等通用任务上几乎无性能损失——在安全性与实用性之间实现了真正的兼顾。论文信息标题[ICLR 2026] AlphaSteer: Learning Refusal Steering with Principled Null-Space ConstraintarXivhttps://arxiv.org/abs/2506.07022GitHubhttps://github.com/AlphaLab-USTC/AlphaSteer嘉宾盛乐恒新加坡国立大学NUS博士生导师为 Tat-Seng Chua 教授。研究方向包括大模型强化学习、大模型表征学习等。个人主页https://github.com/LehengTHU分享内容二从权重几何空间透视模型编辑“学新忘旧”的底层元凶时间11:30-12:00内容介绍大语言模型需要不断更新以保持与不断演变的现实世界知识同步。模型编辑提供了一种比重新训练更轻量化的替代方案但通过多次连续编辑来更新知识的序列编辑Sequential Editing往往会破坏模型的内部表示并导致灾难性遗忘。在这项工作中我们致力于深入理解并缓解序列编辑导致的性能退化。我们提出一个假设超球面均匀性Hyperspherical Uniformity即保持神经元权重在超球面上均匀分布的特性有助于模型保持稳定、保留先验知识同时接纳新的更新。我们使用超球面能量Hyperspherical Energy, HE来量化编辑过程中的神经元均匀性并探究其与编辑性能的相关性。对广泛使用的编辑方法进行的实证研究表明HE 的动态变化与编辑性能之间存在强相关性编辑失败的情况始终伴随着 HE 的剧烈波动。我们进一步从理论上证明HE 的动态变化为预训练知识的退化设定了下界从而突显了为何 HE 的稳定性对于知识保留至关重要。受这些见解的启发我们提出了 SPHERESparse Projection for Hyperspherical Energy-Regularized Editing面向超球面能量正则化编辑的稀疏投影这是一种由 HE 驱动的正则化策略能够稳定神经元权重分布最终在保留先验知识的同时实现可靠的序列更新。具体而言SPHERE 识别出一个与预训练权重矩阵的主超球面方向互补的稀疏空间并将新知识投影到该空间上从而减弱对主方向的扰动。我们在 LLaMA3 (8B) 和 Qwen2.5 (7B) 上进行的大量实验表明SPHERE 在编辑能力上平均优于最佳基线方法 16.41%同时最大程度地保留了模型的通用性能从而为可靠的大规模知识编辑提供了一个新的视角。论文信息标题[ICLR 2026] Energy-Regularized Sequential Model Editing on HyperspheresarXivhttps://arxiv.org/abs/2510.01172嘉宾刘庆远哥伦比亚大学硕士研究生目前在加州大学洛杉矶分校UCLA自然语言处理实验室担任科研助理师从 Nanyun Peng 教授。他的主要研究方向为大语言模型的可解释性与安全隐私。其出色的研究成果曾入选哥伦比亚大学工程学院研究亮点Columbia Engineering Research Highlight。个人主页https://www.qingyuanliu.net/主持人王梦如浙江大学博士生师从张宁豫副教授研究方向是 Interpretability and LLM Safety在 NeurPISACLEMNLP 等顶级会议发表过论文。入群欢迎加入 NICE 每周分享交流群可与 NICEer 唠嗑以及第一时间收到后续 NICE 分享报告的通知。加群通过小助手认证群内无广告。备注【昵称-单位-方向-NICE入群】NICE介绍NICENexus forIntelligenCE是一个由全球 50 位一线青年学者共同发起的顶尖 AI 前沿交流平台。 成立以来我们汇聚海内外 300 嘉宾通过百余场线上深度分享与线下高规格活动北京/上海/苏州等全网积累超 13 万关注。目前NICE 已构建起覆盖中、美、欧的国际化团队正加速在硅谷、纽约、香港等地落地致力于打造连接学术、产业与未来的全球化 AI 前沿社区。NICE主页https://nice-nlp.github.ioNICE海外https://nice-intl.github.iob站https://space.bilibili.com/507524288Youtubehttps://www.youtube.com/niceaitalk编辑 | 宁钰成 中国科学院大学