尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

Precise Attribute Intensity Control in Large Language Models via Targeted Representation Editing

Precise Attribute Intensity Control in Large Language Models via Targeted Representation Editing 该文章提出了PRE-CONTROL方法,解决现有大语言模型(LLM)对齐方法难以实现精确属性强度控制的问题,通过目标达成重构、价值函数训练和梯度干预,实现对LLM输出属性强度的细粒度连续控制,并在下游任务中提升效率。一、文章主要内容研究背景:现有LLM对齐方法(如RLHF、DPO)仅提供方向性或开放式引导,无法可靠实现精确属性强度控制,而实际应用中(如邮件语气调整、多目标权衡)需要对属性强度进行连续尺度的细粒度调节。核心方法(PRE-CONTROL)问题重构:将精确属性强度控制从“最大化/最小化优化”转为“目标达成问题”,通过最小化预测属性强度与用户指定目标的平方误差实现精准控制。价值函数训练:基于时序差分学习(TD(λ))训练轻量级多层感知机(MLP),从LLM的隐藏状态预测部分生成内容对应的最终属性强度,为生成过程提供实时反馈。测试时干预:在LLM解码过程中,通过梯度下降调整隐藏状态,引导生成内容向目标属性强度靠近,支持多属性同时控制(可通过权重设置各属性重要性)。实验验证模型与数据集:在LLaMA-3.2-3b和Phi-4-mini模型上,基于HelpSteer2(对话属性)和Code-UltraFeedback(代码属性)数据集验证。
返回列表