尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

数据混合的代价:学会新任务,会忘掉旧能力吗?——96 条开发样本的低基线实验

数据混合的代价:学会新任务,会忘掉旧能力吗?——96 条开发样本的低基线实验 数据混合的代价学会新任务会忘掉旧能力吗——96 条开发样本的低基线实验系列从最小复现到可检验的科研问题日期2026-10-04读者研究生、科研新人和工程型研究者范围真实 SmolLM2-135M-Instruct32 条影评与 32 条新闻训练池64 条情感、32 条新闻开发样本单种子 CPU 短预算实验。目录复现价值与论文边界核心思想按监督量混合官方代码阅读路线最小实验与评测协议实际结果与失败分析源码与复现入口可检验问题与总结复现价值与论文边界090 已发现同一情感任务的输出约定存在权衡但普通回答与 JSON 回答仍是同一任务不能直接代表广泛的旧能力。091 保留模型、情感数据、模板、优化器和开发划分新增独立新闻分类任务受控变量是新闻监督量占比新增产物是双任务逐例输出和微批次预算账本。回放指训练时重新加入希望保留的任务样本。本篇新闻训练数据不是模型原始预训练记忆库因此只能称任务回放。模型本身已经过指令训练“新任务”指本项目新施加的监督目标并不表示它从未见过情感数据。[1]**论文报告**Kotha、Springer 与 Raghunathan 在 ICLR 2024 论文中提出微调可能改变模型从提示推断任务的倾向行为退化未必等于能力从参数中彻底消失。[2] 本篇借此区分行为、格式和机制不复现其共轭提示实验也不拿其结论证明本次退化原因。**本次实际验证**对冻结版本小模型运行四组真实全参数更新保留全部预定组和失败记录。**作者推断**标签偏好、格式适配与跨任务梯度干扰都可能解释现象尚无直接机制证据支持其中某一个。核心思想按监督量混合SFT 是监督微调即让模型提高给定上下文下正确回答的概率。token 是分词单位。设目标任务与回放任务分别贡献有效目标数 (B_T,B_R)定义α B R B T B R , L u 1 16 ∑ b ∈ u n b ℓ ˉ b . \alpha\frac{B_R}{B_TB_R},\qquad L_u\frac{1}{16}\sum_{b\in u}n_b\bar\ell_b.αBT​BR​BR​​,Lu​161​b∈u∑​nb​ℓˉb​.(\alpha) 是回放监督比例(u) 表示一次参数更新(b) 是其中的微批次(n_b) 是有效回答 token 数(\bar\ell_b) 是其平均交叉熵损失。每次更新的 (\sum_b n_b16)。提示与补齐位置不计损失真实结束标记 EOS 计入监督。情感 JSON 每行八个目标新闻字母回答加 EOS 每行两个。一次情感更新用两行一次新闻更新需八行分四个两行微批次累积梯度。每个微批次损失先乘 (n_b/16)累积完再裁剪、更新若每个微批次都直接做一步新闻组就偷偷获得四倍更新机会。比例相同也不等于轨迹相同。本篇按任务分步交替且使用梯度裁剪不能把实际更新说成始终优化一个完全等价的静态加权目标。更不能把监督预算当作总计算量新闻上下文更长、行数更多输入 token 和时间都会增加。青色数据进入三组橙色回放只进入两个混合组三个模型从相同权重独立初始化。右侧同时测两任务保留确认集与训练隔离。图未画半量辅助组其预算见表。官方代码阅读路线先读固定模型的tokenizer_config.json和 Transformersapply_chat_template确认生成前缀与完整训练序列逐 ID 一致。common.py/build沿用情感模板mixture.py/news_build新增字母回答。真实 EOS 与 PAD 恰好同为 ID 2按长度掩码才能保留结束监督不能把所有 ID 2 删除。随后读LlamaForCausalLM.forward、ForCausalLMLoss标签不提前移位模型内部完成下一 token 对齐。[3] 微批次输入形状为[2,L]logits 为[2,L,49152]末维是词表。独立移位交叉熵与官方 loss 的差异被逐批保存新闻四个微批次的权重和为一。最后看 PyTorchSGD.step与生成器贪心选择分支。真实推理、损失和更新均调用官方实现样本选择、调度、掩码和评测为自写教学代码。源码地图固定 Transformers 4.49.0 与 PyTorch 2.6.0 的提交、函数和行号五份官方文件已重新下载并与安装文件逐字节核对许可证一并保留。最小实验与评测协议模型与 tokenizer revision 为12fd25f77366fa6b3b4b768ec3050bf629380bacSST-2 为8d51e7e4887a4caaa95b3fbebbf53c0490b58bbbAG News 为eb185aade064a813bc0b7f42de02595523103ca4。二十个资源文件有实际 SHA-256。缓存身份包含模型、分词器、数据、提示、模板、解码、配置和执行源码哈希。情感训练池沿用 090 的三十二行负正交替开发集仍为原六十四行一百二十八条确认样本未推理。[4] 新闻标签对应世界、体育、商业、科技分别输出 A/B/C/D。[5] 先给固定 parquet 行位置编号再在每类内按SHA256(91:idx)排序train 各取八行test 各取前八行作开发、随后十六行保留。故新闻测量是三十二条类别均衡的开发子集不能称完整 test 成绩。未见确认数据共一百九十二条。训练池内部和对应开发、确认集通过规范化完全重复检查这不排除近重复、文章关联或预训练污染。新闻来自公开数据提供方的固定镜像原始任务作者与打包提供方分开署名。保留样本只检查索引与重合不送入模型。条件情感/新闻更新数两类监督 token总输入 token仅目标64 / 01024 / 010,55625% 回放48 / 16768 / 25625,47750% 回放32 / 32512 / 51240,398半量目标辅助组32 / 0512 / 05,278前三组固定六十四步、一千零二十四个监督目标最后一组只匹配 50% 回放的目标暴露量用来检查“少训目标”的解释。回放按目标目标目标新闻、目标新闻的周期执行各任务内部按冻结行序循环两任务训练池各三十二行没有开发集回放。四组均从原权重加载134,515,008 个参数参与 SGD学习率 0.001、无动量及衰减、裁剪阈值一seed 91、CPU float32、四线程、eager attention。eval模式关闭随机模块但训练保留自动求导。固定末步评测不早停、不选最好检查点。贪心最多生成三十二个新 token。主指标分别是情感 JSON 和新闻字母的联合正确率即格式与标签同时正确。另报普通情感回答、格式率、唯一显式标签的内容代理后者不是人工语义金标。选择规则预先写明新闻正确数至少为基线减一再最大化 JSON 联合正确并列选较低回放比例。只在开发集执行这一规则。实际结果混合并未保护可见行为状态普通情感正确JSON 格式通过JSON 联合正确新闻联合正确训练前57/640/640/648/32仅目标33/6464/6458/648/3225% 回放34/6464/6458/648/3250% 回放34/6459/6451/645/32半量目标55/6461/6451/648/32仅目标与 25% 回放虽然 JSON 总分相同逐例仍有一胜、一负、六十二平不能把同分写成行为完全一致。新闻两组正确样本都与基线相同。预定规则选择仅目标含义只是这组在当前约束下更简单不是证明零回放普遍最优。50% 回放相对基线新闻为二胜、二十五平、五负。格式却从三十条合格升到三十二条格式改善并未带来内容改善。基线三十条输出 A另两条不是合法单字母50% 回放变为二十个 A、九个 C、三个 D没有 B。均衡训练标签并不保证生成分布均衡。新闻索引 2853 的原标签是世界输出从 A 变 C6105 的原标签是商业输出从 A 变 C。相同输出变化在不同样本上可分别造成损失和收益。逐例比较比“多样性增加所以更好”的事后故事更有约束力。没有人工重新标注新闻语义。半量目标组与 50% 回放的 JSON 都为 51/64逐例也有一胜一负但普通情感分别为 55/64、34/64配对二胜、三十九平、二十三负。加入新闻不只减少了目标训练还改变了优化路径和额外监督本实验不能隔离到底是任务干扰、顺序还是字母约定造成差异。失败排查与证据边界最重要的失败是测量地板。三十二条新闻每类八条永远回答 A 也得八分当前基线没有建立可靠新闻能力。相同八分不能证明旧能力保存良好下降三分也不能直接叫灾难性遗忘。看到低分后换任务、提示或标签顺序直至找到漂亮曲线会把开发探索包装成预先检验。因此本次按协议保留任务明确报告诊断失败。工程上也有真实失败最初预处理在新闻行 112808 发现四百二十二个 token超过二百五十六上限模型尚未加载。保留失败日志后只把新闻训练上限改为五百一十二未截断或替换样本情感上限不变。这是推理前的资源修订已追加到协议。成功试跑十四步、四十次生成再估算正式资源未根据分数改预算。正式实验二百二十四步、八百次生成导入后总耗时 223.41 秒峰值 RSS 5.63 GB。四组训练约 20.90、38.80、60.89、10.47 秒GPU 内存未测。完整参数检查点留在本地并记录文件哈希和非零权重变化。独立审计重建掩码、任务日程、预算、原始回答与标签没有用语法通过替代真实训练。单种子、微小子集和类别配额不支持总体显著性或跨平台位级一致结论。源码与复现入口本篇源码已公开发布固定提交源码目录、README 与运行说明、SOURCE_MAP 官方源码对应。固定版本为7bd49bd7d6c1请使用该提交复现避免主分支变化。安装 README 中固定依赖执行python prepare.py --cache ./cache后最小入口为python run.py --cache ./cache --out smoke-new --private ./private-new --smoke。产物包括任务索引、逐步预算、逐例输出、指标、资源记录与检查点再运行python audit.py --cache ./cache --out smoke-new。去掉试跑参数可复现全部四组缓存会再次核对哈希。本篇本地保留完整原始输出两份数据卡许可均为 unknown分发包不包含原始影评、新闻、输入 token、权重或环境。个别模型回答复述新闻公开验证记录仅保留这些回答的哈希和派生评分原始版本私有归档脚本实际运行会生成完整新记录。其余回答可逐例审计不能把删去文本的记录冒充公开原文。解压与公开副本均另做最小真实运行。可检验的研究问题第一种解释是新闻字母映射本就不适合该模型。下一篇可在独立开发材料上固定语义匹配的类别文本、字母映射及模板变体分别测格式和内容并先完成人工标签保持检查若文本类别明显改善而字母仍偏置就削弱“模型完全不懂新闻”的解释。尚未完成的人审不能提前称金标。第二种解释是顺序与任务梯度冲突。固定两任务暴露量后预先比较交替、分块和不同顺序再做多种子若退化只发生于某种顺序单纯比例解释就不足。所有开发尝试要登记现有确认集继续封存不能看完失败再修改最终检验。总结本篇没有得到“回放保护旧能力”的正结果。它交付了可复跑的混合实验也识别出一个更基础的要求保留任务必须先展示可测能力。受控预算、负结果、失败日志和竞争解释比把同分包装成遗忘被解决更能推动连续研究。参考资料检索与实际访问日期2026-10-04。HuggingFaceTBSmolLM2-135M-Instruct 固定模型卡。模型身份、模板和许可。Suhas Kotha、Jacob Mitchell Springer、Aditi RaghunathanICLR 2024Understanding Catastrophic Forgetting in Language Models via Implicit Inferencev2。仅引用其任务推断假设。Hugging Face固定 causal lossPyTorch固定 SGD。Richard Socher 等EMNLP 2013Recursive Deep Models for Semantic Compositionality Over a Sentiment TreebankSST-2 固定数据卡。Xiang Zhang、Junbo Zhao、Yann LeCun2015Character-level Convolutional Networks for Text Classification作者仓库本次 AG News 固定数据卡。核对任务来源、标签与当前数据打包。
返回列表