尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

zebra_qwen3_7MLA21GDN_noT_SFT_1M_combined_fCE训练配置深度解析:从64K到1M的三阶段SFT技术路线

zebra_qwen3_7MLA21GDN_noT_SFT_1M_combined_fCE训练配置深度解析:从64K到1M的三阶段SFT技术路线 zebra_qwen3_7MLA21GDN_noT_SFT_1M_combined_fCE训练配置深度解析从64K到1M的三阶段SFT技术路线【免费下载链接】zebra_qwen3_7MLA21GDN_noT_SFT_1M_combined_fCE项目地址: https://ai.gitcode.com/hf_mirrors/amd/zebra_qwen3_7MLA21GDN_noT_SFT_1M_combined_fCE让大模型读懂百万级token的上下文是2025年以来大模型领域最炙手可热的方向之一。zebra_qwen3_7MLA21GDN_noT_SFT_1M_combined_fCE 正是一份面向1M1048576 token超长上下文的开源训练配置深度解析案例它基于 Qwen3-1.7B通过 MLA GDN 混合注意力架构与 RoPE 长度扩展技术用三阶段 SFT 路线把模型窗口从 64K 一路推到 1M并公开了完整的 YAML 配置、训练日志与结果数据是新手学习长上下文微调SFT的最佳教材之一。这个项目到底是什么先看它的名字项目名称zebra_qwen3_7MLA21GDN_noT_SFT_1M_combined_fCE其实把核心信息全部写在名字里了拆开看一目了然名称片段含义zebra_qwen3基于 Qwen3 的 Zebra 系列实验7MLA21GDN7 层 MLA 21 层 GDN 混合注意力noTno Teacher无教师模型蒸馏SFT监督微调Supervised Fine-Tuning1M目标上下文长度 1048576 tokencombined多数据集混合训练fCEfused Cross-Entropy融合交叉熵Liger整个仓库的核心是一份 zebra_7MLA21GDN_noT_SFT_1M_combined_fCE.yaml 训练配置文件加上 hybrid_config.json、config.json 等模型结构描述以及 trainer_state.json、train_results.json 等完整训练记录。如果你想复现或研究直接克隆即可git clone https://gitcode.com/hf_mirrors/amd/zebra_qwen3_7MLA21GDN_noT_SFT_1M_combined_fCE为什么需要三阶段SFT从32K到1M的渐进之路直接把模型从 32K 窗口一步拉到 1M 是不现实的——注意力机制会发生灾难性遗忘和位置编码崩溃。因此这个项目采用渐进式长度扩展完整的路线是预训练阶段Qwen3-1.7B 原生窗口为 32K32768 token64K SFT 阶段先通过zebra_7MLA21GDN_noT_SFT_64k_combined_fCE.yaml训练到 64K1M SFT 阶段本配置接续 64K 的 checkpoint继续训练一举扩展到 1M。配置文件开头的注释明确写到Continues from the 64k SFT checkpoint produced by zebra_7MLA21GDN_noT_SFT_64k_combined_fCE.yaml模型加载路径linear_ILD_path与mla_ILD_path也都指向 64K 阶段的产出验证了这种接力式训练思路。核心架构25% MLA 75% GDN 的混合注意力为什么模型叫7MLA21GDN因为它把 28 层 Transformer 拆成了两套注意力机制7 层 MLA层号 1、5、9、13、17、21、25占 25%Multi-head Latent Attention通过低秩压缩q_lora_rank: 1344、kv_lora_rank: 256大幅减少 KV Cache 占用是长上下文的内存救星21 层 GDN其余 75%基于 Mamba 风格的线性注意力linear_type: gdn含ssm_cfg状态空间配置让序列长度与计算量近似线性关系。这种稀疏注意力 线性注意力的混合设计在 hybrid_config.json 中可以看到完整的维度参数head_dim: 128、gdn_num_heads: 6、gdn_head_dim: 256等正是它让 1M 上下文在 8 卡环境下成为可能。1M上下文的关键RoPE长度扩展factor32从 32K 到 1M位置编码是绕不开的坎。项目采用YaRN 方式的 RoPE scalingoriginal_max_position_embeddings: 32768原始窗口factor: 32.032768 × 32 1048576恰好 1Mrope_type: yarn、rope_theta: 1000000值得注意的是训练器特意使用绝对步数 warmupwarmup_steps: 200。配置注释解释得很清楚——1M 数据打包后每轮只有约 20~160 条序列如果按比例warmup_ratio计算会出现 0~1 步的无效预热因此改为固定 200 步让 RoPE 扩展后的注意力有真正的呼吸窗口。这个细节非常值得新手学习。训练配置逐项解析关键超参数一览zebra_7MLA21GDN_noT_SFT_1M_combined_fCE.yaml 中的关键训练参数参数数值说明max_seq_length1048576训练上下文长度 1Mper_device_train_batch_size2单卡 batch sizegradient_accumulation_steps1关闭梯度累积learning_rate6.0e-05学习率lr_scheduler_typecosine余弦退火warmup_steps200绝对预热步数num_train_epochs1训练 1 个 epochbf16true混合精度训练fused_linear_cross_entropytrue融合 CELigeruse_flash_attention_2trueFlash Attention 加速with_distill / ILDfalse无教师蒸馏由于 1M 上下文显存压力巨大配置里关闭了梯度累积gradient_accumulation_steps: 1并依赖 Flash Attention 2 与融合交叉熵降低显存与计算开销。启动命令也很有讲究需要上下文并行context parallelsize 8accelerate launch --config_file configs/fsdp_GDN_tp_cp.yaml \ train_hybrid/train_distill.py configs/qwen3_1.7B/zebra_7MLA21GDN_noT_SFT_1M_combined_fCE.yaml训练数据5大数据集混合dataset_mixer中混合了 5 个高质量数据集数学与长文本对话并重JunxiongWang/sftdatasetv3通用 SFTamd/OpenMathInstruct-2_ZebraLlama_2M数学指令amd/Zebra_Llama_OpenThoughts-114k-math思维链数学amd/OpenR1-Math-220KR1 数学蒸馏amd/Zebra_Llama_ChatQA2-Long-SFT_long_sft_QA长文本问答Chat 模板使用 Qwen 标准的|im_start|/|im_end|格式完整定义见 chat_template.jinja分词器相关配置在 tokenizer_config.json。训练结果真实数据说话根据 train_results.json 与 trainer_state.json 的记录本次 1M SFT 训练的成绩单相当漂亮最终训练损失0.3477从初始 1.60 左右一路下降收敛稳定总步数4978 步1 个 epoch训练样本约 2173 万条训练总时长约 298511 秒约 83 小时8 卡分布式训练总 batch size 16观察 trainer_state.json 中每 10 步的日志可以发现loss 在前 100 步内就从 1.6 快速降到 1.0 附近之后平稳波动最终稳定在 0.35 左右说明 RoPE 长度扩展与混合注意力在 1M 窗口下训练是稳定且有效的。项目模型说明与框架版本等元信息可在 README.md 中查看。给新手的三点学习建议循序渐进长上下文训练必须像本项目的32K → 64K → 1M一样渐进一步到位只会让模型崩溃关注细节warmup 从比例改为绝对步数、关闭梯度累积、开启融合 CE这些小改动在 1M 场景下都是生死攸关的大决策善用混合注意力纯稠密注意力在超长序列下内存爆炸MLA GDN 这类混合架构是平民硬件玩转百万上下文的现实路径。zebra_qwen3_7MLA21GDN_noT_SFT_1M_combined_fCE 用一份完整、可复现的配置把如何训练 1M 上下文模型这道难题的答案完整呈现了出来。无论你是想复现实验、研究混合注意力架构还是单纯想学习长上下文 SFT 的最佳实践这份开源配置都值得你仔细研读。【免费下载链接】zebra_qwen3_7MLA21GDN_noT_SFT_1M_combined_fCE项目地址: https://ai.gitcode.com/hf_mirrors/amd/zebra_qwen3_7MLA21GDN_noT_SFT_1M_combined_fCE创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表