)
如何快速开始HRM-Text从零预训练1B基础模型的完整教程附命令清单【免费下载链接】HRM-TextHRM-Text is a 1B text generation model based on the HRM architecture, strengthened by task completion and latent space reasoning.项目地址: https://gitcode.com/gh_mirrors/hr/HRM-TextHRM-Text 是一个基于 HRM 层级循环架构的 1B 文本生成模型提供完整的大模型预训练框架——只需 16 张 H100 训练约 46 小时成本约 $1000就能从零预训练出在 GSM8k、MATH、MMLU 等 8 项基准上超越 Llama3.2 3B、Gemma3 4B 等更大模型的基础模型。本文将带你走完「数据准备 → 环境搭建 → 启动预训练 → 基准评估 → 格式导出」全流程文末附可直接复制的完整命令清单。先看效果HRM-Text 1B 用 1/130 的训练成本超越 4B 模型上图来自官方基准测试HRM-Text 1B 仅训练 1.9 天16 卡、40B 唯一 token在 DROP82.2%、MMLU60.7%、MATH56.5%等任务上全面超越所有 4B 及以下模型ARC-C 和 MMLU 甚至高于 Olmo3 7B。它的高效来自几项关键技术的组合HRM 层级循环架构主干实现见 models/baselines/hrm_nocarry_bp_warmup.pyPrefixLM 序列打包提升 token 槽位利用率见 dataset_new.pyFlashAttention 3 内核双路 PrefixLM 注意力见 models/flash_attention_prefixlm_v2.pyFSDP2 分布式训练入口为 pretrain.py预训练资源清单1B 基础模型需要什么硬件规格参数量GPU 配置训练时长预估成本L0.6B8×H100单节点~50 小时~$800XL1B16×H100双节点~46 小时~$1472⚠️ 需要 Hopper 级别 GPU如 H100因为注意力路径依赖 FlashAttention 3。第一步准备预训练数据HRM-Text 从data_io流水线产出的已分词数据中训练流程是清洗 → 分词 → 分层采样再让训练直接读取采样输出。两种推荐部署方式单节点数据流水线和训练同机采样结果写入本机共享内存/dev/shm/sampled多节点分词数据放共享存储各节点挂载同一目录后独立执行采样——采样快速且确定性各节点得到的内存数据完全一致cd DATA_IO_PATH python sample_tokenized.py epochs4 output_path/dev/shm/sampled show_analytics.md 注意epochs必须与训练配置一致默认 4见 config/cfg_pretrain.yaml。第二步最快搭建训练环境Docker 一键启动官方提供了包含完整环境的 Docker 镜像CUDA 12.8 PyTorch FlashAttention 3这是最省心的方式git clone https://gitcode.com/gh_mirrors/hr/HRM-Text cd HRM-Text docker run --gpus all --ipchost --networkhost -it \ -v $PWD:/workspace \ sapientai/hrm-text:latest多节点训练时把相同的共享工作区挂载到每个节点代码、分词数据、checkpoint 目录保持相同路径推荐的布局/shared/ |-- HRM-Text/ |--- checkpoints/ |-- data_io/不用 Docker 的替代方案先安装 PyTorch、CUDA、FlashAttention 3已验证版本记录在 docker/Dockerfile再安装 Python 依赖pip install -r requirements.txt启动训练前还差两件小事验证分布式通信多节点场景先用torchrun确认各节点能正常初始化登录 WB训练指标记录wandb login无头环境用wandb login API_KEY第三步启动预训练L 与 XL 参考命令L0.6B单节点 8×H100OMP_NUM_THREADS1 MKL_NUM_THREADS1 \ torchrun --nproc_per_node8 pretrain.py arch/sizearchL lr2.5e-4 global_batch_size172032XL1B双节点在每台节点上运行替换NODE_RANK等占位符OMP_NUM_THREADS1 MKL_NUM_THREADS1 \ torchrun \ --nproc_per_node8 \ --nnodes2 \ --node_rankNODE_RANK \ --master_addrMASTER_ADDR \ --master_portMASTER_PORT \ pretrain.py✅ checkpoint 每个 epoch 自动保存到checkpoints/多节点时每个节点只保存自己的分片建议挂载共享存储所有超参数都支持 Hydra 命令行覆盖例如训练纯 Transformer 基线对比arch/netarchtransformer架构预设位于 config/arch/nethrm / transformer / trm / rins / ut尺寸预设位于 config/arch/sizeB / L / XL / XXL / XXL_wide第四步跑基准测试验证模型效果python -m evaluation.main ckpt_pathcheckpoints/...评估只需1 张 80GB GPU显存不足时追加generation_config.batch_size16降低批量只跑指定基准追加run_only[MATH,DROP,ARC,MMLU]基准数据由 Hugging Face datasets 按需自动下载评估引擎与配置分别见 evaluation/main.py 和 evaluation/config。第五步导出为 Hugging Face Transformers 格式python -m conversion.convert_to_hf \ --ckpt_path checkpoints/... \ --out_dir OUTPUT_PATH若 checkpoint 中存在 EMA 权重评估和导出默认使用 EMA。转换实现见 conversion/convert_to_hf.py。附录完整命令清单按顺序复制即可# 1) 克隆代码 git clone https://gitcode.com/gh_mirrors/hr/HRM-Text cd HRM-Text # 2) 数据分词后分层采样在 data_io 仓库中执行 python sample_tokenized.py epochs4 output_path/dev/shm/sampled # 3) 环境启动官方 Docker 镜像 docker run --gpus all --ipchost --networkhost -it \ -v $PWD:/workspace sapientai/hrm-text:latest # 4) 登录 WB wandb login # 5) 预训练L 规格单节点 8×H100 OMP_NUM_THREADS1 MKL_NUM_THREADS1 \ torchrun --nproc_per_node8 pretrain.py arch/sizearchL lr2.5e-4 global_batch_size172032 # 6) 评估最新 checkpoint python -m evaluation.main ckpt_pathcheckpoints/... # 7) 导出为 HF 格式 python -m conversion.convert_to_hf --ckpt_path checkpoints/... --out_dir OUTPUT_PATH跑完这 7 步你就已经拥有了一个从零预训练的 1B 基础模型 。如果想进一步用指令数据微调SFT可参考 scripts/prepare_sft_data.py 和cfg_sft配置继续继续训练。【免费下载链接】HRM-TextHRM-Text is a 1B text generation model based on the HRM architecture, strengthened by task completion and latent space reasoning.项目地址: https://gitcode.com/gh_mirrors/hr/HRM-Text创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考