尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

(二)数据介绍

(二)数据介绍 1. Tokenizer分词器可以粗略理解成 LLM 使用的一本“词典”负责把自然语言映射成 token id再把 token id 解码回文本项目中也提供了train_tokenizer.py作为词表训练示例。不建议重新训练 tokenizer因为词表和切分规则一旦变化模型权重、数据格式、推理接口与社区生态的兼容性都会下降也会削弱模型的传播性。同时tokenizer 还会影响 PPL 这类按 token 统计的指标因此跨 tokenizer 比较时BPBBits Per Byte往往更有参考价值可参考这篇。 对 MiniMind 这类小模型来说词表大小还会直接影响 embedding 层和输出层的参数占比因此保持词表精简通常是更合适的取舍。2. Pretrain数据MiniMind-3 当前主线预训练数据为pretrain_t2t.jsonl / pretrain_t2t_mini.jsonl。这两份数据已经整理成统一的 text - next token prediction 训练格式目标是在较小算力下兼顾文本质量长度分布中英混合能力与后续 SFT / Tool Calling / RLAIF 阶段的模板衔接。数据来源包括但不限于通用文本语料、对话整理语料、蒸馏补充语料以及各类宽松开源协议可用的数据集主线数据会在清洗、去重、长度控制与格式统一后再进入训练。主要来源包括匠数大模型数据集、Magpie-Align 等公开数据源。其中• pretrain_t2t_mini.jsonl 更适合快速复现• pretrain_t2t.jsonl 更适合完整训练 MiniMind-3 主线模型。文件数据格式为{text: 如何才能摆脱拖延症治愈拖延症并不容易但以下建议可能有所帮助。} {text: 清晨的阳光透过窗帘洒进房间桌上的书页被风轻轻翻动。} {text: Transformer 通过自注意力机制建模上下文关系是现代大语言模型的重要基础结构。}3. SFT(Supervised Fine-Tuning)数据MiniMind-3 当前主线 SFT 数据为sft_t2t.jsonl / sft_t2t_mini.jsonl。相比更早期的 sft_512 / sft_1024 / sft_2048 方案当前版本更强调统一模板更适合对话 思考标签 Tool Calling 的混合训练尽量减少数据预处理分叉降低复现成本。其数据来源包括但不限于高质量指令跟随数据、公开对话数据、模型蒸馏合成数据以及协议友好的开源数据集在进入 t2t 主线前会统一为当前仓库使用的多轮对话格式。当前主线中也包含大量合成数据例如本人基于 qwen3-4b合成的约 10w 条 tool call 数据以及 qwen3 系列的 reasoning 数据等。其中社区主要来源有匠数大模型数据集、Magpie-Align、R1-Distill-SFT、COIG、Step-3.5-Flash-SFT 等。公布版本会确保数据来源与处理链路符合对应开源协议的可传递性约束并遵守 Apache-2.0、CC-BY-NC-2.0 等相关协议要求。其中sft_t2t_mini.jsonl适合快速训练对话模型sft_t2t.jsonl适合完整复现主线版本toolcall 能力已经并入主线 SFT 数据。所有 SFT 文件数据格式均为包含对话数据、Tool Use 数据{ conversations: [ {role: user, content: 你好}, {role: assistant, content: 你好}, {role: user, content: 再见}, {role: assistant, content: 再见} ] } { conversations: [ {role: system, content: # Tools ..., tools: [...]}, {role: user, content: 把你好世界翻译成english}, {role: assistant, content: , tool_calls: [{\name\:\translate_text\,\arguments\:{\text\:\你好世界\,\target_language\:\english\}}]}, {role: tool, content: {\translated_text\:\Hello World\}}, {role: assistant, content: Hello World} ] }4. RL 数据Permalink: Ⅳ RL 数据MiniMind 当前主线 RL 数据为dpo.jsonl。数据抽样自 DPO-En-Zh-20k。主线中会将这部分样本统一重组为当前仓库使用的偏好学习格式用于奖励模型或偏好优化阶段训练其中 chosen 表示更符合偏好的回复rejected 表示相对较差的回复。其中 dpo.jsonl 数据格式为{ chosen: [ {content: Q, role: user}, {content: good answer, role: assistant} ], rejected: [ {content: Q, role: user}, {content: bad answer, role: assistant} ] }除此之外其他 RL 数据与 SFT 数据格式保持一致通常是从 SFT 数据中按总长度和对话轮次筛选得到并将最后一个 assistant 位置留空供 rollout 阶段续写使用。5. MiniMind 训练数据集Note当前主线训练所需的核心数据集已开源因此无需再自行预处理大规模数据集避免重复性的数据处理工作。MiniMind训练数据集下载地址 GitHub - jingyaogong/minimind: Train a 64M-parameter LLM from scratch in just 2h! · GitHub将下载的数据集文件放到./dataset/目录下✨为推荐的必须项./dataset/├── agent_rl.jsonl (86MB)├── agent_rl_math.jsonl (18MB)├── dpo.jsonl (53MB)├── pretrain_t2t_mini.jsonl (1.2GB, ✨)├── pretrain_t2t.jsonl (10GB)├── rlaif.jsonl (24MB, ✨)├── sft_t2t_mini.jsonl (1.6GB, ✨)└── sft_t2t.jsonl (14GB)
返回列表