多模型大模型训练中的数据集构造总结)
InternVL基于互联网开源数据采集了6B数据经过滤后一阶段用了5B数据二阶段用了1B数据。SFT阶段用了4M数据二阶段的0.4%。InternVL1.5与上一版本相比扩大了训练数据集的纳入范围尤其是关于ORC任务进行了细粒度的划分并且设计了翻译流程补充中文语料训练数据的不足同时针对测试任务针对性设计了SFT数据。InternVL2基于1.5版本的数据集二次进行扩充同时构建了包含医疗领域的二阶段高质量训练数据。InternVL2.5 引入了有条件地应用JPEG 压缩图像分块控制在总体的训练数据规模上比v2模型多了近一倍同时由于tille数量的变化训练视觉token数提升的比例变得更大了。并提出了异常数据过滤.InternVL3主要描述将语言预训练与多模态对齐训练整合于同一预训练阶段混合输入多模态数据图文、视频文本等与大规模纯文本语料实现联合优化同步学习语言与多模态能力。InternVL3.5仅训练了1160M 样本250B token仅约InternVL1的1/5,但是在SFT阶段用了约600M样本。InternVL公开时间2024年1月15日仅介绍了其基于模型架构与训练步骤只说明数据均来自开源环境经过筛选后保留合格数据并未详细介绍数据处理流程。具体使用的数据集来源可以查看论文附录https://arxiv.org/pdf/2312.14238整体可以看到用了5B 图文多模态数据集一条图文对问题 回答 ≈200500 token取中间保守值1 条 ≈ 300 token5B 条样本 ≈5B × 300 1500B token训练与测试时具体数据集划分。InternVL1.5Pre-training Dataset.Fine-tuning Dataset.在微调阶段精心选择数据集以提高在各种多模态任务中的模型性能。表1b总结了本阶段使用的数据集。在表1中已经为每个数据集进行了语言注释。对于最初是英文的数据集作为“zh”的注释表示我们已经使用翻译pipeline将其翻译成中文。例如COYO [10]和GRIT [90]最初是英语数据集已经将它们翻译成了中文。总之这些数据集一起为微调建立了丰富和多样的基础这增强了我们的模型处理广泛的多模态任务的能力并确保其为实际应用做好了准备。Data Translation Pipeline为了增强模型的多语言功能 实现了一个翻译流程。该pipeline利用最先进的开源LLMs [4,11,130]或GPT-3.5将英语数据集转换为另一种语言如中文从而保持双语标签的一致性和精度。此外它可以通过调整语言提示符很容易地扩展到包含更多的语言而不依赖于手动注释过程。InternVL2并未介绍数据处理过程只介绍到是1.5版本的数据集扩展版InternVL2.5在 InternVL 2.0 和 2.5 中训练数据的组织由几个关键参数控制以优化训练期间数据集的平衡和分布。数据配比数据增强有条件地应用JPEG 压缩对图像数据集启用以增强稳健性对视频数据集禁用以保持一致的帧质量。最大图块数量该参数控制每个数据集的最大图块数。例如较高的值 24-36 用于多图像或高分辨率数据较低的值 6-12 用于标准图像1 用于视频。n_max重复系数重复因子调整数据集采样频率。低于 1 的值会降低数据集的权重而高于 1 的值会增加数据集的权重。这可确保任务之间的均衡训练并防止过拟合或欠拟合。在总体的训练数据规模上可以发现v2.5比v2模型多了近一倍同时由于tille数量的变化训练视觉token数提升的比例变得更大了。异常数据过滤作者发现 LLM 对数据噪声高度敏感即使是很小的异常如异常值【文本或图片】或重复数据也会在推理过程中引起异常行为。事实证明重复生成尤其是在长格式或 CoT 推理任务中特别有害。为了应对这一挑战并支持未来的研究作者设计了一种高效的数据过滤管道来去除低质量的样本。InternVL3https://hpg123.blog.csdn.net/article/details/156064158仅介绍了其基于原生多模态预训练将语言预训练与多模态对齐训练整合于同一预训练阶段混合输入多模态数据图文、视频文本等与大规模纯文本语料实现联合优化同步学习语言与多模态能力无需额外桥接模块或跨模型对齐流程即可高效处理跨模态任务。未透露数据处理流程。InternVL3.5数据总计约1160M 样本250B token纯文本 : 多模态 ≈ 1:2.5。覆盖图像描述、OCR、图表理解、医学等多领域。最大序列长度为32K。