尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

解密Prompt系列16. LLM对齐经验之数据越少越好?LTD LIMA AlpaGasus

解密Prompt系列16. LLM对齐经验之数据越少越好?LTD  LIMA  AlpaGasus 前言LLM Agent中间插个队总结下指令微调、对齐数据相关的方案已经凑够7篇论文可以召唤神龙啦论文都是以优化指令样本为核心Data-Centric的观点比较一致指令微调也就是对齐阶段的数据质量数量少量多样高质量的对齐数据就能让你快速拥有效果杠杠的模型。注意以上三者是充分必要关系不是说数据越少越好是三者的有机统一。如果你对指令微调还不甚了解建议先看看下解密Prompt系列4. 升级Instruction Tuning。当前对指令微调部分的普遍认知有两个思路抽象派把模型输出和人类偏好进行对齐务实派赋予模型任务指令的理解和完成能力两个思路其实殊途同归重心落在任务对齐既基于用户指令应该召回模型预训练学习的哪些知识以及把这些知识用什么样的格式和风格进行输出类似于把预训练学习的知识重新排列组合并输出。可以类比探测Bert Finetune对向量空间的影响只不过指令微调调整的高维空间更加细分多样。于是才有本章的讨论那我们构建质量更高覆盖范围更广的数据是否比随机造大量的指令数据效果要更好。毕竟你抖音刷1000条杂七杂八的中医养生小知识可能比不上精读黄帝内经神农本草不是~LIMA论文LIMA: Less Is More for Alignment要点人工构建1K高质量样本用于对齐高质量主要指输出的风格一致性以及输入的多样性LIMA是比较早提出Quality Over Quantity观点的论文。论文提出一个假设是模型的知识和能力几乎全部是预训练阶段注入的。而指令微调阶段的对齐只是学习和人类交互的回答形式。因此一个输入多样输出形式一致的高质量指令数据集能帮模型快速学到回答形式。指令数据集的构建方式是人工从Stack Exchange wikiHow和Reddit里面分类筛选更高质量的问题和回答来构建指令样本集。我们具体说下Stack Exchange样本的构建其他两个思路是一致的分类采样: 为了保证多样性把Stack的分成75个科学类别和99个其他类别从每个类别中采样200个问题筛选为了保证质量在以上每个类别中筛选问题评分最高的再筛选该问题中回答得分最高的过滤为了保证输出的一致性过滤太长(4096字符)/太短1200字符的回答过滤以第一人称回答或者引用了其他回答的内容。以及对内容进行清洗只保留代码和文本部分。样本构建随机使用问题的标题或者描述作为输入使用回答做为输出。除了使用已有的QA数据几位作者还人工构建了200条基于个人偏好随机创建的prompt以及编写的回答在回答编写过程中核心是注意回答风格的一致性。重要的事情说三遍一致性一致性一致性。论文反复强调一致的回答风格可以加速模型收敛。论文使用的是65B的LLAMA模型1000条样本微调了15个epochlr1e-5, batch32, max_seq_len 2048。最终是人工在验证集打分上选择了5-10个epoch之间的checkpoint。论文针对数据集的质量数量和多样性进行了消融实验如下图多样性相似质量和数量输入指令多样性更高的stack exchange的效果优于输入相对单一的wikiHow数据集质量同等量级上过滤后质量更高的stack Exchange数据集微调的效果更好数量从质量过滤后单一的stack exchange中采样更高量级的训练样本并不能显著带来效果提升。之前公认的样本数量越多越好可能更多是数量提升带来的指令多样性提升。当然论文选择的样本数本身并无非常大的参考意义因为这个选择的基座模型模型大小数据本身的多样性都相关所以需要具体模型具体分析。ALPAGASUS论文AlpaGasus: Training A Better Alpaca with Fewer Data代码https://lichang-chen.github.io/AlpaGasus/数据: https://github.com/gururise/AlpacaDataCleaned/要点模型自动化筛选高质量指令微调样本论文起名终于从和动物纠缠不清到开始上天入地模型起名AlpaGasusAlpacaPegasus故名飞天羊驼哈哈最近总会让人不由自主想到飞天茅台对比LIMAALPAGASUS没有对什么是高质量进行很明确的定义但是提出了自动化样本过滤的方案成本更低更简单粗暴。从原始52K的ALPACA样本中使用大模型自动筛选高质量的9K样本进行模型微调。论文在以下4个测试集上进行评估使用GPT-4给原始Alpaca和飞天羊驼进行偏好打分胜率如下在不同量级的训练样本上飞天羊驼以80%的胜率超越Alpaca当训练样本在9K左右的时候胜率最高~自动样本过滤机制比较简单就是使用如下Prompt让Chatgpt给(instruction, input, response)的三元组样本进行打分并根据最终的打分分布选定4.5分作为阈值筛选打分4.5的9K样本用于下游模型微调。论文还进行了消融实验对比了不同的筛选阈值得到的不同训练样本量的影响3k/6k/9k中9K的样本量级模型效果最好但超过后模型效果会有下降。延伸下大概就是高质量的数据越多越好但低质量的数据越少越好。同时对比了随机采样9K作为作为对照组效果是显著差于使用模型打分筛选出的9K样本。自动化数据筛选看起来非常美好且梦幻但笔者本人有一个疑问论文使用chatgpt来筛选样本又用GPT4作为评估是否会引入bias这个bias主要来自chatgpt和gpt4相对一致的偏好。这一点除非引入人工评估或者多个大模型例如Claude之类同时进行最终的评估打分否则个人感觉可能出现妈妈看自己的孩子咋看都好看的情况…LTD论文Maybe Only 0.5% Data is Needed: A Preliminary Exploration of Low Training Data Instruction Tuning要点聚类过滤相似度高的样本筛选多样性样本用于对齐LTD的样本筛选中心放在多样性在任务微调上只使用0.5%的训练样本还比原有效果提升了2%。论文对多样性给出了更形象的描述就是用最少的样本去近似刻画当前全部指令集的空间分布。这么一描述其实答案已经呼之欲出了跑不了clusterKNNk-center这些方案论文实现如下具体分成3个步骤Sample embedding: 把指令样向量化这里论文是把指令回答一同输入BERT模型进行编码并且做了l2正则化这样后续聚类计算距离就可以直接使用cosine距离Clustering作者使用K-Means对所有指令样本进行聚类不过个人更偏好aggolomerative clustering,毕竟k-means是密度聚类而层次聚类是基于距离的在文本聚类中距离是有明确含义的可以更好保证不同cluster直接的粒度相对一致Corest Sampling基于聚类结果选择有代表性的样本来构建指令集。我本以为论文会直接从每个cluster动进行随机采样意料之外的是论文采用了贪心的K-center算法来选取更有代表性的数据点算法如下。目标是找到K的中心点使得所有点到距离最近的中心点的距离之和最小化。实现是先用聚类中心点作为起始中心点遍历所有其他点找到离所有起始点距离最远的点把这个点也加入中心点然后多次重复以上过程。除了以上介绍的论文之外还有几篇论文思想也或有相似包括以下Reference中的InstructionGPT-4把多样性和质量进行综合打分的多模态微调模型Instruction Minning 使用指令评估集推理Loss来对指令数据进行高质量筛选的Polite Flamingo通过改写和重构构建高质量多模态模型输出数据Textbooks编程任务上构建教科书级别质量的预训练数据和对应的习题集数据用于微调效果显著超越StarCoder最后感谢你们的阅读和喜欢我收藏了很多技术干货可以共享给喜欢我文章的朋友们如果你肯花时间沉下心去学习它们一定能帮到你。因为这个行业不同于其他行业知识体系实在是过于庞大知识更新也非常快。作为一个普通人无法全部学完所以我们在提升技术的时候首先需要明确一个目标然后制定好完整的计划同时找到好的学习方法这样才能更快的提升自己。这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】一、全套AGI大模型学习路线AI大模型时代的学习之旅从基础到前沿掌握人工智能的核心技能二、640套AI大模型报告合集这套包含640份报告的合集涵盖了AI大模型的理论研究、技术实现、行业应用等多个方面。无论您是科研人员、工程师还是对AI大模型感兴趣的爱好者这套报告合集都将为您提供宝贵的信息和启示。三、AI大模型经典PDF籍随着人工智能技术的飞速发展AI大模型已经成为了当今科技领域的一大热点。这些大型预训练模型如GPT-3、BERT、XLNet等以其强大的语言理解和生成能力正在改变我们对人工智能的认识。 那以下这些PDF籍就是非常不错的学习资源。四、AI大模型商业化落地方案五、面试资料我们学习AI大模型必然是想找到高薪的工作下面这些面试题都是总结当前最新、最热、最高频的面试题并且每道题都有详细的答案面试前刷完这套面试题资料小小offer不在话下。这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】
返回列表