尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

2024 人工智能最前沿:分享几个大模型(LLMs)的热门研究方向

2024 人工智能最前沿:分享几个大模型(LLMs)的热门研究方向 引言在人工智能领域大模型的研究正迅速发展当前涵盖了很多个研究方向每个方向都带有其独特的研究重点和挑战。下面给大家盘点几个比较热门的研究方向主要包括检索增增强生成RAG、大模型Agent、Mamba、MoE、LoRA等这些些研究方向旨在解决大模型在实际应用中的关键问题提高性能和实用性。希望给正在找研究方向的小伙伴一些启发。检索增强生成RAG检索增强生成RAG通过结合信息检索和文本生成来提高AI系统的性能。RAG的核心优势在于它能够利用外部知识库来辅助生成过程从而提高生成内容的准确性和鲁棒性。结合大模型强大的生成性能使得RAG在问答系统、文档生成、自动摘要、智能助手、信息检索和知识图谱填充等多种自然语言处理任务中都能发挥作用。研究重点包括**「检索器与生成器的集成」、「跨模态应用和知识更新」。面临的挑战是如何提高「提高检索效率」、「增强生成质量」、「跨领域应用」**等。近年来人工智能大模型在多种任务上展现了令人瞩目的能力但在知识整合和长期记忆方面大模型仍存在显著缺陷。为此OSU斯坦福作者提出了一个新思路让大模型也拥有一个像人脑海马体一样的记忆操作系统。借鉴海马体在人脑记忆中的关键作用设计了一个名为HippoRAG的新型检索增强模型。实验表明装备了这一类脑记忆系统的大模型在多种需要知识整合的任务中展现出了惊人的性能提升。AI2提出了一种自适应QA问答框架Adaptive-RAG该框架涵盖各种策略简单复杂的都有该框架可根据请求的复杂性动态的选择合适的策略旨在提升检索增强大模型得处理不同复杂请求的响应准确性提高了QA问答的效率。如果仅仅依赖大模型本身的参数知识来进行文本生成那么大模型会不可避免的产生模型幻觉。为此人们将检索增强生成RAG作为大模型文本生成的辅助方法但是RAG方法的准确性依赖于检索文本的准确性当检索出现问题时那么生成文本的准确性将难以保证为此中科大提出纠正检索增强生成CRAG旨在提高文本生成的鲁棒性。Infineon提出RAG-Fusion它是一种结合了RAG和 Reciprocal Rank FusionRRF的技术。具体来说首先通过指令遵循模型生成多个请求然后对每个生成的请求进行矢量搜索以从预定义的集合中检索相关文档接着应用倒数排名融合算法根据多个请求之间的相关性对文档重新排名最后生成重新排序的文档组列表。Amazon提出了一种新方法SYNTHESIZRR用于改进大模型LLMs在分类任务中的微缩化过程。传统方法通过few-shot提示生成数据集但存在重复和偏见问题。SYNTHESIZRR通过检索增强引入多样性「使LLM根据不同内容生成更多样化的示例」。SYNTHESIZRR在提升词汇和语义多样性、模仿人类文本以及提高模型微缩化性能方面均优于传统方法。大模型Agent今年年初业内大佬吴恩达表示大模型Agent是为来大模型大发力点。随着大模型应用场景越来越复杂化单纯依赖大模型的能力将面临巨大的挑战为此用好大模型能力构建大模型Agent将是大势所趋。微软研究人员也深入探讨了Agent AI的基础强调了智能Agent在物理、虚拟现实、混合现实、感官交互等方面的能力并指出Agent AI或是下一代人工智能的关键。其研究重点在于「多任务学习」、「常识推理和持续学习」旨在提高Agent在广泛任务上的表现和适应性。智谱提出新型自动化网页导航AgentAUTOWEBGLM 本文提出了一个名为AUTOWEBGLM的新型自动化web导航Agent它通过简化网页内容和使用AI技术来解决现有web Agent处理真实网页时的挑战。AUTOWEBGLM通过特别设计的算法来表示网页保留重要信息并利用混合人工智能方法进行训练。此外该Agent通过强化学习和拒绝采样技术来提高对网页的理解能力和执行任务的效率。微软提出自动软件开发框架AutoDev这是一个完全自动化的AI驱动软件开发框架旨在自主规划和执行复杂的软件开发任务。AutoDev可以让用户定义复杂的软件工程目标并将这些目标分配给AutoDev的自主Agent来实现。这些Agent可以在代码库上执行多种操作包括文件编辑、检索、构建过程、执行、测试和Git操作。Google提出了SceneCraft它是一个创新的大语言模型Agent能够将文本描述转换成可在Blender中执行的Python脚本用于创建复杂的3D场景。它通过高级抽象、战略规划和库学习来解决空间规划和布局的复杂性。生成模型在软件工程中的应用已经取得了显著成果尤其是在代码生成和调试任务中。尽管如此这些模型在自动生成代码文档方面的潜力还未被充分挖掘。为此清华开发了REPOAGENT这是一个基于大型语言模型的开源框架专门用于自动生成、维护和更新代码文档。通过一系列的评估包括定性和定量分析我们证明了REPOAGENT在创建高质量的代码仓库文档方面的能力。本文研究是关于怎么让那些大型的语言模型比如ChatGPT和GPT-4变得更厉害特别是在处理那些复杂和需要多种技能的任务上。为此清华开发了GITAGENT它可以让模型自己从GitHub上找到合适的代码库然后加到自己的工具箱里。GITAGENT工作的时候会分四个步骤如果遇到问题它还会去GitHub上看看别人是怎么解决的学习经验。对于大语言模型的规划和推理能力不同的人有不同的看法。「亚利桑那州立大学研究人员的核心观点是大语言模型LLMs自身无法进行规划推理」但是却能在解决规划问题上发挥积极的作用。为此作者还提出了一个新的LLM-Modulo框架这个框架把大型语言模型和一些外部的验证工具结合起来使LLMs在规划任务中发挥了重要作用。MambaMamba是一种选择性结构状态空间模型Selective Structured State Space Model其优势是能在长上下文任务上实现线性时间的推理、并行化训练和强大的性能。该技术最早由CMU提出Mamba通过全局感受野和动态加权缓解了卷积神经网络的建模约束并提供了类似于Transformers的高级建模能力同时避免了与Transformer相关的二次计算复杂性。其研究方向集中在提高**「长序列数据处理能力」、「多模态数据处理」和「计算效率」**等。近日波兰研究团队给出的研究成果是 MoE-Mamba即将 Mamba 和混合专家层组合起来的模型。MoE-Mamba 能同时提升SSM 和 MoE 的效率。而且该团队还发现当专家的数量发生变化时MoE-Mamba 的行为是可预测的。中科大等研究人员将Mamba与视觉研究结合起来提出了Vim架构在 ImageNet 分类任务、COCO 对象检测任务和 ADE20k 语义分割任务上与 DeiT等成熟的视觉 Transformers 相比Vim 实现了更高的性能同时还显著提高了计算和内存效率。例如在对分辨率为 1248×1248 的图像进行批量推理提取特征时Vim 比 DeiT 快 2.8 倍并节省 86.8% 的 GPU 内存。华为诺亚方舟实验室的研究者提出了 DenseMamba用于增强 SSM 中各层间隐藏信息的流动。通过将浅层隐藏状态有选择地整合到深层中DensessM 保留了对最终输出至关重要的精细信息。DenseSSM 在保持训练并行性和推理效率的同时通过密集连接实现了性能提升。该方法可广泛应用于各种 SSM 类型如 Mamba 和 RetNet。浙大将Mamba与多模型大模型结合提出了Cobra一个具有线性计算复杂度的MLLM它将Mamba语言模型整合到了视觉模态中。实验结果显示Cobra在性能上与最先进的方法相当速度更快尤其在处理视觉错觉和空间关系判断方面表现突出。cobra的参数量只有LLaVA的43%但性能相当。AI21 Labs 推出并开源了一种名为Jamba的新方法在多个基准上超越了 transformer。Mamba 的 SSM 架构可以很好地解决 transformer 的内存资源和上下文问题。然而Mamba 方法很难提供与 transformer 模型相同的输出水平。Jamba 将基于结构化状态空间模型 (SSM)的 Mamba 模型与 transformer 架构相结合旨在将 SSM 和 transformer 的最佳属性结合在一起。结果表明:Jamba 在长上下文上的吞吐量达到了 Mixtral 8x7B 的3倍。Jamba 比 Mixtral 8x78 等大小相当的基于Transformer 的模型更高效。大模型高效微调(LoRA)大模型在微调过程中可以采取不同的策略主要分为全量微调和参数高效微调两大类。全量微调涉及对预训练模型的所有参数进行调整需要大量的计算资源并有可能导致灾难性遗忘即在提升特定任务性能的同时损失在其他领域的表现。为了解决这些问题参数高效微调PEFT技术通过仅更新模型中的一部分参数来减少训练时间和计算成本。PEFT包括多种方法如Prefix Tuning在输入前添加可学习的virtual tokens作为PrefixPrompt Tuning在输入层加入prompt tokensP-Tuning将Prompt转换为可学习的Embedding层并用MLPLSTM处理Adapter Tuning在模型层中插入小型神经网络模块以及LoRA在矩阵相乘模块中引入低秩矩阵来模拟full fine-tuning。这些技术旨在提高训练效率同时保持或提升模型性能。在广泛使用的参数高效微调(PEFT)方法中LORA 及其变体由于避免了额外的推理成本而获得了相当大的普及。LoRA显著降低了微调的成本同时获得与全模型微调相近的效果。所以LoRA的一些改进方法也层出不穷该方向也成了研究热点。该方向的研究重点主要在于**「参数效率」、「保微调策略」、「上下文扩展」、「模型压缩」**等。英伟达提出了权重分解低阶适应(DORA)增强了 LoRA 的学习能力和训练稳定性同时避免了任何额外的推理开销。实验表明DORA 在各种下游任务上的模型微调都要优于LORA。华盛顿大学提出了QLORA该算法在保持完整的16位微调任务性能的情况下可以实现单卡48G GPU微调650亿参数的大模型作者公布了他们训练的系列模型Guanaco与之前公开发布的所有模型相比在Vicuna基准测试中表现更好只需要在单个GPU上微调24小时就能达到ChatGPT性能水平的99.3%。MIT为了扩展Token上下文长度提出了LongLORA微调算法它能够在资源受限的情况下极大的扩展预训练大模型(LLMS)的上下文长度LongLORA可以让LLaMA2-7B的上下文从4K扩展至100K。斯坦福提出了S-LORA它是专为众多 LORA 适配程序的可扩展服务而设计的系统它将所有适配程序存储在主内存中并将当前运行査询所使用的适配程序取到 GPU 内存中。S-LORA 能够以较小的开销在单个 GPU 或多个 GPU 上为数千个 LORA 适配器提供服务(同时为 2000 个适配器提供服务)并将增加的 LORA 计算开销降至最低。相比之下LLM-packed 需要维护多个权重副本并且由于 GPU 内存限制只能为少于5 个适配器提供服务。MoEMoE其实也不是一项新的技术了MoE全称为Mixed Expert Models。该项技术最早是由剑桥的研究人员在1991年的一篇文章“Adaptive Mixture of Local Experts”中提出。但是随着近年来大模型参数规模的不断拓展以及大模型多任务的应用该技术也成为了当前研究的热点。我们都知道随着模型参数规模的不断增大模型性能也会不断的提升并会出现涌现现象这也是当前大模型爆火的主要原因。然而如何在有限的计算资源预算下用更少的训练步数训练一个更大的模型呢那么MoE技术主要就是干这件事情的。MoE具有训练资源需求低、训练速度快、推理成本低、扩展性好以及具备多任务学习能力。它的一个显著优势是它们能够在远少于 Dense 模型所需的计算资源下进行有效的预训练。这意味着在相同的计算预算条件下您可以显著扩大模型或数据集的规模。特别是在预训练阶段与Dense 模型相比MoE模型通常能够更快地达到相同的质量水平。当前其研究重点主要集中在**「专家网络的协同」、「动态路由」、「专家激活率低」和「模型的可扩展性」**等方向。下面是一些最近的研究进展供大家参考2022年Google 提出的 Switch Transformers 一定程度缓解了模型复杂性高、下游任务微调不稳定等问题。Switch Transformers 简化了 MoE 路由算法设计了直观的改进模型降低了通信和计算成本。Switch Transformers 的训练方法减轻了不稳定性并且首次展示了用较低精度bfloat16格式训练大型稀疏模型的可能性。北大针对MoE路由机制进行了改进提出了一种新颖的动态Expert选择框架对于较难的任务本文方法会选择更多的Expert来处理对于简单的任务就用少些这样可以更有效地利用计算资源。实验结果表明:本文动态路由方法在各种基准测试中都要优于传统的Tp-2路由方法平均提高了0.7%同时激活的参数不到90%。微软针对MoE专家激活率低等问题提出了多头混合专家(MH-MOE)。MH-MOE 采用了多头机制可将每个输入 token 分成多个子 token。然后将这些子 token 分配给组多样化的专家并行处理之后再无缝地将它们整合进原来的 token 形式该方法专家激活率更高且扩展性更好并且具有更细粒度的理解能力。ByteDance针对大模型多模态场景提出了CuMo将MOE应用于多模态LLM该方法在视觉编码器和多层感知器(MLP)连接器中整合了Top-K稀疏门控MOE块有效提升了模型在多模态任务上的性能同时保持了较低的推理成本。在不同模型尺寸的多模态任务基准测试中达到了SOTA。最后的最后感谢你们的阅读和喜欢我收藏了很多技术干货可以共享给喜欢我文章的朋友们如果你肯花时间沉下心去学习它们一定能帮到你。因为这个行业不同于其他行业知识体系实在是过于庞大知识更新也非常快。作为一个普通人无法全部学完所以我们在提升技术的时候首先需要明确一个目标然后制定好完整的计划同时找到好的学习方法这样才能更快的提升自己。这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】## 大模型知识脑图为了成为更好的 AI大模型 开发者这里为大家提供了总的路线图。它的用处就在于你可以按照上面的知识点去找对应的学习资源保证自己学得较为全面。经典书籍阅读阅读AI大模型经典书籍可以帮助读者提高技术水平开拓视野掌握核心技术提高解决问题的能力同时也可以借鉴他人的经验。对于想要深入学习AI大模型开发的读者来说阅读经典书籍是非常有必要的。实战案例光学理论是没用的要学会跟着一起敲要动手实操才能将自己的所学运用到实际当中去这时候可以搞点实战案例来学习。面试资料我们学习AI大模型必然是想找到高薪的工作下面这些面试题都是总结当前最新、最热、最高频的面试题并且每道题都有详细的答案面试前刷完这套面试题资料小小offer不在话下640套AI大模型报告合集这套包含640份报告的合集涵盖了AI大模型的理论研究、技术实现、行业应用等多个方面。无论您是科研人员、工程师还是对AI大模型感兴趣的爱好者这套报告合集都将为您提供宝贵的信息和启示。这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】
返回列表