多模态大模型实战13

发布时间:2026/7/23 14:01:08

多模态大模型实战13 第13章 多模态RAG——图文检索增强生成学习目标回顾RAG基础原理掌握多模态RAG架构(混合索引、跨模态检索)了解多模态嵌入模型端到端实战:图文混合知识库问答13.1 RAG基础回顾纯文本RAG用户问题 → 文本嵌入 → 向量检索 → 召回文档片段 → LLM生成答案为什么需要多模态RAG很多知识存在于图表、图片、PDF扫描件中,纯文本RAG无法利用这些信息。13.2 多模态RAG架构三种架构1. 文本优先图片 → VLM描述 → 文本嵌入 → 文本向量库 → LLM最简单,但图片信息在描述过程中有损。2. 多模态嵌入图片/文本 → 多模态嵌入模型 → 统一向量空间 → 检索 → LLM无损,但需要多模态嵌入模型。3. 原生多模态图片

相关新闻