基于向量数据库与LLM的金融知识库问答系统实战

发布时间:2026/7/25 4:23:57

基于向量数据库与LLM的金融知识库问答系统实战 1. 项目背景与核心价值去年在做一个金融知识库项目时我深刻体会到传统关键词检索的局限性——当用户问美联储加息对科技股的影响时系统只能返回含有关键词美联储、科技股的文档而无法理解问题语义。这正是向量数据库结合大语言模型的用武之地。这个实战项目将带您构建一个能真正理解PDF文档内容的问答系统。其核心突破在于语义理解通过嵌入模型将文本转化为向量捕获加息→货币政策→股市波动等深层关联精准召回用向量相似度匹配替代关键词匹配找到真正相关的文档片段可信回答基于检索到的上下文生成回答避免大模型幻觉2. 技术架构解析2.1 系统组成模块graph TD A[PDF上传] -- B[文本提取] B -- C[文本分块] C -- D[向量嵌入] D -- E[向量存储] F[用户提问] -- G[问题向量化] G -- H[向量检索] H -- I[上下文组装] I -- J[LLM生成回答]2.2 关键技术选型2.2.1 向量数据库对比数据库写入速度查询性能内存占用适合场景Chroma★★★★★★★★★快速原型开发Milvus★★★★★★★★★★★★生产级海量数据Pinecone★★★★★★★★★★★全托管云服务Weaviate★★★★★★★★★★★多模态检索实战建议初期推荐Chroma轻量易用生产环境建议Milvus集群版2.2.2 嵌入模型选择通用领域text-embedding-ada-002OpenAI中文优化m3e-base中文语义匹配冠军模型领域专用在特定领域数据上微调BERT3. 完整实现流程3.1 环境准备# 推荐使用Python 3.10 conda create -n pdfqa python3.10 conda activate pdfqa # 核心依赖 pip install langchain0.0.340 pip install chromadb0.4.15 pip install pypdf3.17.0 pip install openai0.28.03.2 PDF处理流水线3.2.1 文本提取优化from pypdf import PdfReader def extract_text_with_metadata(pdf_path): reader PdfReader(pdf_path) meta reader.metadata text for page in reader.pages: # 保留页码信息便于溯源 text f【Page {page.page_number}】{page.extract_text()}\n\n return { text: text, source: pdf_path, title: meta.title or os.path.basename(pdf_path) }3.2.2 智能分块策略from langchain.text_splitter import RecursiveCharacterTextSplitter text_splitter RecursiveCharacterTextSplitter( chunk_size500, # 适合问答的片段长度 chunk_overlap50, # 避免关键信息被切断 length_functionlen, add_start_indexTrue # 记录块在原文中的位置 )3.3 向量化与存储3.3.1 嵌入处理from langchain.embeddings import OpenAIEmbeddings embeddings OpenAIEmbeddings( modeltext-embedding-ada-002, deploymentyour-deployment-name # Azure专用参数 )3.3.2 ChromaDB集成from langchain.vectorstores import Chroma vector_db Chroma.from_documents( documentssplit_docs, embeddingembeddings, persist_directory./chroma_db ) # 持久化到磁盘 vector_db.persist()3.4 问答链实现3.4.1 检索增强生成from langchain.chains import RetrievalQA from langchain.chat_models import ChatOpenAI qa_chain RetrievalQA.from_chain_type( llmChatOpenAI(temperature0), chain_typestuff, retrievervector_db.as_retriever( search_typesimilarity_score_threshold, search_kwargs{score_threshold: 0.7, k: 3} ), return_source_documentsTrue )3.4.2 结果后处理def format_response(result): answer result[result] sources {doc.metadata[source] for doc in result[source_documents]} return f{answer}\n\n参考资料{, .join(sources)}4. 生产级优化技巧4.1 性能提升方案批量处理优化# 启用并行嵌入 embeddings OpenAIEmbeddings(request_timeout60, max_retries5)缓存机制from langchain.cache import SQLiteCache import langchain langchain.llm_cache SQLiteCache(database_path.langchain.db)4.2 效果增强策略查询扩展from langchain.retrievers import ContextualCompressionRetriever from langchain.retrievers.document_compressors import LLMChainExtractor compressor LLMChainExtractor.from_llm(ChatOpenAI()) compression_retriever ContextualCompressionRetriever( base_compressorcompressor, base_retrievervector_db.as_retriever() )混合检索from langchain.retrievers import BM25Retriever, EnsembleRetriever bm25_retriever BM25Retriever.from_documents(docs) ensemble_retriever EnsembleRetriever( retrievers[vector_db.as_retriever(), bm25_retriever], weights[0.7, 0.3] )5. 常见问题排查5.1 典型错误与解决方案问题现象可能原因解决方案返回无关内容嵌入模型不匹配更换为领域专用模型回答存在幻觉检索阈值过低调整score_threshold≥0.7处理速度慢未启用批量处理配置batch_size32中文效果差使用英文嵌入模型切换为m3e-base中文模型5.2 监控指标建议检索质量命中率检索结果中有用文档比例平均相似度得分生成质量人工评估分数1-5分制幻觉出现频率# 自动化评估示例 def evaluate_retrieval(query, ideal_docs): retrieved retriever.get_relevant_documents(query) overlap set(ideal_docs) set(retrieved) return len(overlap)/len(ideal_docs)6. 进阶扩展方向多模态支持提取PDF中的表格数据使用camelot或tabula处理扫描件OCR版面分析对话记忆from langchain.memory import ConversationBufferMemory memory ConversationBufferMemory( memory_keychat_history, return_messagesTrue )权限控制基于元数据过滤部门/密级retriever vector_db.as_retriever( filter{department: finance} )这个项目最让我惊喜的是当我们将200份金融研究报告入库后系统能准确回答对比过去三次美联储加息周期中纳斯达克指数的表现差异这类复杂问题。关键在于分块时保持上下文完整如将整份报告的执行摘要作为单独块以及调整相似度阈值到0.75左右平衡查全率与准确率。

相关新闻