尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

文本向量化Embedding

文本向量化Embedding 摘要Embedding文本向量化把文字变成一串数字让意思相近的文字数字也相近。用智谱 GLM 的embedding-3模型把几段文字转成向量再算余弦相似度理解语义距离。一、概念理解什么是向量数学概念向量vector就是一串带顺序的数字在几何里可以理解成从原点出发、有方向有长度的一个箭头。2 维向量[3, 4]平面坐标系里的一个点横着走 3、竖着走 4。3 维向量[1, 2, 5]空间里的一个点。embedding-3是 2048 维向量——就是 2048 个数字排成一排。我们很难想象 2048 维空间但计算机可以用它算距离。向量之间能算夹角。两个向量指向同一个方向夹角≈0°指向相反夹角≈180°。夹角越小说明它们在同一个方向上这是余弦相似度的几何来源。怎么理解向量化假如每个奶茶都用几个维度打分甜度、苦度、奶味、茶味、果味, 5 个维度就是 5 维向量。珍珠奶茶 → [8,1,9,6,2]奶绿 → [7,2,8,8,1]柠檬红茶 → [7,4,1,7,9]这串数字就是每个奶茶的味道向量。珍珠奶茶和奶绿向量接近味道像和柠檬红茶差距大。这样计算机就可以通过计算来判断奶茶更接近哪种类型。Embedding 模型干的事相当于有一张覆盖全人类语言的超维地图模型把每句话变成一个坐标点钉上去。意思相近的句子坐标挨得近八竿子打不着的坐标离得远。iPhone和苹果手机会被钉在相邻位置而它们和苹果水果之间隔着一条语义鸿沟。“向量化”就是把人靠感觉判断的像不像翻译成计算机靠算术判断的距离近不近。Embedding 是什么把一段文字压缩成一串固定长度的数字向量让计算机能用距离衡量两段文字的语义关系。意思越接近 → 向量夹角越小 → 余弦相似度越接近 1意思越远 → 夹角越大 → 余弦相似度越接近 0二、用智谱 GLM API 做向量化使用其他家向量模型也可以, 只是以智谱为例官方SDK示例, 见官方 Python SDK - 智谱AI开放文档文本嵌入部分# 基础文本嵌入 from zai import ZhipuAiClient client ZhipuAiClient(api_key”YOUR_API_KEY”) def embed(text: str): response client.embeddings.create( modelembedding-3, inputtext ) # 对于text是个列表的情况下 for i, embedding in enumerate(response.data): print(f文本{i1}的嵌入向量维度: {len(embedding.embedding)}) print(f前5个维度的值: {embedding.embedding[:5]}) # text列表长度是1 return response.data[0].embeddingembedding-3 默认输出2048 维向量对中文支持很好。三、算余弦相似度用 glm提供的库计算余弦相似度import numpy as np from sklearn.metrics.pairwise import cosine_similarity def calculate_similarity(texts): 计算文本间的相似度 response client.embeddings.create( modelembedding-3, inputtexts ) embeddings [data.embedding for data in response.data] embeddings_array np.array(embeddings) # 计算余弦相似度 similarity_matrix cosine_similarity(embeddings_array) return similarity_matrix也可以用 numpy库计算余弦相似度import numpy as np def cosine_sim(a, b): a, b np.array(a), np.array(b) return float(np.dot(a, b) / (np.linalg.norm(a) * np.linalg.norm(b)))测试效果对比s1 embed(苹果手机续航怎么样) s2 embed(iPhone电池能用多久) s3 embed(苹果好吃吗甜不甜) print(cosine_sim(s1, s2)) #0.78 一个意思距离很近 print(cosine_sim(s1, s3)) #0.21 都提到苹果但语义差远了 print(cosine_sim(s2, s3)) #0.19 基本不相干“苹果手机” vs “iPhone” 相似度 0.78远高于它们和苹果水果的 0.2 左右。这说明 Embedding 抓的是语义不是字面。这对做 RAG 检索是非常有帮助——用户问iPhone 怎么用能召回苹果手机使用技巧等相关文档。四、Embedding在RAG中很重要Embedding 出现在RAG环节中用户提问 →【向量化】问题 embedding-3 转成向量 →【向量检索】在知识库里找最相似的文档块靠余弦相似度排序 →【注入 Prompt】把召回的原文 问题一起喂给大模型 →【生成】模型基于资料作答没有 EmbeddingRAG 就退化成关键词匹配关键词匹配用户搜续航文档里写的是电池使用时间就搜不到。向量检索两者语义相近余弦相似度高这样就能召回。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】
返回列表