尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

AI人工智能的基础概念

AI人工智能的基础概念 一、 基础概念大模型的核心基石LLM大语言模型, Large Language Model基于海量文本数据训练出的超大规模神经网络模型。它能够理解人类语言并根据上下文预测接下来的文本。Token词元大模型处理文本的基本单位。一句话会被切分成若干 Token1 个 Token 大致相当于 0.75 个英文单词或 0.5-0.8 个汉字。大模型的计费和处理上限均以 Token 为单位。Embedding向量化/语义嵌入将高维的人类文字、图片或音频转化为一串高维数值向量如[0.12, -0.85, 0.43, ...]。通过计算向量之间的距离大模型能够精准理解“苹果”和“水果”在语义上的相似度而不是死板地匹配字面字符。Context Window上下文窗口大模型单次对话能够同时接收并处理的最大 Token 数量包含输入的提示词与输出的回答。一旦超出行数上限模型就会“遗忘”最早的内容。Temperature采样温度控制模型输出随机性与创造力的参数通常取值 0 到 1。Temperature 接近 0输出非常确定、严谨适合代码生成、计算或事实回答。Temperature 接近 1输出更具随机性和创造力适合文案撰写或头脑风暴。幻觉Hallucination指大模型在缺乏事实依据的情况下一本正经地编造错误或不存在的信息。这是大模型基于概率预测下一个 Token 的固有特性所导致的。二、 核心架构让 AI 落地生产力的三大模式[ 用户提问 ] │ ├──► [ RAG ] ───► 查外部知识库/向量库 ────► 拼入上下文回答 │ ├──► [ Function Calling ] ──► 识别意图 ──► 调用外部 API/数据库 │ └──► [ Agent ] ──► 思路拆解 (ReAct) ──► 循环执行工具 ──► 交付最终结果RAG检索增强生成, Retrieval-Augmented Generation为了解决大模型“知识滞后”和“幻觉”问题RAG 在模型回答前先去外部企业知识库中检索相关文档将检索到的内容作为背景补充送给大模型让大模型“开卷考试”大幅提升回答的准确性。Function Calling函数/工具调用让大模型从“纯聊天”走向“能干活”的关键能力。模型可以根据用户意图自动识别出需要调用的外部 API 参数如查询天气、订机票、执行 SQL并输出结构化的 JSON 数据交由后端程序执行。Agent智能体 / ReAct 模式具备自治能力的 AI 系统。它采用ReActReasoning Acting思考与行动模式先思考下一步该做什么Reasoning接着调用工具执行操作Acting再根据工具返回的结果继续思考直到完成复杂的跨步骤任务。三、 工程组件与标准协议构建现代 AI 应用的积木向量数据库Vector Database专门用于高效存储和快速检索高维向量数据的数据库。在 RAG 场景中它是储存企业知识库向量的关键组件。Milvus高性能开源分布式向量数据库适合千万级至亿级海量向量场景。pgvectorPostgreSQL 的向量扩展插件允许开发者在现有的关系型数据库中直接进行向量检索极大地降低了中小项目的运维成本。Pinecone云原生全托管向量数据库开箱即用免去底层维护烦恼。重排序Reranker在 RAG 的粗检索阶段向量数据库会快速选出相关度较高的前 20~50 篇文档。Reranker 模型则会对这些文档进行更精细的语义二次打分与排序精简出最核心的 3~5 篇送给大模型大幅提升上下文质量。SSE / WebSocket 流式推送大模型生成文本需要时间。为了避免用户长时间面对空白屏幕等待前端通常采用SSEServer-Sent Events服务器发送事件或 WebSocket实现类似于打字机一样逐字实时显示回答的效果。MCPModel Context Protocol模型上下文协议由 Anthropic 倡导提出的开源统一接口协议。类似于硬件领域的 USB 接口它让各种外部数据源如 Git、本地数据库只需提供统一标准服务任何支持 MCP 的 AI 客户端就能无缝插拔、安全地访问这些上下文。四、 进阶模型与训练调优让模型更懂业务与对齐人类Fine-Tuning微调 / SFT当通用大模型无法满足特定行业如医疗、法律的专业术语或严格格式要求时使用特定数据集对开源模型进行二次训练改变其行为模式。LoRA / QLoRA高效参数微调全量微调大模型成本极高。LoRA 通过在模型旁挂一些极小的低秩矩阵进行训练大幅降低了微调所需的显卡算力和资金成本。RLHF / DPO基于人类反馈的强化学习 / 直接偏好优化训练大模型的核心对齐技术。让模型不仅“会说话”还懂得“说人话”、不说有害言论、更符合人类的价值观和偏好。五、 其他成本控制Token 节省大模型 API 按 Token 计费。在生产环境中需要通过精简 Prompt、选择性价比更高的模型、压缩历史对话上下文等手段降低运营成本。延迟优化Latency Optimization通过流式传输Streaming、投机采样、优化模型尺寸以及使用支持并发量更高的推断引擎来降低首包延迟TTFT与生成时间。结构化输出 / 约束解码Structured Outputs / JSON Mode强制大模型严格按照你指定的 JSON Schema 输出避免因模型多加标点符号导致后端解析崩溃。提示词注入防御Prompt Injection防范恶意用户在输入中嵌入篡改指令如“忽视之前的提示词”诱导大模型突破既定规则泄露机密。语义缓存Semantic Cache利用 Embedding 技术识别不同表达但含义相同的请求。如果命中缓存直接返回历史回答既省钱又提升响应速度。Guardrails安全护栏 / 内容审核在用户输入前和模型输出后加入的“安全网”用来拦截色情、暴力、泄密等违规内容或防止越狱攻击。Evals模型与应用评估编写自动化评估流水线对 RAG 的召回率、Agent 的成功率、回答的准确性进行打分充当 AI 的“单元测试”。LLM Observability大模型可观测性 / 链路追踪类似传统系统的 SkyWalking用于可视化追踪复杂 Agent 或 RAG 链路中每一步的 Prompt、耗时与 Token 消耗。
返回列表