
前言大模型从单纯对话走向自主思考、任务规划、工具调用、闭环执行核心载体就是 AI Agent。很多开发者只知道 Agent 能自动干活却搞不懂从输入一句话到拿到最终结果中间经历了哪些分层环节、每个模块承担什么职责、专业名词到底是什么含义。一、AI Agent整体架构分层先建立全局认知整套流程分为六层架构自上而下依次为用户层任务发起方输入自然语言需求Agent 调度层全局大脑中枢负责接收、调度、路由、结果汇总Skill 技能封装层标准化工具能力抽象屏蔽底层工具差异LLM 大模型层负责语义理解、意图识别、任务拆解、参数生成、答案整编MCP 协议中间层工具注册、发现、路由、API 调度的统一网关外部工具层搜索、数据库、代码执行、接口服务、文档解析等实际能力载体在实际过程中依次经过的层级是Agent → LLM思考→ Skill能力封装→ MCP工具网关→ Tool实际干活核心设计思想分层解耦、单一职责、标准化接入、可插拔扩展。新增工具不用改 Agent 核心逻辑新增业务能力只需封装 Skill 即可。二、相关术语1.LLM大语言模型1通俗解释LLM 就是AI Agent 的大脑。只会思考、理解、拆解、写文字、做决策但是不会联网、不会查数据库、不会运行代码、不会调用外部接口只能动脑子不能动手干活。2专业定义LLMLarge Language Model大语言模型是基于海量文本预训练生成的生成式大模型具备语义理解、意图识别、逻辑推理、任务拆解、文本生成、参数编排能力。2.Skill技能层1通俗解释Skill 是Agent 的能力包装壳。把底下乱七八糟的工具搜索、查库、代码执行、生成表格统一包装成标准化 “技能”让上层 Agent 不用管底层工具长什么样只需要调用技能就行。类比你手机里有「拍照」技能底层可以用主摄、超广角、长焦但你只点「拍照」不用管调用哪颗摄像头。2专业定义Skill智能体技能是对同类工具能力的高层抽象与标准化封装层统一规范工具的入参、出参、调用逻辑、返回格式屏蔽底层工具的异构差异。3在 Agent 里的核心作用把多个底层工具收拢成一个统一能力如「全网搜索技能」底下挂多个搜索引擎统一参数格式、统一结果返回格式承载上下文、用户偏好、权限和限流配置给 LLM 生成参数做草稿、做约束3.MCP模型控制协议1通俗解释MCP 就是工具统一网关 调度中心。所有外部工具都在 MCP 里注册登记Agent 和 Skill 要调用工具都找 MCP由 MCP 帮你找工具、发请求、收结果、做异常处理。类比MCP 像物业前台所有服务修水电、保洁、维修都在前台登记你不用挨个找师傅直接找前台前台帮你派单、对接、反馈结果。2专业定义MCPModel Control Protocol模型控制协议是 AI Agent 体系中工具注册、服务发现、路由调度、API 网关、协议标准化的中间层是连接「Skill/Agent」与「外部工具」的统一通信协议与调度枢纽。3MCP 核心职责工具注册维护全局工具注册表记录每个工具功能、接口地址、参数规范服务发现根据任务需求自动匹配最合适的工具协议转发统一组装请求、调用工具真实 API管控能力统一做权限校验、限流、超时、熔断、异常降级结果标准化把不同工具返回的五花八门数据统一格式返回给上层三、AI Agent 全流程精讲1.第一阶段用户请求接入 记忆上下文加载1用户发起自然语言 Query用户输入一句复杂任务指令例如帮我整理近一年国内光伏行业财报数据做同比对比并生成 Markdown 分析表格。核心关键词Query用户以自然语言表达的原始任务请求是整个 Agent 链路的入口。Query 的清晰度、是否隐含多步骤诉求直接决定后续意图识别和任务拆解的准确率。2Agent 接收请求并做基础校验Agent 作为统一入口网关承接用户请求完成会话绑定、权限校验、非法请求过滤、请求头与身份信息封装。3历史对话 长期记忆检索Agent 根据会话 ID从记忆库拉取短期会话上下文长期用户记忆短期记忆当前聊天上下文、上一轮问答内容长期记忆用户使用习惯、偏好格式、历史任务特征核心关键词Memory 记忆检索AI Agent 区别于普通大模型对话的核心能力之一。让 Agent 拥有连续对话能力和个性化服务能力能省略重复前提、指代上文需求、适配用户固有习惯。2.第二阶段LLM 语义理解 任务规划1LLM 意图识别 复杂任务拆解Agent 把「用户 Query 历史上下文」送入大模型LLM 完成两大核心动作意图识别精准判定用户真实诉求类型数据查询 / 文本创作 / 数据分析 / 多工具协同任务等任务拆解把一个无法一步完成的复杂大任务拆成多个可串行 / 可并行执行的原子子任务。核心关键词意图识别 Intent Recognition大模型通过语义理解消歧、补全隐含信息锁定用户底层真实目的解决自然语言模糊、口语化、省略前提的问题。核心关键词任务拆解 Task Decomposition将模糊、高复杂度的目标拆分为顺序明确、依赖清晰、可单独执行的子步骤。是 Agent 具备自主解决复杂任务的底层核心。2LLM 生成结构化执行计划大模型输出一份可被 Agent 解析的执行 Plan包含子任务执行先后顺序哪些步骤需要调用外部工具步骤间依赖关系每一步预期输出格式核心关键词执行计划 Execution PlanAgent 后续调度执行的 “施工蓝图”决定整个任务怎么走、先做什么后做什么、何时调用工具、何时直接生成文本。3.第三阶段技能匹配 调用参数编排1Agent 接收并解析执行计划Agent 接收 LLM 返回的计划做结构化解析标记出需要工具调用的节点和纯文本生成节点分流进入不同处理分支。2判断是否需要调用 Skill / 外部工具纯文案写作、简单总结无需工具直接走 LLM 生成回复实时数据、联网搜索、数据库查询、代码运算、可视化生成必须调用工具技能。3路由匹配对应 SkillAgent 按任务类型路由到对应技能搜索 Skill、数据分析 Skill、代码执行 Skill、报表生成 Skill 等。4Skill 加载上下文与自身能力配置Skill 读取当前会话上下文、用户偏好同时加载自身配置参数约束、调用限流、权限范围、支持返回格式。5Skill 生成工具调用参数草案Skill 根据任务目标先粗粒度整理出调用关键词、时间范围、数据维度等形成参数草稿避免无边界调用。6LLM 补全、优化、标准化调用参数由大模型结合用户原始需求对参数草案做精修、补全、约束格式化输出完全符合下游工具 API 要求的标准入参。4.第四阶段MCP 协议层调度 工具实际执行1Agent 通过 Skill 发起工具调用请求封装好的标准参数经由 Skill 回传给 Agent由 Agent 统一向外发起调用请求。2MCP 完成工具发现与最优选择维护全局工具注册表功能描述、接口地址、入参出参规范按任务需求做工具发现、匹配、择优选择统一做权限、限流、超时、异常熔断屏蔽异构工具接口差异MCP 的价值工具可插拔、协议统一、接入无需改动 Agent 核心代码。3MCP 调用具体工具 APIMCP 按协议标准组装 HTTP / 内部 RPC 请求调用目标工具的真实接口。4外部工具执行具体业务逻辑核心关键词Tool 外部工具大模型本身有知识但无实时性、无联网能力、无执行能力、无法操作外部系统Tool 就是能力延伸载体。常见类型检索类全网搜索、知识库检索、企业内部文档检索计算类代码解释器、计算器、数据分析业务类数据库查询、工单系统、邮件推送、可视化图表生成创作类文生图、PPT 生成、文档导出工具执行完毕返回原始结果给 MCP。5MCP 接收结果并做标准化封装MCP 做结果合法性校验、异常捕获、格式统一转换把异构工具返回值抹平为统一结构回传给 Agent。5.第五阶段结果整编 最终答案输出1Skill 解析、校验、格式化工具返回结果对应 Skill 负责有效信息提取、脏数据过滤、格式规整、适配用户偏好如固定 Markdown 表格、极简文本等。2Agent 多结果聚合 上下文再整合若任务涉及多轮多工具调用Agent 统一聚合所有子任务结果结合初始需求和会话上下文整理成完整信息上下文。3LLM 基于整合信息生成最终回答大模型不再凭空生成而是基于用户需求 工具真实数据 执行结果做逻辑梳理、总结解读、格式美化输出符合人类阅读习惯的最终内容。4Agent 返回最终结果给用户Agent 做最后一层格式适配、排版优化推送到前端对话界面完成从提问到结果的全流程闭环。三、底层架构设计关键思想分层解耦用户 - Agent-Skill-LLM-MCP-Tool 每层各司其职改动某一层不影响其他层大模型负责思考Agent 负责调度工具负责干活分工明确最大化发挥各模块优势标准化协议与封装通过 SkillMCP 两层封装实现工具即插即用适合企业级大规模落地记忆 规划 工具 反思闭环完整复刻人类 “思考 - 拆分 - 找资源 - 做事 - 总结” 的行为逻辑。四、结语AI Agent 不是大模型的简单包装而是一套语义理解→任务规划→技能匹配→协议调度→工具执行→结果整编的完整工程架构体系。看懂这一整套流程就能更好的理解Agent产品的底层逻辑