
摘要当大模型的能力边界不断扩展真正决定 AI 价值上限的已不再只是算法本身而是支撑其落地的基础设施体系。本文基于 2026 Agentic AI 超级智能体系统架构峰会演讲系统阐述了阿里云 PAI 平台如何围绕算力、推理与场景三条主线构建面向 Agentic AI 的全栈基础设施——从数十万卡集群的统一调度与训推一体到企业级 Token 服务 TokenWorks 的 KV Cache 感知调度与 SLO 保障再到 Physical AI、自动驾驶、具身智能等场景化方案的落地以及 Agentic 交互与 AI 原生数据管线的融合展现了一条从有算力到用好算力再到智能驱动的清晰演进路径。演讲人 周文超阿里云智能研究员人工智能平台PAI负责人百炼平台AI搜索负责人从算力底座到场景落地AGI不仅是模型更是千行百业的高效应用当前 AI Infra 架构可分为以下几个核心层次。最底层是算力。阿里云人工智能平台 PAI 管理着多种异构计算资源包括不同规格的 CPU 和 GPU以及高带宽网络、存储等。该平台承担着资源池化与弹性调度的职责。算力的规模和稳定供给决定了 AI 智能的上限。算力层之上是 AI 的两大核心环节——训练和推理。训练环节重点关注 GPU 资源的使用效率MFU。将 MFU 从百分之十几、二十几提升至百分之五十甚至更高直接决定了模型训练的速度和资源消耗。推理环节同样如此。近年来学术界和工业界的一个核心技术突破是如何实现更高效的 LLM Serving使大模型在算力平台上完成高效推理。过去一年该领域涌现了大量新技术PD 分离、KV Cache 的多层级利用从本机内存到跨机内存再到 SSD以及 MTP 技术提升 Acceptance Rate 等。计算效率的提升是模型生产和应用的基础。再上一层是企业 Token 服务的保障体系。有了训练和推理能力便可产出高质量的模型并生成高质量 Token。下一个目标是实现高效率的 Token 产出并提供稳定的效率保障。确定性的 SLO 至关重要尤其在 Agentic AI 时代Token 的稳定性和效率直接决定上层服务的可靠性。SLO 已从单一的 P99 延迟演变为更复杂的指标体系不仅涵盖整体延迟还包括 TTFT 和 TPOT 等具体约束条件。在此基础上需要实现 Token 成本的最小化并确保 TTFT、TPOT 及成本在较长周期内实现 99.9999% 甚至 99.99999% 的 SLO 达成率。这是企业级 Token 服务乃至 Agentic AI 落地的前提。最上层是场景化的 AI 工程。Token 产出之后仍需将其应用于具体场景以创造真正的业务价值。这需要从通用平台走向行业纵深覆盖智驾、具身智能、AI Coding、多模态探索等不同应用场景构建行业纵深的场景化 AI 工程。阿里云人工智能平台 PAI阿里云人工智能平台 PAI 的架构分为IaaS、PaaS、MaaS 和解决方案四层。最底层是 IaaS依托阿里云在云时代的深厚积淀。计算方面支持 CPU、GPU 等多种计算类型存储方面提供 CPFS 等面向 AI 工作负载的高带宽存储网络方面具备跨 Region 和 Region 内的两层高速网络保障 51.2Tbps 的高速互联。此外结合 MaxCompute、EMR、Flink 等大数据平台提供 AIData 的高效解决方案。IaaS 之上是 PaaS 层也是 PAI 投入最多精力构建的部分在 AI Infra 中具有最大的设计空间和发展潜力。PAI 拥有两个核心引擎——训练引擎 DLC 和推理引擎 EAS并在引擎之上提供多种大模型开发和应用工具IDEDSWNotebook 式开发工具支持交互式建模、Agentic 工具以 Agentic 方式与平台交互同时更好地支持 Agent 工作负载、以及多模态 AI 和 Physical AI 等场景化工具。最终目标是让 AI 算力、智能和数据形成飞轮效应。PaaS 之上是 MaaS 层。底层的基础设施和 AI 算力平台支撑了 Model as a Service包括 ModelScope、阿里云百炼以及 OpenAI、Anthropic、Hugging Face 等第三方 MaaS 平台通过不同协议使用底层的 AI Infra。最上面是解决方案层覆盖 Agent、自动驾驶、具身智能、科研智算等不同行业和场景。算力的应用效率是AI迭代和应用的关键PAI统一调度引擎训推一体的高效调度PAI 的核心能力之一是统一资源调度。资源呈现显著的异构性和多元性体现在多个维度。第一是算力的异构与多样性。CPU、GPU 以及日趋丰富的 GPU 类型——包括英伟达 GPU、阿里云 PPU 和国产生态 GPU——种类繁多。能否在统一的资源池中实现混合调度在调度时将不同卡型统一管理是关键能力所在。第二是网络的多样性。卡与卡之间可能处于同一机器、同一机架、跨机架甚至跨机房等不同拓扑位置网络带宽和延迟保障差异显著直接影响大规模训练和推理的整体效率。因此调度时需考虑网络拓扑亲和性——例如使用 Tensor Parallel 进行训练或推理时应将相关任务优先分配到高速互联的 GPU 上。PAI 的统一调度引擎综合考虑了算力多样性、网络多样性以及多种调度策略FIFO、Round Robin、是否允许抢占等。配额分配后的使用模式——固定配额还是允许闲时复用和抢占——进一步扩大了调度空间。PAI 平台将所有这些调度能力集成于统一的调度器中结合阿里巴巴训练 Qwen、Wan 等大模型积累的实践经验在管理的数十万卡算力集群中实现了 90% 以上的有效算力利用率。资源、调度和工作空间三层体系实现算力精细化管理另一个关键维度是易用性。企业中与 AI 算力相关的角色包括资源购买方决定采购规模、资源分配方管理不同团队的资源配比和资源使用方模型开发团队、数据开发团队等。不同角色需要不同的资源管理视图。资源购买阶段PAI 提供 AI 资源组的概念可统一管理 GPU、CPU、内存、存储等资源实现可观测、可管可控。资源分配阶段通过定义 Quota资源配额来保障各团队的资源互不干扰每个配额内可自由使用。资源使用阶段在 AI 工作空间内进行资源绑定例如将部分 GPU 用于训练、另一部分用于推理在使用层面实现资源管控。购买、分配、使用三层体系协同实现了算力的精细化管理这也是 PAI 平台在业界广受认可的核心能力。PAI-DLC 超大规模分布式训练服务训练服务是另一个与算力密切相关的核心领域。在调度引擎之上训练引擎针对多种训练任务和阶段进行了深度优化涵盖预训练、后训练、MoE 模型训练和多模态模型训练等。以 MoE 训练为例PAI 引入了 Chunk Flow 技术。由于训练的 Context Window 长度可变定长训练会导致大量 GPU 空跑和资源浪费。PAI 将变长训练组织为等长的 Chunk显著提升了训练效率在 MoE 模型训练中可实现约三倍的资源使用效率提升。此外PAI 集成十余种主流训练框架支持一键启动复杂的训练和 Rollout 操作。综合来看在训练方面10 万卡算力集群管理的卡数过去一年增长约三倍MoE 训练 MFU 最高超过 80%训练任务量过去一年增长超百倍每月有超过 4000 万个训练任务在平台上运行。Agentic时代的推理服务进入 Agent 时代推理服务领域发生了根本性变化。Agentic Inference 具有以下四个显著特征。单次对话如同一次长跑——可涵盖数十轮交互上下文可达数十万 Token。Prefill 和 Decode 分离已成为标配无论是 Coding 场景还是 Agentic 场景上下文日趋冗长两阶段分离势在必行。同一查询还需多个实例协作甚至在探索 Attention 与 Forward 的进一步分离AFD 分离。KV Cache 已成为核心资产。过去一年KV Cache 从一项辅助优化手段演变为核心议题。其命中率从 60%—70% 持续攀升在部分 Coding 场景下已超过 95%。每一个百分点的提升都意味着推理时 GPU 资源的节省——尤其从 95% 到 96%看似仅提升一个百分点但未命中率从 5% 降至 4%实际资源节省达 20%。在阿里内部和 PAI 平台上KV Cache 的优化是重点投入方向确保在多轮对话和 Coding Agent 环境中充分发挥其价值。网关同样至关重要。传统网关已基本失效——Round Robin 和一致性哈希等方式无法感知 KV Cache必然导致命中率下降并影响 TTFT 和 TPOT。现代网关需要实现 KV Cache-Aware Routing。网关还承担着更多职责在 MaaS 或推理场景中需要处理多种协议如 Anthropic 协议、Responses 协议同时承担翻译、调度和计费等功能。SLO 的定义也发生了根本性变化。当前工业实践中的 SLO 本质上是一个约束优化问题——约束条件涉及 TTFT 和 TPOT优化目标是单 Token 成本或百万 Token 成本。推理的服务单位也从资源快速演进到了 Token在 LLM 时代推理经历了从同步推理到异步推理再到流式推理的演进以 Token 作为服务粒度。Agent 时代由于上下文极长推理过程有时如同在 Token 中摸索前行——可能消耗大量 Token 而编码进展有限。因此需要实现高效、低成本、高质量的 Token 利用。PAI TokenWorks 企业级推理服务PAI 推出了 TokenWorks——企业级专属推理服务支持数据不出域的私有化部署提供具有 SLO 保障的推理服务。TokenWorks 针对前述每个问题都进行了专项优化。流量高效调度方面实现了 KV Cache-Aware 的网关流量调度确保 KV Cache 命中率足够高。通过从 HBM 到内存再到 SSD 的多层缓存架构命中率可稳定在 90% 以上部分场景可达 95%。引擎深度优化方面针对不同 Attention 机制从 DeepSeek V4 到 K3 等实施算子融合采用 D-Spark、D-Flash 等技术提升推理引擎效率。此外还包括模型预热缓存、用户 Token 管理等功能实现成本可核算、可治理。这些技术能力最终以 Token 形式交付——对客户而言即为具有 SLO 保障的专属 Token 服务数据可管可控、不出域、安全。场景化是AI业务价值体现的必经之路以物理 AI为例可以清晰地看到 AI Infra 的演进方向。Physical AI 是当前备受关注的领域其发展呈现双轮驱动格局一侧通过 Physical AI 模拟物理世界捕捉物理规律生成符合物理规律的世界仿真另一侧通过 LLM/VLM 提炼和抽象人类知识。两者相互促进——Physical AI 中基于仿真的反馈可用于 LLM/VLM 的强化学习训练而 LLM/VLM 在数据标注、清洗和扩增等方面也反向推动了世界模型的训练。PAI 平台构建了 Physical AI 的全栈能力。底层是算力层统一管理不同 GPU 和资源。中间层集成了 Physical AI 领域主流的仿真、训练和测试框架。上层是场景化的平台能力Notebook Gallery 组件沉淀了数百个业界最佳实践模板支持一键启动DSW 提供交互式开发环境支持自定义环境的探索验证与调试以及低延迟可视化的机器人仿真环境。模型的上线和部署则依托训练平台 DLC 和推理平台 EAS。完整的解决方案还涵盖数据合成、真机与仿真数据的联合管线、模型训练验证与上线。PAI 与 Isaac、Cosmos 等合作伙伴持续协作不断提升 Physical AI 全栈能力。Physical AI 的研发全流程包括数据生产真机采集数据如车辆和人形机器人数据不足时通过仿真进行扩增和增强、数据加工标注、筛选、画质增强等、模型训练预训练、后训练含微调和 RLHF以及模型评测。PAI 平台在该研发全流程中与客户和合作伙伴共同打造使之更贴合 Physical AI 的研发实践。Agentic PAIAI驱动的PAI操作入口AI 正加速进入千行百业PAI 平台本身也积极拥抱 Agentic 交互方式。Agentic PAI 将平台能力以自然语言交互的方式呈现从资源管理到训练、部署、运维乃至故障排查均可以 Agentic 方式进行支持 CLI 和 Chat 等交互形式。PAI 平台已沉淀了大量训练、推理和 RL 任务训练本身即是一项复杂的系统工程Agentic 方式能够帮助客户更高效地完成模型训练、部署和运维。这也便于客户将 PAI 能力快速集成到企业内部 AI 平台。大型企业通常拥有自有的 AI 部署管理和观测平台通过 Agentic 接口PAI 的能力可快速融入企业自有的 AI 平台体系。不同角色从中获得的收益各有侧重算法工程师和模型训练者关注开发效率和训练稳定性可将数百个 Worker 的日志交由 AI 分析专注于模型本身无需在海量日志中人工排查 Loss 异常部署和推理工程师关注服务上架、运维和性能部署、扩缩容、灰度发布和故障排查可一站式完成平台资源管理者和成本负责人可快速实现成本洞察查看 GPU 利用率、排名和环比趋势等。Agentic 全模态数据处理管线模型训练离不开数据。对阿里云而言AI 与 Data 紧密相连。在 Agentic 时代全模态数据处理管线同样备受关注。数据管线涵盖数据治理、资源管理、开发体验和多模态数据纳管等方面。阿里云大数据平台正从传统数仓向 AI Native 数据平台转型可将复杂的 AI 推理场景简化为一行 SQL使熟悉 SQL 的开发者将 AI 能力直接嵌入已有的开发平台和流程中。通过异构资源的灵活调度多种模型覆盖全场景。这是大数据平台与人工智能平台联合打造的成果将大数据产品从传统数仓平台到 AI Native 数据平台的转型。结语从算力到智能体作为行业从业者可以看到一条清晰的趋势——从单纯关注算力到算力如何更好地支撑智能体AI Infra 层面正在经历深刻的演进与变革。阿里云大数据AI 平台将持续助力千行百业共享 AI 红利。