尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

PagedAttention与vLLM:Maths, CS AI Compendium连续批处理原理图解

PagedAttention与vLLM:Maths, CS  AI Compendium连续批处理原理图解 PagedAttention与vLLMMaths, CS AI Compendium连续批处理原理图解【免费下载链接】maths-cs-ai-compendiumBecome a cracked AI/ML researcher/engineer with this unconventional textbook covering maths, computing, and ML with intuition.项目地址: https://gitcode.com/GitHub_Trending/mat/maths-cs-ai-compendiumMaths, CS AI Compendium 是一本面向 AI/ML 工程师的开源教程教材系统覆盖数学、计算机科学与机器学习知识。本文带你用 10 分钟、零代码看懂它第 17 章「AI Inference」中最核心的一节连续批处理Continuous Batching如何把 GPU 吞吐提升数倍以及 PagedAttention 与 vLLM 如何彻底解决 KV-Cache 显存浪费问题。为什么 GPU 推理会浪费 90% 算力单看一条 LLM 请求很简单输入 token输出 token。但要同时服务上千个并发用户就是一个纯系统问题。教材把 LLM 推理拆成两个特征完全不同的阶段| | Prefill提示词处理 | Decode逐 token 生成 | |--|---|---| | 处理方式 | 一次并行处理全部输入 | 每次只生成 1 个 token | | 瓶颈 | 计算FLOPS | 显存带宽 | | 算术强度 | 高 | 极低 | | GPU 利用率 | 高50–80% | 低1–10%无批处理时 | | 关键指标 | TTFT 首 token 时间 | TPOT 每 token 时间 |最原始的静态批处理会收集一批请求、补齐到相同长度后一起跑。它有两个致命问题等最长的短请求早早完成却要干等批次里最长请求结束才能开下一批GPU 大量空转padding 浪费最长提示 2000 token、最短只有 50 token 时短请求要白白计算 1950 个填充位。连续批处理按「解码步」动态调度 连续批处理又称迭代级批处理的精髓在于把调度粒度从「整条请求」降到「单个解码步」。每个解码步都执行三件事所有在途请求并行各生成 1 个 token谁生成了 EOS 结束符立即从批次中移除队列里的新请求立即插入腾出的槽位。批次大小因此每一步都在动态变化GPU 不再等待「掉队者」也没有 padding 浪费。教材给出的结论是连续批处理通常能把吞吐量提升2–10 倍且几乎不影响延迟和模型质量。PagedAttention 如何治好 KV-Cache 内存浪费每个请求的 KV-Cache 会随生成的 token 不断增长而不同请求进度不同。若为每个请求预分配「最大可能长度」的连续显存浪费极其严重——这正是 PagedAttentionKwon et al., 2023要解决的问题。它的灵感直接来自操作系统课程的虚拟内存分页见教材第 13 章分页Pages把 KV-Cache 切成固定大小的页每页存放若干 token 位置。页内连续页间可以不连续地散布在物理显存里按需分配token 真正生成时才分配新页不再按最大长度预留写时复制Copy-on-Write共享同一系统提示词的请求共用同一批 KV 页只有内容分叉时才复制。三大收益一句话总结无碎片、不预留、能共享。vLLMPagedAttention 的落地推理引擎vLLM是围绕 PagedAttention 构建的 LLM 推理引擎把「几乎零浪费」的 KV-Cache 管理变成现实相比静态分配服务可带来2–4 倍吞吐提升。配套的生产工程手段还包括调度策略FCFS、短作业优先SJF、优先级抢占——高优先级请求可把低优先级请求的 KV-Cache 换出到 CPU 内存服务完再恢复Token 预算限制活跃批次总 token 数防止个别长请求饿死新请求关键指标TTFT 关注用户体验、TPOT 决定生成速度而「每 token 成本」才是生产环境的终极指标——GPU 利用率提升一倍单位成本近似减半。配套学习路径教材相关章节导航 想深入原理建议按下面的顺序阅读教材推理与批处理核心章节chapter 17 - AI inference/03. serving and batching.md —— 含 prefill/decode 对比、调度策略、约束生成与请求路由的完整解析操作系统分页原理chapter 13 - computing and OS/03. operating systems.md —— PagedAttention「虚拟内存」思想的源头部署与 DevOps 实践chapter 15 - production software engineering/05. deployment and devops.md —— 模型服务上线的工程全流程AI Inference 章节总览chapter 17 - AI inference/01. quantisation.md 起共 5 篇覆盖量化、高效架构、边缘推理与规模化部署。 一句话总结连续批处理让 GPU「时刻有活干」PagedAttention 让显存「一块不浪费」vLLM 则把两者变成开箱即用的推理引擎。理解了这条主线你就掌握了 LLM 服务化性能优化的第一性原理。【免费下载链接】maths-cs-ai-compendiumBecome a cracked AI/ML researcher/engineer with this unconventional textbook covering maths, computing, and ML with intuition.项目地址: https://gitcode.com/GitHub_Trending/mat/maths-cs-ai-compendium创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表