
2026年9月1日lmdeploy 发布 v0.17.0 版本。本次更新覆盖功能集成、推理性能优化、接口能力完善、模型兼容性修复、构建流程调整、文档与自动化测试改进等多个方向。从更新内容来看v0.17.0 的重点十分明确一方面继续增强推理引擎能力加入 DeepEPv2、Kimi K2.6、Mooncake Store 等支持另一方面围绕 GLM-5.2 服务、Paged Attention、V4 Prefill、FP8 MoE、推测解码等关键路径持续优化。同时版本也修复了 FP8 权重回退、视觉数据 URL、Anthropic API 系统消息、GLM 工具调用、Triton 编译等一批问题。对于关注大模型部署、推理服务、模型兼容性以及 API 接口稳定性的开发者而言lmdeploy v0.17.0 是一次覆盖面较广的版本更新。一、版本信息速览版本v0.17.0发布时间2026年9月1日更新范围功能、性能、兼容性、接口、构建、文档、测试与版本维护核心关键词DeepEPv2、Kimi K2.6、Mooncake Store、服务端多候选输出、GLM-5.2、Paged Attention、V4 Prefill、FP8 MoE、推测解码、结构化响应格式本次版本中的变更可以概括为四个层面新能力接入包括 DeepEPv2、Kimi K2.6 与 Mooncake Store。推理链路持续优化包括 GLM-5.2 服务、CUDA Attention、FP8 MoE 和推测解码。接口与响应格式扩展包括 Chat Completions 的多候选输出以及结构化标签响应格式。稳定性修复与工程维护包括模型转换、API、构建链接、Markdown 链接校验、测试工作流与依赖要求调整。二、新功能DeepEPv2、Kimi K2.6、Mooncake Store正式接入1. 集成 DeepEPv2v0.17.0 集成了 DeepEPv2。DeepEPv2 的加入是本版本功能更新中的重要内容之一。此次更新明确将 DeepEPv2 纳入 lmdeploy 的支持范围进一步扩展了项目所覆盖的能力与组件。对于使用 lmdeploy 的用户来说版本升级后可关注 DeepEPv2 相关能力的接入情况。该项变更对应更新编号 4783。2. PyTorch 引擎支持 Kimi K2.6本次更新中PyTorch 引擎新增支持 Kimi K2.6。模型兼容性始终是推理部署框架的重要组成部分。v0.17.0 明确增加了 Kimi K2.6 支持并且该支持位于 PyTorch 引擎范围内。这意味着在 lmdeploy 的 PyTorch 路径中Kimi K2.6 成为本次版本新增覆盖的模型之一。对于关注该模型部署与推理支持的用户而言这项更新值得重点关注。该项变更对应更新编号 4846。3. kv_connector 支持 Mooncake Storev0.17.0 在 kv_connector 中新增 Mooncake Store 支持。kv_connector 是本次功能更新的重要切入点。随着 Mooncake Store 的支持加入lmdeploy 在相关存储能力支持方面进一步扩展。此次更新明确指出支持对象为 Mooncake Store所属模块为 kv_connector。该项变更对应更新编号 4903。三、性能与能力改进从多候选输出到推理关键路径优化除了新增支持外v0.17.0 的大量更新集中在性能和服务能力改进上。涉及 Chat Completions、GLM-5.2、CUDA Attention、Ascend Attention 后端、FP8 MoE、推测解码、页面大小与结构化响应格式。1. Chat Completions 支持服务端多候选输出本次更新为 Chat Completions 增加服务端 fan-out 能力用于支持n 1的 choices。在 Chat Completions 场景中当请求需要返回多个候选结果时v0.17.0 新增了服务端侧的 fan-out 支持。这项更新聚焦于n 1的 choices也就是单次请求中需要获得多个候选响应的情况。该能力的加入使 Chat Completions 接口在多候选输出处理方面获得了新的服务端支持。该项变更对应更新编号 4841。2. 进一步优化 GLM-5.2 服务性能v0.17.0 对 GLM-5.2 serving 进行了进一步性能优化。更新内容中明确使用了“进一步优化”说明 GLM-5.2 服务链路仍是持续优化的重点。本次版本继续围绕 GLM-5.2 的服务表现进行改进。该项变更对应更新编号 4853。3. CUDA 路径使用 PDL 优化 Paged Attention 与 V4 Prefill本次更新在 CUDA 路径中使用 PDL 处理 Paged Attention 和 V4 Prefill。Paged Attention 与 Prefill 都是推理过程中的重要环节。v0.17.0 明确引入 PDL用于 Paged Attention 和 V4 Prefill 的相关优化。该项更新体现了对 CUDA 推理路径的持续打磨涉及两个明确对象Paged AttentionV4 Prefill该项变更对应更新编号 4861。4. Ascend 更新 Attention 算子后端v0.17.0 对 Ascend 平台的 Attention 算子后端进行了更新。此次修改的重点是 Attention 的 op_backend也就是 Attention 算子的后端实现选择或相关配置。更新记录明确指出该项内容位于 Ascend 相关路径中。该项变更对应更新编号 4900。5. 优化紧凑分块 FP8 MoE与路由准备过程在 PyTorch 路径中v0.17.0 优化了 compact blocked FP8 MoE并优化了 route preparation。本次性能优化涵盖两个直接对象紧凑分块 FP8 MoE路由准备过程FP8 MoE 和路由准备都属于相关推理流程中的关键部分。此次更新针对 compact blocked FP8 MoE 以及 route preparation 进行优化体现出 lmdeploy 对相关路径的持续调整。该项变更对应更新编号 4857。6. 降低推测解码前后处理开销v0.17.0 对推测解码的 pre-processing 和 post-processing 开销进行了降低。推测解码不仅涉及实际解码过程也包括前处理与后处理步骤。本次更新针对这两部分的开销进行优化目标是减少 speculative decoding 的前后处理成本。更新内容明确涵盖推测解码前处理开销推测解码后处理开销该项变更对应更新编号 4877。7. 支持非二次幂页面大小本版本新增支持非二次幂的 page size。此前在页面大小使用上可能存在特定约束而 v0.17.0 明确支持不属于二次幂的 page size。该项能力扩展了页面大小的可支持范围。需要注意的是更新内容的重点在于“支持非二次幂页面大小”并未给出具体可选页面大小列表。因此使用时应以实际版本配置与运行环境为准。该项变更对应更新编号 4854。8. TurboMind 与 PyTorch 引擎支持 structural_tag 响应格式v0.17.0 新增 structural_tag response_format 支持覆盖 TurboMind 和 PyTorch 两类引擎。这项更新属于响应格式能力扩展。新增的格式为 structural_tag并且明确支持以下推理引擎TurboMind 引擎PyTorch 引擎对于需要使用结构化标签响应格式的场景该版本增加了对应能力支持。该项变更对应更新编号 4906。四、问题修复模型、接口、工具调用、编译与数据处理全面加固v0.17.0 修复内容覆盖 TurboMind、视觉输入、API、原生 Transformers 预热、Anthropic API、DSA Prefill、构建链接、GLM 工具调用、Triton 编译以及模型转换等多个部分。这些修复共同提升了版本的兼容性与稳定性。1. 恢复 pre-sm90 GPU 上 FP8 权重仅量化回退能力本次更新修复 TurboMind 相关问题恢复 pre-sm90 GPU 上的 FP8 weight-only fallback。更新内容明确指出此次修复针对 pre-sm90 GPU也就是 SM90 之前的 GPU 架构环境恢复 FP8 权重仅量化模式下的回退能力。该问题位于 TurboMind 路径中修复后相关环境下的 FP8 weight-only fallback 得到恢复。该项变更对应更新编号 4871。2. 视觉模块对格式异常的数据 URL 提供清晰报错v0.17.0 修复了视觉模块对 malformed data URLs 的处理问题。此前当视觉输入中的数据 URL 格式异常时系统现在会抛出更清晰的错误信息。更新的重点并非改变数据 URL 的格式要求而是让格式不合法时的报错更加明确。这能够帮助使用者在遇到错误数据 URL 时更容易定位问题。该项变更对应更新编号 4837。3. 修复 API 中的 reponses 接口问题本版本修复了 API 中的 reponses interface 问题。更新记录中使用的是 reponses interface 表述本次版本对此接口问题进行了修复。该项变更属于 API 层面的稳定性修正。该项变更对应更新编号 4893。4. 修复 DSV4 原生 Transformers 预热问题v0.17.0 修复了 DSV4 native Transformers warmup 相关问题。此次修复涉及 DSV4、原生 Transformers 与 warmup 三个关键点。更新内容明确表明DSV4 的 native Transformers 预热流程获得修复。该项变更对应更新编号 4878。5. Anthropic API 支持内联系统消息本版本修复 Anthropic API 中内联 system messages 的支持问题。系统消息是接口调用中的重要组成部分。v0.17.0 明确支持 inline system messages也就是内联系统消息的处理。该项修复位于 Anthropic API 路径中。该项变更对应更新编号 4882。6. 限制 DSA Prefill 分数内存占用v0.17.0 修复 DSA Prefill score memory 问题对其内存使用进行限制。更新内容明确为 bound DSA prefill score memory即对 DSA Prefill 分数相关内存进行边界控制。该修复聚焦于内存占用管理。该项变更对应更新编号 4896。7. 修正 GEMM 内核归档链接顺序本次版本修复构建问题修正 GEMM kernel archive 的链接顺序。GEMM 内核归档文件在构建链接时其链接顺序得到修正。该项更新位于 build 相关内容中属于工程构建层面的修复。该项变更对应更新编号 4910。8. 拒绝不可用的 GLM 工具调用v0.17.0 修复 GLM tool calls 处理问题拒绝不可用的工具调用。更新内容明确指出对于 unavailable GLM tool calls系统将进行拒绝处理。该项修复聚焦于 GLM 工具调用的可用性判断。该项变更对应更新编号 4901。9. 避免 Triton 在 Paged Attention Reduction 中错误编译本版本修复 PyTorch 路径中的 Triton 错误编译问题。具体来说修复目标是避免 Triton 在 paged attention reduction 中发生 miscompile。该项修复同时涉及PyTorchTritonPaged Attention Reduction该项变更对应更新编号 4920。10. 修复 Intern-S2-Preview-FP8 转换问题v0.17.0 修复 Intern-S2-Preview-FP8 的转换问题。该问题位于模型转换相关流程中本版本对 Intern-S2-Preview-FP8 convert 进行了修复。该项变更对应更新编号 4923。五、工程、文档与测试更新链接校验、依赖调整、评测工作流同步推进除功能、性能与修复外v0.17.0 也在文档、自动化测试、构建依赖和版本维护方面进行了更新。这些内容虽然不直接体现为模型或推理能力的新增但对于项目的持续维护同样重要。1. 校验跨文件 Markdown 链接目标本次更新修复并增加了跨文件 Markdown 链接目标校验。更新内容明确指出项目对 cross-file Markdown link targets 进行验证。也就是说当 Markdown 文档中的链接指向其他文件时会对目标进行校验。该项变更对应更新编号 4868。2. README 更新以反映 EuroSys 2027 论文接收信息v0.17.0 更新 README以反映 EuroSys 2027 论文接收信息。此次修改属于 README 内容更新明确涉及 EuroSys 2027 论文接收相关信息。该项变更对应更新编号 4891。3. 修复 README 中的语法问题本次版本还对 README 中的语法进行了修复。这是文档质量维护的一部分更新内容明确为修复 README grammar。该项变更对应更新编号 4866。4. 自动化测试移除未使用模型配置并在 YAML 中控制 routed_expertsv0.17.0 改进 autotest移除了未使用的模型配置并通过 YAML 对 routed_experts 进行控制。此次自动化测试改动包括两部分精简未使用的模型配置在 YAML 中对 routed_experts 进行门控控制该项变更对应更新编号 4885。5. CUDA 运行时依赖中移除 flashinfer本版本调整构建依赖从 CUDA runtime requirements 中移除 flashinfer。更新内容的表达十分直接flashinfer 不再位于 CUDA 运行时依赖要求中。该项变更对应更新编号 4902。6. 新增基础 API 评测测试工作流v0.17.0 在持续集成中新增 base API eval test workflow。该项更新为 CI 增加基础 API 评测测试工作流属于自动化测试与持续集成能力维护的一部分。该项变更对应更新编号 4874。7. 版本号升级至 v0.17.0本次发布完成版本号更新正式升级至 v0.17.0。该项变更对应更新编号 4914。六、lmdeploy v0.17.0更新内容完整汇总为了便于快速查看以下对本次版本全部更新进行汇总。新增功能集成 DeepEPv2。PyTorch 引擎支持 Kimi K2.6。kv_connector 支持 Mooncake Store。性能与能力改进Chat Completions 支持服务端 fan-out以支持n 1的 choices。进一步优化 GLM-5.2 serving。CUDA 路径使用 PDL 优化 Paged Attention 和 V4 Prefill。Ascend 更新 Attention 算子后端。PyTorch 优化 compact blocked FP8 MoE 和路由准备过程。降低推测解码前处理与后处理开销。支持非二次幂页面大小。TurboMind 和 PyTorch 引擎支持 structural_tag response_format。问题修复恢复 pre-sm90 GPU 上 FP8 权重仅量化回退能力。视觉模块对格式异常的数据 URL 提供清晰错误信息。修复 API 中的 reponses 接口问题。修复 DSV4 原生 Transformers 预热问题。修复 Anthropic API 内联系统消息支持。限制 DSA Prefill 分数相关内存。修正 GEMM 内核归档链接顺序。拒绝不可用的 GLM 工具调用。避免 Triton 在 Paged Attention Reduction 中发生错误编译。修复 Intern-S2-Preview-FP8 转换问题。其他更新校验跨文件 Markdown 链接目标。README 更新以反映 EuroSys 2027 论文接收信息。修复 README 语法。自动化测试移除未使用模型配置并通过 YAML 控制 routed_experts。CUDA 运行时依赖移除 flashinfer。新增基础 API 评测测试工作流。版本号升级至 v0.17.0。七、结语代码地址github.com/InternLM/lmdeploylmdeploy v0.17.0 是一次内容覆盖广泛的版本更新。在功能层面版本集成 DeepEPv2增加 Kimi K2.6 支持并让 kv_connector 支持 Mooncake Store。在服务和性能层面Chat Completions 获得服务端多候选输出能力GLM-5.2 serving 持续优化CUDA 中的 Paged Attention 与 V4 Prefill 引入 PDLFP8 MoE、路由准备和推测解码前后处理也得到优化。在兼容性和稳定性层面v0.17.0 修复了 TurboMind FP8 权重回退、视觉数据 URL 报错、API 接口、DSV4 预热、Anthropic API 系统消息、DSA Prefill 内存、GLM 工具调用、Triton 编译与模型转换等问题。同时项目还完成了 Markdown 链接校验、README 更新、自动化测试精简、CUDA 依赖调整、基础 API 评测工作流新增与版本号升级等维护工作。整体来看lmdeploy v0.17.0 围绕“能力扩展、性能优化、稳定性修复、工程维护”四个方向完成了一次集中更新。