尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

在 Xinference 中部署 Kimi-K2.5:三格式模型规格、启动命令与源码级适配解析

在 Xinference 中部署 Kimi-K2.5:三格式模型规格、启动命令与源码级适配解析 在 Xinference 中部署 Kimi-K2.5三格式模型规格、启动命令与源码级适配解析【免费下载链接】inferenceSwap GPT for any LLM by changing a single line of code. Xinference lets you run open-source, speech, and multimodal models on cloud, on-prem, or your laptop — all through one unified, production-ready inference API.项目地址: https://gitcode.com/GitHub_Trending/in/inferenceKimi-K2.5 是 Xinference 内置模型库中的一个开源原生多模态智能体agentic大模型支持 chat 与 vision 能力、262144 token 上下文。本文基于 Kimi-K2.5 内置模型文档 展开完整覆盖其三个模型规格pytorch / ggufv2 / mlx的参数、下载源与启动命令并结合 llm_family.json 与 vLLM 引擎适配代码 说明 Xinference 如何注册该模型、解析量化分片以及校验 vLLM 版本兼容性帮助读者直接复制命令完成部署并理解底层机制。模型概览原生多模态 Agentic 模型根据 模型文档 与 llm_family.json 中的注册条目Kimi-K2.5 的核心元信息如下属性值模型名称Kimi-K2.5上下文长度262144支持语言en英文、zh中文模型能力chat、vision架构architecturesKimiK25ForConditionalGeneration停止信号stop: [[EOS]]stop_token_ids: [163585]官方描述为Kimi K2.5 是在 Kimi-K2-Base 之上、通过约 15 万亿混合视觉与文本 token 持续预训练构建的开源原生多模态智能体模型将视觉与语言理解同高级 agentic 能力、即时instant与思考thinking模式、对话与智能体范式无缝整合。这一描述与源码中注册的 chat template 能力相互印证——模板内置了|tool_calls_section_begin|工具调用段、|im_system|tool_declare|im_middle|工具声明段以及thinking变量控制的/think推理块渲染逻辑详见下文“chat template”一节。三个模型规格与启动命令Xinference 为 Kimi-K2.5 注册了三个模型规格Model Spec模型规模均记为1058_59十亿参数即约 1058.59B。三者对应不同的权重格式、推理引擎与下载源启动命令的结构一致区别仅在于--model-engine、--model-format与--quantization取值。Spec 1pytorch 格式vLLM / Transformers 引擎参数值模型格式pytorch模型规模1058_59B量化选项none非量化支持引擎vLLM、TransformersModel IDmoonshotai/Kimi-K2.5模型仓库Hugging Face、ModelScope启动命令${engine}、${quantization}为占位符需按上方选项替换xinference launch --model-engine ${engine} --model-name Kimi-K2.5 \ --size-in-billions 1058_59 --model-format pytorch --quantization ${quantization}该规格面向多卡 GPU 集群部署非量化的 ~1058B 参数模型需要大显存规模多节点或多卡张量并行pytorch 权重由 vLLM 或 Transformers 引擎直接加载。结合 vllm/core.py 的版本适配逻辑见后文此路径对 vLLM 版本有硬性要求。Spec 2ggufv2 格式llama.cpp 引擎参数值模型格式ggufv2模型规模1058_59B分片文件模板Kimi-K2.5-{quantization}-{part}.gguf支持引擎llama.cppModel IDunsloth/Kimi-K2.5-GGUF模型仓库Hugging Face、ModelScope启动命令xinference launch --model-engine ${engine} --model-name Kimi-K2.5 \ --size-in-billions 1058_59 --model-format ggufv2 --quantization ${quantization}ggufv2 规格的关键细节在 llm_family.json 中注册为model_file_name_split_template: Kimi-K2.5-{quantization}-{part}.gguf即该模型的 GGUF 权重按量化档位拆分为多个分片文件Xinference 下载时按模板逐片拉取再合并。从quantization_parts的注册结构看不同仓库提供的量化档位并不对等Hugging Faceunsloth/Kimi-K2.5-GGUF覆盖最完整的量化矩阵包括BF1646 片、Q8_023 片、Q6_K18 片、Q5_K_M / UD-Q5_K_XL16 片、Q5_K_S15 片、Q4_0 / Q4_1 / Q4_K_M / Q4_K_S / UD-Q4_K_XL各 13 片、IQ4_NL / IQ4_XS各 12 片、Q3_K_M / UD-Q3_K_XL各 11 片、Q3_K_S10 片、Q2_K / Q2_K_L / UD-Q2_K_XL各 8 片、UD-IQ1_M / UD-IQ2_M / UD-IQ2_XXS各 7 片、UD-IQ1_S6 片、UD-IQ3_XXS9 片、UD-Q6_K_XL19 片、UD-Q8_K_XL25 片ModelScopeunsloth/Kimi-K2.5-GGUF仅提供 Q8_023 片、UD-Q2_K_XL8 片、UD-Q4_K_XL13 片三档分片。因此在选择--quantization时需与所选下载源对齐文档中规格说明标注的量化列表为none而实际可下载的量化档位以quantization_parts注册的完整矩阵为准。分片数量越少意味着磁盘占用与下载时间越小但量化位宽越低对 ~1058B 参数规模模型的精度损失越大读者应按自身显存/内存预算自行权衡。Spec 3mlx 格式MLX 引擎Apple 平台参数值模型格式mlx模型规模1058_59B量化选项3bit支持引擎MLXModel IDmlx-community/Kimi-K2.5-{quantization}量化名内嵌于仓库路径模型仓库Hugging Face、ModelScope启动命令xinference launch --model-engine ${engine} --model-name Kimi-K2.5 \ --size-in-billions 1058_59 --model-format mlx --quantization ${quantization}mlx 规格仅注册了3bit一个量化档见 llm_family.json且 Model ID 本身带{quantization}占位符即量化档位决定最终下载的模型仓库路径。该路径面向 Apple Silicon 统一内存设备是三个规格中唯一针对非 CUDA 硬件的方案。源码佐证Xinference 如何注册并服务 Kimi-K2.5文档中的规格表并非手写静态内容而是由 llm_family.json 中的模型族条目驱动生成的。围绕 Kimi-K2.5 条目约第 25958–26522 行可以确认以下几项源码级事实1. 架构与推理能力声明。条目中architectures: [KimiK25ForConditionalGeneration]表明这是一个多模态条件生成架构与文档标注的vision能力一致stop: [[EOS]]与stop_token_ids: [163585]定义了生成停止条件引擎在解码时据此截断输出。2. chat template 印证“agentic instant/thinking 双模式”描述。条目注册的 Jinja 模板包含以下关键机制工具调用渲染|tool_calls_section_begin|/|tool_call_begin|{{id}}|tool_call_argument_begin|{{arguments}}|tool_call_end|结构以及 assistant 历史消息中 tool_calls 的统一回放工具声明注入当存在tools参数时以|im_system|tool_declare|im_middle|段向系统区注入工具 schema支持tools_ts_str或 JSON 序列化两种形式thinking/instant 模式切换模板以thinking is defined and thinking is false条件决定是渲染空的/think即时模式还是开放的/think思考模式并对历史消息中的reasoning_content做保留渲染多模态占位符image 内容渲染为|media_begin|image|media_content||media_pad||media_end|video 内容渲染为|kimi_k25_video_placeholder|。这说明“对话与智能体范式”“即时与思考模式”的描述有模板层面的直接实现支撑而非仅停留在市场描述。3. 虚拟环境依赖自动安装。条目中的virtualenv.packages声明了引擎条件依赖vllm_dependencies当#engine# vllm、sglang_dependencies当#engine# sglang、以及 vLLM 引擎下的#system_numpy#。这对应 Xinference 的模型隔离机制——启动时按引擎自动装配运行依赖无需用户手动管理 Python 环境。引擎兼容性vLLM 版本门槛pytorch 规格声明支持 vLLM 引擎而 vLLM 对KimiK25ForConditionalGeneration的模型支持本身有版本门槛。vllm/core.py 中的版本适配函数明确写道if effective_version version.parse(0.15.0): _append_unique( VLLM_SUPPORTED_MULTI_MODEL_LIST, KimiK25ForConditionalGeneration )即 vLLM 低于 0.15.0 时该架构不会被加入VLLM_SUPPORTED_MULTI_MODEL_LIST白名单启动 vLLM 引擎加载 Kimi-K2.5 会被兼容性检查拦截。由此可推断使用--model-format pytorch --model-engine vllm部署 Kimi-K2.5 时应确认环境中的 vLLM 版本不低于 0.15.0。llama.cppggufv2与 MLXmlx路径则不受该 vLLM 版本约束它们分别由 llama.cpp 引擎 与 MLX 引擎 独立加载。部署注意事项资源前提约 1058.59B 参数、262144 上下文意味着 pytorch 非量化规格需要大规模显存多卡/多节点张量并行ggufv2 与 mlx 规格则是通过量化把内存/显存需求降到可承受范围的前提占位符替换三条启动命令中的${engine}与${quantization}必须替换为该规格实际支持的引擎名与量化档且 ggufv2 量化档需与所选下载源Hugging Face 全量矩阵 vs ModelScope 三档匹配分片下载ggufv2 规格按Kimi-K2.5-{quantization}-{part}.gguf模板逐片下载低档位如 UD-Q2_K_XL 仅 8 片下载量显著低于高档位如 BF16 的 46 片适用前提以上结论均基于当前仓库中 llm_family.json 与 vllm/core.py 的注册内容模型仓库可用性与量化档集合以各模型仓库实际发布为准。【免费下载链接】inferenceSwap GPT for any LLM by changing a single line of code. Xinference lets you run open-source, speech, and multimodal models on cloud, on-prem, or your laptop — all through one unified, production-ready inference API.项目地址: https://gitcode.com/GitHub_Trending/in/inference创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表