尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

Kimi K2 大模型部署与选型:1T 参数 MoE 模型 16 卡怎么跑起来

Kimi K2 大模型部署与选型:1T 参数 MoE 模型 16 卡怎么跑起来 Kimi K2 大模型部署与选型1T 参数 MoE 模型 16 卡怎么跑起来【免费下载链接】Kimi-K2Kimi K2 is the large language model series developed by Moonshot AI team项目地址: https://gitcode.com/GitHub_Trending/ki/Kimi-K2Kimi K2 是 Moonshot AI 开源的 1T 参数 MoE 大语言模型主打智能体工具调用与代码修复提供 Base 和 Instruct 两个版本。这篇文章帮你按场景选对版本并用最小 16 卡配置跑起来。它解决什么问题你需要一个能自主调工具查天气、搜数据库、改代码的开源模型但多数开源模型要么不会稳定发起函数调用要么调用了你也没法解析或者你想在自己的领域数据上微调拿到的却是已经定型的对话模型改不动风格。Kimi K2 同时给了两端Instruct 直接接管智能体任务Base 留给你做二次训练两者共享同一套部署门槛。项目全景速览Kimi K2 是一个总参数 1T、每 token 只激活 32B 参数的旗舰 MoEMixture of Experts即把模型拆成很多专家每次只用其中几个做计算大模型权重以 block-fp8 格式发布代码与权重均为 Modified MIT 许可适合做对话、智能体、代码和数学推理场景。核心参数架构MoE61 层、384 个专家每 token 选 8 个专家 1 个共享专家注意力用 MLA规模总参数 1T / 激活 32B词表 160K上下文 128K硬件门槛最小部署单元为 16 张 H200 或 H20 GPU128k 序列长度推理引擎官方推荐 vLLMv0.10.0rc1、SGLang、KTransformers、TensorRT-LLMv1.0.0-rc2版本/能力横向对比Kimi K2 系列提供两个 checkpoint模型权重在不同训练阶段导出的快照通俗说就是你选用哪一版Checkpoint定位代表公开成绩适合谁Kimi-K2-Instruct后训练版本反应级reflex-grade速度不带长思考SWE-bench VerifiedAgentic单次尝试65.8SWE-bench Multilingual 47.3GPQA-Diamond 75.1Tau2 retail 70.6直接上线对话、工具调用、修代码Kimi-K2-Base预训练底座未做指令微调MMLU 87.85-shotMMLU-Pro 69.2GSM8k 92.18-shot领域微调、研究、自定义训练两个版本架构和部署门槛完全一致差异只在训练策略Instruct 拿来即用Base 直接拿去聊天效果会打折扣但底子分并不低留给你的微调空间更大。成绩均来自官方评测完整榜单见 README。按场景对号入座如果你在搭带工具调用的智能体客服、检索、查库选Instruct因为模型会自主决定何时调用函数且 vLLM/SGLang 内置kimi_k2解析器你只需传入工具描述。如果你要做领域微调私有数据 SFT、定制对话风格选Base因为没被指令微调定型你的数据直接决定最终行为。如果你要大规模在线服务选Instruct SGLang因为 DPEP数据并行专家并行把专家拆到多卡以放大并发配合预填/解码分离的官方 4P12D 示例可以横向扩吞吐。如果你的集群凑不齐 16 卡同构 GPU选KTransformers因为它走 GGUF 权重 CPU 卸载路径并支持 AMX 优化。快速上手 权重从官方 Hugging Face 的 moonshotai 组织下载block-fp8 格式仓库里的文档和配置可以这样拿到git clone https://gitcode.com/GitHub_Trending/ki/Kimi-K2在 16 张 H200/H20 上用 vLLM 启动Tensor Parallel 即把模型切到多卡并行计算16 卡内可用纯 TPvllm serve $MODEL_PATH \ --port 8000 \ --served-model-name kimi-k2 \ --trust-remote-code \ --tensor-parallel-size 16 \ --enable-auto-tool-choice \ --tool-call-parser kimi_k2服务起来后用 OpenAI 兼容接口对话官方推荐 temperature0.6completion client.chat.completions.create( modelkimi-k2, messages[{role: user, content: 请简要自我介绍}], temperature0.6, max_tokens256, )常见坑 ⚠️工具调用返回|tool_call_begin|之类的原始标签原因是引擎没开工具解析器vLLM 要同时加--enable-auto-tool-choice --tool-call-parser kimi_k2SGLang 加--tool-call-parser kimi_k2也可以按 工具调用指南 手动解析。非推荐框架报kimi_k2不识别原因是 config.json 里model_type写的是kimi_k2以便引擎做专属优化解法是把model_type临时改成deepseek_v3加载兼容手段工具调用需自己实现解析逻辑。16 卡部署吞吐上不去或显存吃紧原因是 128K 上下文的 KV cache 压力大、纯 TP16 并发有限解法是切 DPEPvLLM 示例用--data-parallel-size 16 --enable-expert-parallel --gpu-memory-utilization 0.85或上 SGLang 预填/解码分离。延伸资源部署指南 docs/deploy_guidance.mdvLLM / SGLang / KTransformers / TensorRT-LLM 的最小启动命令与关键参数说明工具调用指南 docs/tool_call_guidance.md工具描述模板、流式调用与手动解析的完整示例tech_report.pdf完整技术报告LICENSEModified MIT代码与权重同许可一句话收尾要直接用就选 Instruct 并带上解析器参数要自己练就选 Base硬件都是 16 卡起步——这就是 Kimi K2 的全部选型逻辑。【免费下载链接】Kimi-K2Kimi K2 is the large language model series developed by Moonshot AI team项目地址: https://gitcode.com/GitHub_Trending/ki/Kimi-K2创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表