尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

16 卡拉起万亿参数智能体模型 Kimi K2

16 卡拉起万亿参数智能体模型 Kimi K2 16 卡拉起万亿参数智能体模型 Kimi K2【免费下载链接】Kimi-K2Kimi K2 is the large language model series developed by Moonshot AI team项目地址: https://gitcode.com/GitHub_Trending/ki/Kimi-K2想让本地模型自主调用工具、驱动一条自动化流水线时Kimi K2 是当前最可落地的万亿参数智能体 MoE 模型SWE-bench Verified 单次尝试 65.8%16 卡集群即可本地拉起。下文命令按顺序执行约 30 分钟能跑通第一个带工具调用的请求。拆解 1T 参数 MoE 架构与硬指标Kimi K2 是 Moonshot AI 训练的 MoE 模型总参数 1T、激活参数 32B共 61 层1 层 Dense 60 层 MoE每层 384 个专家、每 token 路由选 8 个加 1 个共享专家注意力用 MLA上下文 128K词表 160K。训练用 15.5T tokens、MuonClip 优化器分 Kimi-K2-Base基座适合自训微调和 Kimi-K2-Instruct指令版reflex 级响应、无长思考阶段两个版本。官方开放权重为 block-fp8 格式代码与权重均遵循 Modified MIT 许可。Instruct 版官方评测要点均为 open-source SOTA 口径能力基准Kimi K2智能体编码SWE-bench Verified单次尝试65.8智能体编码SWE-bench Verified多次尝试71.6多语言编码SWE-bench Multilingual47.3终端智能体TerminalBench / Terminus30.0 / 25.0竞赛编程LiveCodeBench v653.7工具调用Tau2 telecomAvg465.8数学AIME 2024Avg6469.616 卡 vLLM 拉起 FP8 推理服务按 部署指南Kimi K2 FP8 权重在 128K 上下文下的最小部署单元是 H200/H20 平台上的 16 卡集群纯 TP 与 DPEP 两种并行都能跑。清单如下GPU16 张 H200 或 H20 级显卡block-fp8 权重约 1TB这是 16 卡下限的由来引擎vLLM ≥ v0.10.0rc1权重moonshotai/Kimi-K2-Instruct 的 block-fp8 checkpoint本地路径写入$MODEL_PATH加载--trust-remote-code必带验证环境nvidia-smi -L | wc -l # 应输出 16 pip show vllm # 确认 v0.10.0rc1 及以上克隆仓库含完整部署与工具调用文档git clone https://gitcode.com/GitHub_Trending/ki/Kimi-K2一条命令拉起 OpenAI 兼容服务vllm serve $MODEL_PATH \ --port 8000 \ --served-model-name kimi-k2 \ --trust-remote-code \ --tensor-parallel-size 16 \ --enable-auto-tool-choice \ # 启用工具调用必带 --tool-call-parser kimi_k2 # 启用工具调用必带拿到服务后用标准 OpenAI SDK 发第一个请求response client.chat.completions.create( modelkimi-k2, messagesmessages, streamFalse, temperature0.6, # README 给 Instruct 的推荐值 max_tokens256 )横向对比四种推理引擎部署指南 官方推荐四个引擎定位各不相同引擎定位关键参数参考配置vLLMTP快速拉起并行度 ≤16--tensor-parallel-size 16单机 16 卡vLLMDPEP吞吐优先、多节点--data-parallel-size 16 --enable-expert-parallel2 节点 × 8 卡SGLangTP 多节点 / PD 分离--tp 16/--disaggregation-mode2 节点 TP164P12D H200KTransformersCPUGPU 混合、资源受限--cache_lens 30000可选 AMX 优化GGUF 权重TensorRT-LLMNVIDIA 原生极致性能--tp_size 16 --ep_size 82 节点TRT-LLM v1.0.0-rc22 节点 DPEP 的改法很小node 1 加--headless --data-parallel-start-rank 8node 0 加--data-parallel-size-local 8 --data-parallel-address $MASTER_IP --data-parallel-rpc-port $PORT完整命令在文档里。SGLang 的 PD 分离模式把 prefill4 节点与 decode12 节点独立扩缩配launch_lb做负载均衡。另注意Kimi K2 复用DeepSeekV3CausalLM结构config.json 里标记model_type: kimi_k2若引擎不在推荐列表内可临时改成deepseek_v3加载工具调用需自行解析。跑通工具调用闭环当你要模型自主决定何时调哪个 API时服务端必须开 parservLLM 用--enable-auto-tool-choice --tool-call-parser kimi_k2SGLang 用--tool-call-parser kimi_k2客户端跑一个直到finish_reason不再是tool_calls的循环finish_reason None while finish_reason is None or finish_reason tool_calls: completion client.chat.completions.create( modelkimi-k2, messagesmessages, temperature0.6, toolstools, tool_choiceauto ) choice completion.choices[0] finish_reason choice.finish_reason if finish_reason tool_calls: messages.append(choice.message) for tc in choice.message.tool_calls: result tool_maptc.function.name) messages.append({role: tool, tool_call_id: tc.id, name: tc.function.name, content: json.dumps(result)})预期输出先打印一行tool_result如{weather: Sunny}模型再基于工具结果生成最终回答。引擎不支持 kimi_k2 parser 时按 工具调用指南 手动解析工具调用块包在|tool_calls_section_begin|/|tool_calls_section_end|内每次调用的 ID 形如functions.{func_name}:{idx}可直接对/completions原始输出做正则提取。压榨吞吐四个关键参数文档明确示例命令并非最优配置但以下参数是官方给出的基线vLLM DPEP 场景参数作用推荐值--max-num-batched-tokens每轮调度的 token 预算平衡 prefill/decode8192--max-num-seqs最大并发序列数256--gpu-memory-utilizationGPU 显存占用上限留给 KV cache0.85temperatureInstruct 版生成稳定性0.6--cache_lensKTransformersKV cache 长度30000扩展方向文档给得很直接节点越多专家并行度可以开得越高推理 batch 与整体吞吐随之放大。30 秒定位高频报错模型直接吐出|tool_calls_section_begin|等 token→ 引擎没加载 kimi_k2 parser → vLLM 补--enable-auto-tool-choice --tool-call-parser kimi_k2SGLang 补--tool-call-parser kimi_k2。引擎不识别模型架构→model_type是kimi_k2且框架未适配 → 把权重目录 config.json 临时改为deepseek_v3。单节点显存不足→ 128K FP8 最小单元就是 16 卡 → 换 2 节点 DPEP第二节点--headless --data-parallel-start-rank 8或 SGLang PD 分离。流式工具调用文本被截断→ 工具调用前的文本不是最终答案 → 每收到一轮 tool_calls 就把已累积文本清零后重来。工具循环退不出去→ 各引擎对工具调用结束的finish_reason取值不一致 → 按所用引擎单独核对tool_call_guidance.md 的注释已提醒。下一步权重更新跟踪 moonshotai 的 Hugging Face 空间与 vLLM / SGLang 的发布节奏文档示例不是最优配置追极致性能以引擎官网为准。拉起命令全集见 docs/deploy_guidance.md流式工具调用与手动解析的完整实现见 docs/tool_call_guidance.md。服务起来后把你的 Agent 框架直接接到/v1/chat/completions——工具调用对客户端只是请求里多传一个tools字段的事。【免费下载链接】Kimi-K2Kimi K2 is the large language model series developed by Moonshot AI team项目地址: https://gitcode.com/GitHub_Trending/ki/Kimi-K2创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表