尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

TokenSpeed 模型启动配方全解析:Kimi K2.5、Qwen3.5 与 GPT-OSS 最佳实践配置清单

TokenSpeed 模型启动配方全解析:Kimi K2.5、Qwen3.5 与 GPT-OSS 最佳实践配置清单 TokenSpeed 模型启动配方全解析Kimi K2.5、Qwen3.5 与 GPT-OSS 最佳实践配置清单【免费下载链接】tokenspeedTokenSpeed is a speed-of-light LLM inference engine.项目地址: https://gitcode.com/gh_mirrors/to/tokenspeedTokenSpeed 是一款面向 Agent 场景的光速 LLM 推理引擎本文带你快速掌握 TokenSpeed 的模型启动配方与最佳实践配置覆盖 Kimi K2.5、Qwen3.5 与 GPT-OSS 三大热门模型家族的启动参数清单、并行策略选择与性能调优顺序帮助新手一次性配出既快又稳的推理服务。 一分钟看懂 TokenSpeed 启动逻辑用 TokenSpeed 起服务只需一条命令tokenspeed serve 模型路径 参数。与 vLLM 类似它对外提供 OpenAI 兼容 API与 TensorRT-LLM 相比它对普通用户几乎零门槛。官方把启动配方Model Recipe定义为先选模型家族 → 再定硬件拓扑 → 最后只调整真正影响运行时行为的参数。完整的官方配方见 docs/recipes/models.md启动检查清单见 docs/guides/launching.md。上图是 Kimi K2.5 在 B200 上的实测 Pareto 曲线在 Attn TP4/TP8 两种拓扑下TokenSpeed蓝线在大并发区间持续跑赢 TensorRT-LLM虚线——这正是配置对了才有速度的底气。三大模型族关键参数速查表维度Kimi K2.5Qwen3.5 30B-A3BGPT-OSS 120B上下文长度26214440960131072张量并行TP4 专家并行TP2 专家并行TP4KV 缓存精度FP8默认FP8量化NVFP4——注意力后端trtllm_mla——MoE 后端flashinfer_trtllmflashinfer_cutlass—解析器kimi_k25/kimik2qwen3思维解析器base推理解析器最大并发序列256默认256 Kimi K2.5 启动配方长上下文 MoE 专家的完整清单Kimi 风格 MoE 模型的启动通常需要四件套远程代码信任、长上下文、推理/工具解析器、显式 MLA/MoE 后端。官方推荐配置4 卡即可起步tokenspeed serve nvidia/Kimi-K2.5-NVFP4 \ --served-model-name kimi-k2.5 \ --trust-remote-code \ --max-model-len 262144 \ --kv-cache-dtype fp8 \ --quantization nvfp4 \ --tensor-parallel-size 4 \ --enable-expert-parallel \ --chunked-prefill-size 8192 \ --max-num-seqs 256 \ --attention-backend trtllm_mla \ --moe-backend flashinfer_trtllm \ --reasoning-parser kimi_k25 \ --tool-call-parser kimik2 \ --host 0.0.0.0 --port 8000新手友好的几个要点256K 上下文 FP8 KV--kv-cache-dtype fp8让长上下文的 KV 显存占用直接减半是长上下文部署的关键开关NVFP4 权重 专家并行--quantization nvfp4配合--enable-expert-parallel4 张卡就能装下这个级别的大 MoE--chunked-prefill-size 8192控制预填充分块大小是长 prompt 场景 TTFT 与吞吐的平衡旋钮解析器别漏--reasoning-parser kimi_k25和--tool-call-parser kimik2决定了思维链与工具调用能否被前端正确拆分。如果还想上 DFlash 投机解码只需保留上面的启动形态追加--speculative-algorithm DFLASH、草稿模型路径、--speculative-num-draft-tokens 8等投机参数即可详见 docs/recipes/models.md 的 DFlash 小节。 Qwen3.5 启动配方从单卡 30B 到多机大 MoEQwen3.5-30B-A3B单节点起步Qwen3.5 30B-A3B 是 MoE 架构注意用 MoE 身份启动并显式选择 MoE 后端tokenspeed serve Qwen/Qwen3-30B-A3B \ --served-model-name qwen3-30b-a3b \ --tensor-parallel-size 2 \ --enable-expert-parallel \ --moe-backend flashinfer_cutlass \ --max-model-len 40960 \ --reasoning-parser qwen3 \ --host 0.0.0.0 --port 8000Qwen3.8-2.4T-A95B双机 16 卡的两套布局超大 MoE 模型需要双机部署两节点运行同一命令、仅--node-rank不同全部节点通过--dist-init-addr指向节点 0多机规则见 docs/serving/parallelism.md。官方给出两种可选布局TP16单副本跨双机小批量场景 TTFT/TPOT 更低专家保持张量并行、无 all-to-all 开销TP8 DP2 EP16DeepEP从中大批量起反超——两个注意力副本加 DeepEP 专家分发/聚合吞吐优势明显。# 节点 0对外提供 HTTP API节点 1 同命令仅 --node-rank 1 tokenspeed serve Qwen/Qwen3.8-2.4T-A95B \ --nnodes 2 --node-rank 0 --nprocs-per-node 8 --world-size 16 \ --dist-init-addr node0-host:25000 \ --attn-tp-size 16 \ --moe-backend auto \ --quantization fp8 --kv-cache-dtype fp8 \ --attention-backend trtllm \ --chunked-prefill-size 8192 \ --max-num-seqs 128 \ --speculative-algorithm MTP --speculative-num-steps 3 \ --reasoning-parser qwen3_thinking --tool-call-parser qwen_coder \ --host 0.0.0.0 --port 8000DeepEP 版本把并行段替换为--attn-tp-size 8 --data-parallel-size 2 --ep-size 16 --moe-backend deep_gemm --all2all-backend deepep并追加--low-latency-max-num-tokens-per-gpu 64——它决定 NVSHMEM 通信堆大小务必按真实单卡解码 token 上限设置超容量批次会被拒绝而不是截断。上图展示了 TokenSpeed 可插拔内核体系在 AMD MI355X 上的表现不同注意力后端Gluon 领先随序列长度与批次的吞吐差异说明显式选择后端对不同硬件的收益相当可观。⚡ GPT-OSS 启动配方小模型简单起大模型调并行GPT-OSS 是新手最友好的起点小模型从最简配置开始大模型才需要调并行与 KV 精度。GPT-OSS-20B单卡即可tokenspeed serve openai/gpt-oss-20b \ --served-model-name gpt-oss-20b \ --tensor-parallel-size 1 \ --max-model-len 131072 \ --chunked-prefill-size 8192 \ --reasoning-parser base \ --host 0.0.0.0 --port 8000GPT-OSS-120B4 卡 FP8 KVtokenspeed serve openai/gpt-oss-120b \ --served-model-name gpt-oss-120b \ --tensor-parallel-size 4 \ --max-model-len 131072 \ --kv-cache-dtype fp8 \ --chunked-prefill-size 8192 \ --max-num-seqs 256 \ --reasoning-parser base \ --host 0.0.0.0 --port 8000如果运行在 8× gfx950 的 AMD 节点上MXFP4 权重的 120B 还可以启用 Gluon Petit MegaMoE 后端--moe-backend gluon_petit单卡最多支撑 1024 个 prefill/decode token见 docs/recipes/models.md 的对应小节。️ 通用调优顺序照着 6 步走就不会错官方配方页末尾给出了适用于所有模型的标准调优顺序docs/recipes/models.md建议按序执行、一次只动一层模型身份模型 ID、--trust-remote-code、tokenizer 模式、--served-model-name上下文与内存--max-model-len与--kv-cache-dtypeFP8 是长上下文首选并行拓扑--tensor-parallel-size/--data-parallel-size/--enable-expert-parallel必须与机器卡数匹配调度器预算先--chunked-prefill-size、--max-num-seqs最后才动--max-total-tokens显式后端基准测试或生产环境请显式指定 attention / MoE / sampling 后端别依赖自动选择按需加高级特性推理解析器、工具解析器、语法约束、投机解码MTP/EAGLE3/DFlash/DSpark只在模型与负载真正需要时再加。上图是 MLA 注意力 Prefill 内核的延迟对比us在多个用例下TokenSpeed 的 MLA 实现均明显低于 TensorRT-LLM MLA——这正是 Kimi 系列 K2.5/K3 采用trtllm_mla/tokenspeed_mla后端时获得的速度来源。⏱️ 启动慢用启动计时快速定位大模型首次启动常伴随权重加载、内核自动调优与 CUDA Graph 捕获。设置环境变量TOKENSPEED_STARTUP_TIMING1即可让运行时打印各阶段 JSON 计时记录权重weights.*、KV 池kv.build、图捕获graph.capture、自动调优kernels.autotune等完整阶段说明见 docs/guides/startup-timing.md。排查时优先看最慢 rank 的外层 wall-clock 记录并区分编译缓存冷启动与稳态运行。 延伸阅读模型启动配方总表docs/recipes/models.md启动检查清单与最小示例docs/guides/launching.md环境搭建与验证docs/guides/getting-started.md并行策略TP/DP/EP/多机docs/serving/parallelism.md服务器参数全表docs/configuration/server.md一句话总结先用配方页找到与你模型家族最接近的启动命令按身份 → 上下文 → 并行 → 预算 → 后端 → 高级特性的顺序逐项确认再用启动计时定位瓶颈——这就是 TokenSpeed 上 Kimi K2.5、Qwen3.5 与 GPT-OSS 的最佳实践配置路径。【免费下载链接】tokenspeedTokenSpeed is a speed-of-light LLM inference engine.项目地址: https://gitcode.com/gh_mirrors/to/tokenspeed创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表