尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

在 Xinference 中部署 Qwen3-Next-Instruct:四种格式规格与多引擎启动指南

在 Xinference 中部署 Qwen3-Next-Instruct:四种格式规格与多引擎启动指南 在 Xinference 中部署 Qwen3-Next-Instruct四种格式规格与多引擎启动指南【免费下载链接】inferenceSwap GPT for any LLM by changing a single line of code. Xinference lets you run open-source, speech, and multimodal models on cloud, on-prem, or your laptop — all through one unified, production-ready inference API.项目地址: https://gitcode.com/GitHub_Trending/in/inference本篇技术指南围绕 Xinference 内置模型清单中的Qwen3-Next-InstructQwen3-Next 系列首款模型Qwen3-Next-80B-A3B展开完整覆盖其上下文长度、语言与能力设定以及 pytorch / fp8 / awq / mlx 四种 Model Spec 的模型 ID、量化选项、支持引擎与对应xinference launch启动命令并结合仓库源码llm_family.json、vLLM 补丁与单元测试深入解析元数据背后的实现细节。读完本文你将能够在本地、云端或 Apple 芯片设备上用一行命令把 Qwen3-Next-Instruct 跑起来并通过统一的 OpenAI 兼容推理 API 提供服务。模型概览Qwen3-Next 系列的首个成员按官方内置模型清单 qwen3-next-instruct.rst 的记载Qwen3-Next-Instruct 的核心规格如下属性值Context Length上下文长度262144约 256K tokensModel Name模型名Qwen3-Next-InstructLanguages语言en, zhAbilities能力chat, toolsDescriptionQwen3-Next-80B-A3B 是 Qwen3-Next 系列的首款模型其中Qwen3-Next-80B-A3B表明这是一个80B 总参数量、3B 激活参数的 MoE 模型。这一总参数 80B / 激活参数 3B的信息也直接写入了仓库内置模型元数据 llm_family.json该条目的model_size_in_billions为 80同时activated_size_in_billions为 3二者共同决定了模型加载时的显存估算与调度策略。chat能力意味着它适用于通用对话与指令跟随tools能力则说明模型原生支持工具调用function calling适合作为 Agent 的后端 LLM——配合 Xinference 的统一推理 API可以无缝替换任何基于 OpenAI 协议的应用。四种 Model Spec格式、量化与引擎矩阵与许多大模型只提供单一权重格式不同Qwen3-Next-Instruct 在 Xinference 中以四种 Model Spec 注册覆盖 PyTorch 原始权重、FP8 高密度推理、AWQ 低比特量化与 MLX Apple 芯片推理四类使用场景Spec模型格式参数量量化选项支持引擎模型 IDSpec 1pytorch80BnonevLLM, Transformers, SGLangQwen/Qwen3-Next-80B-A3B-InstructSpec 2fp880Bfp8vLLM, SGLangQwen/Qwen3-Next-80B-A3B-Instruct-FP8Spec 3awq80B4bit, 8bitvLLM, Transformers, SGLangcpatonn/Qwen3-Next-80B-A3B-Instruct-AWQ-{quantization}Spec 4mlx80B4bit, 5bit, 6bit, 8bitMLXmlx-community/Qwen3-Next-80B-A3B-Instruct-{quantization}需要特别注意的是fp8 格式只支持 vLLM 与 SGLang两个引擎不支持 Transformers 后端若显存有限又想保留较高精度FP8 是比原始 BF16/FP16 更省显存的选择。awq 格式的模型 ID 中包含{quantization}占位符实际下载时会替换为 4bit 或 8bit例如cpatonn/Qwen3-Next-80B-A3B-Instruct-AWQ-4bit。mlx 格式专为 Apple Silicon 设计由 MLX 引擎驱动量化档位最多4bit / 5bit / 6bit / 8bit适合在 Mac 上以低比特运行 80B 模型。模型可从Hugging Face 与 ModelScope两大模型仓库拉取两类源在 llm_family.json 中分别注册了model_idModelScope 侧使用cpatonn-mirror/...前缀。一行命令启动四种规格的 launch 命令原文档为每个 Model Spec 提供了标准启动命令。命令中的${engine}与${quantization}均为占位符需要按上表替换为实际值例如--model-engine vllm --quantization 4bit。Spec 1PyTorch 原始权重none 量化xinference launch --model-engine ${engine} --model-name Qwen3-Next-Instruct --size-in-billions 80 --model-format pytorch --quantization ${quantization}该格式无量化quantization取none引擎可在 vLLM、Transformers、SGLang 中任选其一。追求最高精度的实验场景使用此规格。Spec 2FP8 权重fp8 量化xinference launch --model-engine ${engine} --model-name Qwen3-Next-Instruct --size-in-billions 80 --model-format fp8 --quantization ${quantization}quantization取fp8引擎仅支持 vLLM 与 SGLang。FP8 在保持接近全精度效果的同时显著降低显存占用适合单卡或显存受限的生产环境。Spec 3AWQ 量化权重4bit / 8bitxinference launch --model-engine ${engine} --model-name Qwen3-Next-Instruct --size-in-billions 80 --model-format awq --quantization ${quantization}quantization从4bit、8bit中二选一引擎支持 vLLM、Transformers、SGLang。AWQ 是激活感知的权重量化方案4bit 档位可将 80B 模型的显存需求大幅压缩是本地低成本部署的首选。Spec 4MLX 权重4bit / 5bit / 6bit / 8bitxinference launch --model-engine ${engine} --model-name Qwen3-Next-Instruct --size-in-billions 80 --model-format mlx --quantization ${quantization}quantization从4bit、5bit、6bit、8bit中选取引擎固定为 MLX仅适用于 Apple SiliconM 系列芯片环境。Xinference 的 MLX 后端基于 mlx/core.py 中的MLXBatchModel实现连续批处理continuous batching与 prompt 缓存让 Mac 也能高效推理 80B 级别模型。启动命令参数拆解参数含义取值示例--model-engine推理后端引擎vllm/transformers/sglang/mlx--model-name内置模型注册名Qwen3-Next-Instruct--size-in-billions模型规格参数十亿80--model-format权重格式pytorch/fp8/awq/mlx--quantization量化方式none/fp8/4bit/5bit/6bit/8bit启动成功后模型会以 OpenAI 兼容的推理 API 对外提供服务可以通过 RESTful 客户端参见 client/restful/restful_client.py或标准 OpenAI SDK 进行对话与工具调用。源码级元数据模型注册与运行时的背后细节Xinference 内置模型清单由 llm_family.json 统一管理。Qwen3-Next-Instruct 对应条目llm_family.json不仅包含上表可见的规格还携带了启动与推理所需的关键运行时配置架构与类型architectures为Qwen3NextForCausalLMmodel_type为qwen3_next这是 vLLM、SGLang 等引擎路由与补丁匹配的依据。停止条件stop列表为[|endoftext|, |im_end|]同时stop_token_ids为[151643, 151645]确保流式生成在正确的特殊 token 处截断。工具调用解析tool_parser为qwen即使用 Qwen 系列的 XML 风格工具调用解析器对应仓库中的 tool_parsers 目录。对话模板条目内置完整的 Jinjachat_template在启用工具时使用tools/tools与tool_call/tool_call标签组织函数调用格式无工具时使用标准 ChatML 格式。虚拟环境依赖virtualenv.packages按引擎条件声明依赖#vllm_dependencies#、#transformers_dependencies#、#sglang_dependencies#、#mlx_dependencies#Xinference 会为每个引擎创建独立的虚拟环境避免不同推理后端的依赖冲突vLLM 引擎额外声明#system_numpy#保证系统 numpy 与 vLLM 环境兼容。这些元数据同样由单元测试守护在 test_llm_family.py 中参数化测试断言Qwen3-Next-Instruct的架构为Qwen3NextForCausalLM且各格式的量化集合与文档一致pytorch →{none}、fp8 →{fp8}、awq →{4bit, 8bit}。vLLM 引擎的专属补丁混合注意力 KV Cache 分页修正Qwen3-Next 是**混合注意力hybrid attention线性注意力 全注意力**模型。在 vLLM 0.20.x 上当不同类型层的 KV Cache page size 无法整除时vLLM 会抛出NotImplementedError导致模型无法启动。仓库为此内置了自动补丁 hybrid_kv_cache_page_size.py该补丁注册为VllmPatch其architectures集合显式包含Qwen3NextForCausalLMhybrid_kv_cache_page_size.py注释中指出该问题对应上游 issue见 xorbitsai/inference#5043。补丁会定位模型虚拟环境中的 vLLM 安装v1/core/kv_cache_utils.py将硬报错替换为LCM最小公倍数填充策略当较小层的 page size 能整除最大 page size 时沿用原逻辑否则计算所有较小 page size 的 LCM把目标 page size 向上取整为 LCM 的整数倍从而统一各层 KV Cache 规格并附带填充开销日志hybrid_kv_cache_page_size.py。补丁具备幂等性已打过标记# [xinference-patch] hybrid KV cache LCM padding的文件会被跳过当上游 vLLM 正式合入修复后补丁的removal_condition指向 vllm-project/vllm#37121 / #38041该补丁将自动不再生效。因此在使用 vLLM 引擎启动 Qwen3-Next-Instruct 时Xinference 会自动处理混合注意力的 KV Cache 兼容问题无需手工修改 vLLM 源码。相关阅读与延伸文档模板 llm.rst.jinja 展示了上述模型规格页面的生成逻辑Qwen3-Next-Instruct 页面即由该模板基于 llm_family.json 渲染而来。同系列还有推理增强版Qwen3-Next-Thinking能力为 chat、reasoning、tools注册在 llm_family.json如需带思维链的推理模型可参考其文档页 qwen3-next-thinking.rst。更完整的命令行参数GPU 选择、工作目录、额外 vLLM/SGLang 参数等可参阅 using_xinference.rst 与模型启动指南 launch.rst。总结Qwen3-Next-InstructQwen3-Next-80B-A3B在 Xinference 中以 pytorch / fp8 / awq / mlx 四种规格、六档量化粒度覆盖从高精度研究到 Apple 芯片本地部署的完整路径启动命令即xinference launch --model-name Qwen3-Next-Instruct --size-in-billions 80配上对应的--model-format与--quantization。底层由 llm_family.json 提供元数据、按引擎自动创建虚拟环境并由 vLLM 混合 KV Cache 补丁兜底确保了换一行代码即可接入的稳定推理体验。【免费下载链接】inferenceSwap GPT for any LLM by changing a single line of code. Xinference lets you run open-source, speech, and multimodal models on cloud, on-prem, or your laptop — all through one unified, production-ready inference API.项目地址: https://gitcode.com/GitHub_Trending/in/inference创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表