尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

Qwen 系列本地部署——Moe架构的有趣亮点

Qwen 系列本地部署——Moe架构的有趣亮点 8G 显存跑三个 Qwen8B 稠密 / 27B 稠密 / 35.5B MoE 实测对比结果有点反直觉环境Windows 11 · 8GB 显存 GPU · Ollama · 全部 Q4_K_M 4-bit 量化 所有数据来自本机ollama show与统一 prompt 实测无理论推算。一、三只选手我在 8G 显存的机器上先后部署了三个 Qwen 系列本地模型规格跨度很大Ollama 模型名参数量架构量化显存策略qwen-fast8.2BQwen3 稠密Q4_K_M全 GPUqwen3.8-fast27.3B稠密Q4_K_M28 层驻留 GPU其余 offload 内存qwen36-fast35.5BMoE 混合专家Q4_K_M10 层驻留 GPU其余 offload 内存三个模型在 8G 显存上都成功跑通。怎么跑通的见第四节先看最有意思的实测结果。二、同题实测速度对比统一 prompt“用三句话解释什么是 Transformer 的自注意力机制”通过 Ollama REST API 计时统计 eval 阶段生成速度模型总耗时输出 tokens生成速度Qwen3-8B8.2B27.4s32423.4 tokens/sQwen3.635.5B MoE140.7s135312.1 tokens/sQwen3.827.3B115.4s1812.7 tokens/s两只大模型都是 thinking 模型输出含思考过程 token同样的 4-bit 量化同样的推理框架。结果反直觉总参数量最大的 35.5B MoE速度是 27.3B 稠密模型的 4.5 倍——而且它只有 10 层驻留 GPU27B 那只驻留了 28 层。三、为什么 35.5B 反而吊打 27.3B关键在 MoEMixture of Experts混合专家的稀疏激活机制稠密模型每个 token 都要经过全部参数的计算——27.3B 就是每 token 实打实算 27.3BMoE 模型由多个专家网络组成路由器每个 token 只挑一小部分专家激活一个直接证据35.5B 那只模型的官方命名是 Qwen3.6-35B-A3B——A3B 就是激活 3B总参 35.5B每 token 实际参与计算的只有约 3B。这带来一个重要的概念拆分总参数量→ 决定存储成本权重文件多大、内存占多少激活参数量→ 决定计算成本每 token 实际要算多少、要搬运多少数据offload 场景下计算成本更致命GPU 和内存之间的数据搬运是最大瓶颈MoE 每 token 需要访问的权重流远小于稠密模型所以即使大部分层在内存里35.5B MoE 依然跑出了 4.5 倍于 27B 稠密的速度。参数量大 跑不动这个直觉在 MoE 时代需要修正了。四、8G 显存的生存策略层分配 offloadQ4_K_M 量化后 27.3B 模型权重约 16GB显存只有 8G。Ollama 的num_gpu参数控制前 N 层放进显存、剩余层留在内存层数给多显存溢出OOM层数给少能跑但慢计算大头落在 CPU/内存最优解 显存刚好用满、不溢出的临界层数27.3B 稠密模型我最终设在 28 层35.5B MoE 只需要 10 层——它每 token 要算的东西少对 GPU 层数的依赖没那么极端。另一个吃显存的是KV cache上下文越长历史 token 的 Key/Value 缓存越大和模型权重抢同一块显存。Qwen3.6 标称 256K 上下文我实际降到 128K 使用——质量感知不到差异显存压力小一大截。五、怎么选一张表说清场景推荐理由日常对话、工具调用、批量任务Qwen3-8B23.4 tokens/s 体感流畅32K 上下文够用追求答案质量、能接受等待Qwen3.8-27.3B稠密大模型输出稳2.7 tokens/s 相当于逐句读显存小但想要大模型能力Qwen3.6-35.5B MoE总参最大却最快的大模型12.1 tokens/s 可用性好六、延伸从网安视角看 abliterated 消融模型作为网络空间安全专业的学生我在部署原版模型之外还下载了社区 huihui-ai 发布的三个对应abliterated消融版本Qwen3-8B-abliteratedQ4_K_MQwen3.8-27B-AbliteratedQ4_K_MHuihui-Qwen3.6-35B-A3B-abliteratedQ4_K所谓 abliterated是通过消融模型内部的拒绝方向refusal direction使模型的安全对齐失效、不再触发拒答。从 AI 安全研究的角度这类模型的价值不在能说什么而在于它揭示了一个事实当前大模型的安全对齐更像行为矫正而非能力删除——拒绝行为可以被定向消融意味着对齐防线存在结构性脆弱。这和我课程里做的对抗样本、数据投毒实验是同一脉络安全机制是可攻击面需要纵深防御而不是一劳永逸的开关。后续计划对原版与消融版做拒绝行为对比测试整理成独立文章。注相关内容仅用于安全研究与学习。七、复现部署与配置记录llm-learning-journey/02-qwen-deploy含ollama show原始输出测速脚本bench_test.py纯标准库对任意 Ollama 模型输出 tokens/s欢迎测试
返回列表