尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

Bonsai-demo Linux部署实战:CUDA/Vulkan/ROCm/CPU四大后端全解析,两条命令快速上手

Bonsai-demo Linux部署实战:CUDA/Vulkan/ROCm/CPU四大后端全解析,两条命令快速上手 Bonsai-demo Linux部署实战CUDA/Vulkan/ROCm/CPU四大后端全解析两条命令快速上手【免费下载链接】Bonsai-demoBonsai Demo项目地址: https://gitcode.com/GitHub_Trending/bo/Bonsai-demoBonsai-demo是一个把1-bit/三值量化大模型Bonsai、Ternary-Bonsai1.7B–27B跑在本地设备上的开源部署项目。它通过一条 setup.sh 脚本自动安装依赖、下载模型与预编译二进制让 Linux 用户在CUDA、Vulkan、ROCm、CPU 四大后端上都能以极低显存占用运行 256k 长上下文、支持视觉与工具调用的 27B 模型——27B 的 1-bit 权重仅 3.53 GiB比常见 4-bit 量化小了 75% 以上。为什么 Bonsai-demo 值得在 Linux 上手 上图为社区基准图横轴是模型体积GB对数刻度纵轴是平均基准分。可以看到Bonsai 系列在 0.25–1 GB 的极小体积下跑分显著高于 Qwen3、Minstral3 等同级别模型——这正是极致量化路线的核心卖点小文件、高能效普通硬件也能跑大模型。对 Linux 用户而言项目内置了针对各后端的预编译二进制bin/cuda/、bin/vulkan/、bin/rocm/、bin/cpu/无需编译即可开箱使用想自己构建源码也只需一条命令。快速开始两条命令完成部署前置要求一个较新的 Linux 发行版x64 或 arm64 均可。git clone https://gitcode.com/GitHub_Trending/bo/Bonsai-demo cd Bonsai-demo # 可选选择模型尺寸27B默认/ 8B / 4B / 1.7B export BONSAI_MODEL27B # 一条命令搞定装依赖、下模型、按 GPU 类型下载对应后端二进制 ./setup.shsetup.sh 会自动检测你的环境并下载对应后端的预编译二进制可重复执行已完成步骤会自动跳过。随后启动带 Web 聊天界面的推理服务器./scripts/start_llama_server.sh # 打开 http://localhost:8080scripts/start_llama_server.sh 会自动检测 GPUCUDA / ROCm / Vulkan / Metal并卸载全部层不想用 GPU 时设BONSAI_NGL0即可强制 CPU 推理。CUDA / Vulkan / ROCm / CPU四大后端怎么选后端适用硬件特点源码构建CUDANVIDIA 显卡性能最强1-bit/三值格式均已合入上游 llama.cpp独占推测解码加速scripts/build_cuda_linux.shVulkanAMD / Intel / NVIDIA 通用兼容性最广一张sudo apt install libvulkan-dev glslc就能构建cmake -DGGML_VULKANONROCmAMD 独显 / APUAMD 专属快速通道需 ROCm 工具链hipcccmake -DGGML_HIPONCPU任何机器零门槛兜底1.7B/4B 模型流畅可用scripts/build_cpu_linux.shCUDANVIDIA 用户的最快路径拥有 NVIDIA 显卡时直接走 scripts/build_cuda_linux.sh脚本会自动探测 CUDA 版本也可用--cuda-path /usr/local/cuda-12.8指定工具链。预编译二进制覆盖 CUDA 12.4 与 12.8 两档。CUDA 后端是 1-bitQ1_0与三值PQ2_0/Q2_0量化支持最完整的后端也是唯一默认不限图像 token 上限的后端并且支持 SPECULATIVE.md 中的DSpark 推测解码在 L40S 上实测三值 27B 解码提速 1.8–2.4 倍1-bit 27B 提速 1.4–1.75 倍只需BONSAI_SPECULATIVE1开启。Vulkan一张命令覆盖最多的显卡Vulkan 是跨厂商的通用图形接口AMD、Intel 核显、NVIDIA 都能跑。没有专用驱动栈也可以优先选它。构建需先安装 Vulkan SDKsudo apt install libvulkan-dev glslc cmake -B build -DCMAKE_BUILD_TYPERelease -DGGML_VULKANON cmake --build build -j$(nproc)注意Vulkan 后端的启动脚本默认会把图像降采样到约 1024 个视觉 token速度优先需要 OCR 级细节时设BONSAI_IMAGE_MAX_TOKENS0。ROCmAMD 的专属快速通道AMD 独显或 Strix Halo 这类大内存 APU 可走 ROCmHIP路径需要 ROCm 工具链cmake -B build -DCMAKE_BUILD_TYPERelease -DGGML_HIPON cmake --build build -j$(nproc)社区实测中 AMD Strix Halo128 GB 统一内存 上Bonsai-8B 解码 96 t/sBonsai-1.7B 预填充高达5,001 t/s——128 GB 统一内存甚至能塞下 80B MoE 模型51 t/s 生成。CPU没有显卡也能跑兜底方案是纯 CPU 构建scripts/build_cpu_linux.shx64/arm64 通吃无任何 GPU 依赖。量化模型的 CPU 友好度远超普通模型社区里一台只有 4 核的 i3-7100 虚拟机上Bonsai-1.7B 也能跑到 14.26 t/s同尺寸全精度模型通常不足 1 t/s日常问答完全可用27B 则建议至少配 16 GB 内存并使用BONSAI_CTX限制上下文。社区真实硬件基准一览 以下数据来自 community-benchmarks/tg128 解码速度pp512 预填充速度硬件后端模型解码 (t/s)预填充 (t/s)NVIDIA L40S 48 GBCUDABonsai-27B (1-bit)107.52,937NVIDIA L40S 48 GBCUDATernary-27B (三值)74.33,036AMD Strix Halo 128 GBROCmBonsai-8B961,325AMD Strix Halo 128 GBVulkanBonsai-8B64831GTX 1080 Ti 11 GBCUDABonsai-27B (1-bit)28.3285Intel i3-7100 (4 核)CPUBonsai-1.7B14.332.0两个值得注意的结论老显卡也能跑大模型2017 年的 Pascal 架构 GTX 1080 Ti 跑 27B 解码 28 t/s且 11 GB 显存还剩 7 GB 给 KV 缓存同硬件后端差异明显Strix Halo 上 ROCm 比 Vulkan 快约 50%AMD 卡有 ROCm 时优先选它。常用调优环境变量所有启动脚本都由环境变量驱动完整 24 项参考见 environment_variables.md。最常用的几个变量默认作用BONSAI_MODEL27B模型尺寸27B/8B/4B/1.7BBONSAI_FAMILYternary模型家族ternary三值 /bonsai1-bitBONSAI_NGL自动检测GPU 卸载层数0 纯 CPUBONSAI_CTX按内存分档上下文长度最高 262144小内存机器建议BONSAI_CTX8192BONSAI_SPECULATIVE0开启 DSpark 推测解码CUDA 收益最大BONSAI_KV404-bit KV 缓存长上下文内存省约 3.5 倍见 KV-CACHE.md组合示例BONSAI_MODEL4B ./setup.sh直接换小模型BONSAI_FAMILYbonsai BONSAI_MODEL4B ./scripts/run_llama.sh -p Hello!用 1-bit 家族做一次性问答。部署常见问题排查 ❓内存分配过大 / 机器卡死早期版本默认吃满 262k 训练上下文现在脚本已按内存自动分档。若仍有内存压力固定小上下文即可BONSAI_CTX8192 ./scripts/start_llama_server.shCUDA 源码编译时 OOM编译 CUDA kernel 极耗内存build_cuda_linux.sh会自动探测显存小于 16 GB 时把并行度压到-j 2手动编译遇到 OOM 请同样降低-j或关闭其他 GPU 程序。弱核显上 Vulkan 反而慢自动检测依据的是装了驱动而非GPU 够强弱核显机器建议BONSAI_NGL0退回 CPU。回答很慢但硬件不弱27B 是推理模型等待时间大头在思考 token 而非硬件。聊天界面点灯泡图标选低一档 Reasoning effort或启动时加--reasoning-budget 2048限制思考预算。总结Bonsai-demo 把本地跑大模型的门槛降到了极限一条 setup 命令、四大后端自动适配、3.5 GB 跑 27B。选型口诀——NVIDIA 卡→ CUDA顺手开BONSAI_SPECULATIVE1AMD 卡且有 ROCm→ ROCm没有 ROCm→ Vulkan核显 / 无 GPU→ CPU 后端 小尺寸模型1.7B/4B内存紧张 →BONSAI_CTX降上下文或BONSAI_KV41。更多细节视觉输入、工具调用、MCP见仓库内的 VISION.md 与 TOOLS.md祝你部署顺利 【免费下载链接】Bonsai-demoBonsai Demo项目地址: https://gitcode.com/GitHub_Trending/bo/Bonsai-demo创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表