尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

llm-server-docs llama-swap配置指南:多个大模型集中管理,一键热切换完整教程

llm-server-docs llama-swap配置指南:多个大模型集中管理,一键热切换完整教程 llm-server-docs llama-swap配置指南多个大模型集中管理一键热切换完整教程【免费下载链接】llm-server-docsEnd-to-end documentation to set up your own local fully private LLM server on Debian. Equipped with chat, web search, RAG, model management, MCP servers, image generation, and TTS.项目地址: https://gitcode.com/gh_mirrors/ll/llm-server-docsllm-server-docs 是一套在 Debian 上搭建本地、完全私有 LLM 服务器的端到端文档项目涵盖聊天平台、联网搜索、RAG、模型管理、MCP、图像生成与语音合成等完整部署。其中llama-swap是「多个大模型集中管理」的核心——它作为轻量级 LLM 代理服务让你从 llama.cpp、vLLM 等推理引擎中一键热切换模型且无需重启聊天平台。为什么需要 llama-swap多模型管理的三大痛点如果你用过手动方式跑 llama.cpp 或 vLLM一定有这些烦恼关了终端就退出模型进程随终端窗口关闭或服务器重启而丢失无法热切换换一个模型要手动停旧进程、启新进程聊天平台看不到多个模型Open WebUI 里只有一个固定模型可选llama-swap 正是为这些痛点而生。它是一个轻量级 LLM 代理服务位于推理引擎与聊天平台之间帮你做到用单一入口点集中管理来自不同后端llama.cpp / vLLM的模型模型分组、随时上/下架、在 Web UI 中一键切换为每个模型配置自定义超参数查看流式日志实时监控模型状态 如果你用的是 Ollama模型管理可由它的 CLI 直接搞定本文的 llama-swap 主要针对 llama.cpp 与 vLLM 的手动部署场景。llama-swap 在整体架构中的位置在 llm-server-docs 的软件栈中各组件分工明确组件职责vLLM / llama.cpp / Ollama推理引擎加载模型权重并生成文本llama-swap模型服务器负责多个大模型的加载、卸载与热切换Open WebUI聊天平台提供 Web 界面MCP 代理 / SearXNG / Kokoro / ComfyUI工具代理、联网搜索、语音合成、图像生成llama-swap 把背后的推理引擎聚合起来对外暴露统一的OpenAI 兼容 API因此任何 OpenAI 兼容客户端都能直接接入。用 Docker 快速部署 llama-swap整个过程只需 3 步第一步创建配置目录mkdir llama-swap cd llama-swap nano config.yaml第二步写入模型配置以 llama.cpp 模型为例models: qwen3-4b: proxy: http://127.0.0.1:7000 cmd: | /app/llama-server -m /models/Qwen3-4B-Instruct-2507-UD-Q4_K_XL.gguf --port 7000 --host 0.0.0.0第三步启动容器docker run -d --gpus all --restart unless-stopped --network app-net \ --pullalways --name llama-swap -p 9292:8080 \ -v /path/to/models:/models \ -v /home/username/llama-swap/config.yaml:/app/config.yaml \ -v /home/username/llama.cpp/build/bin/llama-server:/app/llama-server \ ghcr.io/mostlygeek/llama-swap:cuda把username换成你的实际用户名/path/to/models换成你的模型文件目录。运行curl http://localhost:9292/health验证健康检查成功后在浏览器打开http://localhost:9292llama-swap 的 Web UI 即可开始管理工作。编写 config.yaml多个大模型集中管理的核心config.yaml是 llama-swap 的心脏每个模型由三类字段描述proxy模型实际监听的地址cmd启动模型的命令cmdStop停止模型的命令Docker 方式运行 vLLM 时需要运行 vLLM 模型Docker 方式示例models: qwen3-4b: proxy: http://127.0.0.1:7000 cmd: | docker run --name qwen-vllm --init --rm -p 7000:8080 --ipchost vllm/vllm-openai:latest -m /models/Qwen/Qwen3-4B-Instruct-2507 cmdStop: docker stop qwen-vllm往config.yaml里添加多个模型后它们都会出现在 llama-swap 的 Web UI 里随时一键切换——这就是「多模型集中管理」的关键。llama-swap 配置项非常全面模型分组、路由规则等强烈建议通读其官方配置文档按需定制出可部署的专属配置。一键热切换像云控制台一样操作 Web UI部署完成后你的本地服务器相当于一个「自建云控制台」在模型列表中启动 / 停止 / 切换模型不用碰终端模型按需加载与卸载不占用不需要的显存查看流式日志实时监控系统性能切换模型后聊天平台会在几秒内看到新模型出现全程无需重启任何服务。将 Open WebUI 接入 llama-swapOpen WebUI 通过 OpenAI 兼容协议接入 llama-swap只需 3 个字段进入Admin Panel Settings Connections勾选Enable OpenAI API填写API Base URLhttp://llama-swap:8080/v1同一 Docker 网络内API Key任意字符串均可⚠️ 易错点8080 是 llama-swap容器内部端口9292 是宿主机对外端口。app-net网络里的容器互相访问时用内网端口宿主机访问用 9292——端口混用是「连不上」的第一大原因。llama-swap vs systemd怎么选模型服务器持久化其实有两条路方案优点缺点llama-swap推荐Web UI 一键换模型、日志监控、高度可配置多一层代理开销极小systemd服务开销最低、随系统启动无 UI切换模型要改配置llama.cpp 原生的--models-preset参数也能切换模型功能上与 llama-swap 等价但没有 UI 可切换、看活动与日志。如果你只跑一个 vLLM 模型且无需切换systemd最简单多个模型、想一键热切换选 llama-swap。常见问题与安全最佳实践配置改了不生效服务配置变更有时光重启容器不够直接重建down 再 up即可防火墙若用 systemd 方式暴露服务记得用ufw把端口开放给本地网络容器安全加固模型服务器是长期运行服务建议按 docs/docker-security.md 的加固指南限制容器的攻击面更新方式llama-swap 的更新 停止容器、删除容器、重新执行 docker run 命令远程管理你的模型服务器模型服务器跑起来后如果想在外面家里、办公室也能管理 llama-swap 与聊天平台文档提供了 Tailscale 网格 VPN Caddy 反向代理的组合Tailscale 负责加密隧道Caddy 负责域名路由与证书详细配置见 docs/remote-access.md。完整文档与延伸阅读本地 LLM 服务器完整搭建流程Debian Docker 全组件见项目 README.md三大推理引擎 llama.cpp / Ollama / vLLM 的选型对比见 docs/inference-engine-comparison.mdDocker 容器安全加固细节见 docs/docker-security.md远程访问SSH、防火墙、Tailscale、Caddy见 docs/remote-access.md如需在本地浏览完整文档可克隆仓库git clone https://gitcode.com/gh_mirrors/ll/llm-server-docs到这里llama-swap 配置就全部完成了写好 config.yaml 集中管理多个大模型Web UI 一键热切换三个字段接入 Open WebUI——你的本地大模型服务器就具备了「云服务商级」的体验。【免费下载链接】llm-server-docsEnd-to-end documentation to set up your own local fully private LLM server on Debian. Equipped with chat, web search, RAG, model management, MCP servers, image generation, and TTS.项目地址: https://gitcode.com/gh_mirrors/ll/llm-server-docs创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表