尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

LocalAI 本地部署实战指南:从拉镜像到跑通首次推理的完整路径

LocalAI 本地部署实战指南:从拉镜像到跑通首次推理的完整路径 LocalAI 本地部署实战指南从拉镜像到跑通首次推理的完整路径【免费下载链接】LocalAILocalAI is the open-source AI engine. Run any model - LLMs, vision, voice, image, video - on any hardware. No GPU required.项目地址: https://gitcode.com/GitHub_Trending/lo/LocalAILocalAI 是一个开源的本地 AI 推理引擎能把 LLM、视觉、语音、图像、视频模型跑在自己的硬件上不依赖 GPU并对外提供与 OpenAI 兼容的 REST API。这篇文章带你走一遍最短路径Docker 起服务、装模型、验证可用、调关键参数最后给你一份高频报错速查。全程大约 20 分钟你需要的是一台装了 Docker 的 Linux 或 macOS 机器。环境自检动手前的 3 项必查容器引擎是否可用LocalAI 推荐容器方式部署先确认 Docker或 Podman能正常跑起来。执行下面这条命令看它能否跑出一个简单输出docker run --rm hello-world输出Hello from Docker!说明引擎正常如果报权限错误把当前用户加进docker组再重试。8080 端口是否空闲LocalAI 默认监听 8080被占用是启动阶段最常见的翻车点。查一下这个端口有没有进程在听ss -tlnp | grep 8080有输出就说明被占用了先处理占用方或者后面把端口映射到 8081第 4 节有对应解法。没输出就可以直接往下走。磁盘与内存余量模型文件动辄几 GB且首次启动会从模型库下载。确认 /models 挂载点所在的分区至少有 10GB 空闲df -h .同时留意可用内存CPU 模式跑 Q4 量化的小模型8GB 内存是较稳妥的下限。最短路径跑通CPU 容器 模型库一键安装这是唯一一条需要完整跟着做的主路径。备选方案一句话带过有 NVIDIA 卡用localai/localai:latest-gpu-nvidia-cuda-12镜像加--gpus allAMD/Intel/Vulkan 各有对应镜像参考 docs/content/getting-started/containers.md。第一步启动 CPU 容器先拉 CPU 版镜像并启动容器把宿主机 8080 映射到容器 8080--name local-ai方便后面查日志docker run -p 8080:8080 --name local-ai -ti localai/localai:latest看到启动日志开始滚动即代表服务已就绪。国内网络拉镜像慢的话给 Docker 配置镜像加速源改/etc/docker/daemon.json加registry-mirrors即可不用换发行方式。第二步从模型库装第一个模型⚠️ 不要手动拷贝 GGUF 文件那是旧式玩法。打开浏览器访问http://localhost:8080进入 Models → Explore搜索qwen3-4b并点 Install。这个 4B 级模型体积小、纯 CPU 可跑且支持工具调用后面扩展用得上。安装页会显示下载进度同时 LocalAI 会自动探测你的硬件并下载匹配的 backendllama.cpp 等不用你操心 backend 匹配问题。第三步发第一条推理请求装完模型切到 Chat 页选qwen3-4b发一句话几秒内应该出回复。如果你习惯命令行OpenAI 兼容接口也直接可用model字段填安装时的模型名curl http://localhost:8080/v1/chat/completions \ -H Content-Type: application/json \ -d {model:qwen3-4b,messages:[{role:user,content:Hello}]}返回 JSON 里choices[0].message.content就是模型输出拿到它说明全链路已通。验证服务可用与 3 个关键参数两个健康检查端点日常巡检只需要这两个比翻日志快curl http://localhost:8080/readyz # 返回 OK 表示服务存活 curl -s http://localhost:8080/v1/models | jq .data[].id # 列出已加载模型readyz挂了先docker logs local-ai看最后几行/v1/models里没有你以为的模型多半是名字没对上以这个列表为准。最影响体验的 3 个参数改模型配置时优先动这三个其他保持默认threads设成物理核心数不是逻辑核心比如 4 核 CPU 就写threads: 4。设多了会互相争抢速度反而下降。context_size上下文窗口内存不够时OOM的头号元凶。按业务实际需要取最小值例如context_size: 2048。mmap模型放在机械硬盘上就设mmap: false让模型整体载入内存避免随机 IO 把推理拖成蜗牛。这三个参数在 Web UI 的模型编辑页或直接改模型 YAML 都能改。GPU 用户再关注gpu_layers层卸载数量配置方法见 docs/content/features/gpu-acceleration.md。高频故障速查6 个最常见的报错网络与启动类curl: (7) Failed to connect to localhost port 8080: Connection refused现象接口直接拒连。原因容器没起来或端口没映射。一句话修复docker ps -a | grep local-ai确认容器存在且状态为 Up不存在就重跑第 2 节的启动命令。bind: address already in use现象容器启动即退出。原因宿主机 8080 被占。一句话修复把启动命令的端口映射改成-p 8081:8080之后所有 curl 用 8081 即可不必去杀别的进程。镜像拉取卡住或超时现象docker pull长时间无进度。原因默认 registry 网络不通。一句话修复在/etc/docker/daemon.json配置registry-mirrors加速源后重启 Docker。模型加载类404model not found现象请求返回 404。原因model字段和实际安装名不一致大小写、后缀都要精确。一句话修复以curl -s http://localhost:8080/v1/models | jq .data[].id的输出为准改请求。could not load model: ...或grpc service not ready现象模型找到但加载失败。原因backend 未安装、模型文件损坏、或内存不足具体原因在冒号后的 backend 原文里。一句话修复先local-ai backends install llama-cpp补 backend再重新下载模型仍失败就开DEBUGtrue重启看完整 backend 日志对照 docs/content/reference/runtime-errors.md 的错误对照表逐行排查。请求返回 503 且带Retry-After头现象加载失败后的冷却期。原因LocalAI 对刚失败过的模型会设置一个递增的加载冷却窗默认 10 秒起最多 5 分钟防止轮询请求反复拉起崩溃的 backend。一句话修复等Retry-After秒数过去再重试或重启 LocalAI 直接清掉冷却。内存与并发类进程被Killed或日志出现out of memory现象模型加载到一半进程消失。原因模型加 KV cache 超过可用内存/显存。一句话修复换更低量化Q4_K_S/Q2_K、调小context_size内存紧张时加--max-active-backends1只保留一个模型常驻。✅ 排查任何疑难问题通用动作就一个DEBUGtrue重启真实原因几乎都在 server 日志里HTTP 响应体只是摘要。完整分类排查见 docs/content/getting-started/troubleshooting.md。到这里从一台空机器到能对外提供 OpenAI 兼容推理接口整条链路你已经完整走过一遍。上面没覆盖到的问题先去 docs/content/reference/runtime-errors.md 按错误原文查一遍仍解决不了就带上DEBUGtrue日志、系统信息、LocalAI 版本和复现步骤提交到项目仓库的 Issues 区或者到项目社区README 中有入口提问比硬啃快得多。【免费下载链接】LocalAILocalAI is the open-source AI engine. Run any model - LLMs, vision, voice, image, video - on any hardware. No GPU required.项目地址: https://gitcode.com/GitHub_Trending/lo/LocalAI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表