
使用 Ollama 本地运行 Yi 系列模型终端与 OpenWebUI 可视化部署实战【免费下载链接】YiA series of large language models trained from scratch by developers 01-ai项目地址: https://gitcode.com/GitHub_Trending/yi/Yi本指南以 Cookbook/en/opensource/local/local-ollama.md 为核心教程完整讲解如何在自有硬件上通过 Ollama 一键拉取并运行 Yi 系列大模型并进一步结合 Docker 部署 OpenWebUI把命令行交互升级为可视化对话界面。读完本文你将掌握ollama run的核心用法、模型自动下载机制以及一条从终端运行到网页对话的完整本地部署路径。Ollama 是什么为什么适合运行 YiOllama 是一个开源的大型语言模型LLM服务工具它允许用户在自己的硬件环境中轻松部署和使用大规模预训练模型。它的核心价值在于把模型下载、权重管理、推理服务、命令行交互整合为一条简单命令用户无需手动处理权重文件格式与推理框架配置即可快速在本地运行模型。对于 Yi 系列模型而言这一特性尤为重要。Yi 系列是 01.AI 从零训练的双语中英开源大模型覆盖 6B、9B、34B 等多个尺寸并提供 Chat对话与 Base基座两类模型模型清单与下载入口见 README.md。由于 Yi 采用与 Llama 相同的 Transformer 架构详见 README.md 中Yi 与 Llama 的关系一节它能直接复用 Llama 生态中成熟的工具链Ollama 正是其中之一——这意味着用户可以在 Ollama 模型库中直接检索到官方可用的 Yi 模型并通过一条命令完成拉取与运行免去自行转换 GGUF 格式的繁琐步骤。Ollama 的适用场景包括个人电脑Windows / macOS / Linux上的模型体验与日常对话在有限硬件条件下以量化形式运行 Yi-6B 等中小尺寸模型作为后端为 OpenWebUI 等 Web UI 提供本地推理服务实现数据不出本机的私有化使用。下载与安装 OllamaOllama 的下载与安装非常简单步骤如下前往 Ollama 官方网站点击页面中的 Download 按钮下载与你电脑操作系统匹配的安装包支持 macOS、Linux 以及 Windows 预览版。下载完成后按照对应系统的安装流程完成安装即可macOS 与 Windows 为图形化安装包Linux 通常为一条安装脚本命令。安装完成后在终端中执行ollama --version之类的命令即可确认安装是否成功。安装完成后无需任何额外配置Ollama 便已内置模型仓库拉取能力可以直接进入下一步终端运行。方式一终端直接运行 Yi 模型Ollama 最直观的使用方式是在终端中直接运行 Yi 系列模型。对于官方已提供的 Yi 模型以yi:6b为例其他可用模型请以 Ollama 官方模型库中的 yi 系列列表为准执行如下命令ollama run yi:6b这条命令背后的工作流程是自动下载首次执行时Ollama 会根据模型名yi:6b从模型仓库自动下载对应权重到本地用户无需手动处理权重文件的格式转换或路径配置即拉即用下载完成后终端即进入交互式对话模式可以直接输入问题与 Yi 模型对话再次使用秒级启动模型已缓存于本地后续再次执行同一条命令将直接加载模型进入对话不再重复下载。以下图片展示了一次成功的运行效果终端中执行ollama run yi:6b后模型正常加载并给出回应底部进入消息输入等待状态关于模型选择的补充说明终端方式适合快速验证模型能力、脚本化调用或资源受限无图形界面的服务器环境如果你希望运行 34B 等更大尺寸的 Yi 模型请结合 README.md 中给出的硬件要求评估本机显存/内存是否充足通过 Ollama 运行时模型通常会以量化形式加载对硬件的要求低于 FP16 全精度推理若 Ollama 模型库中的版本无法满足需求也可以考虑仓库 Cookbook 中提供的其他本地运行路线例如 llama.cpp 方案支持自行将 Yi 模型转换为 GGUF 格式并做 Q4/Q8 等精度量化或 MLX-LM 方案专用于 macOS它们在模型精度与硬件利用上各有侧重。方式二使用 OpenWebUI 可视化运行终端交互虽然轻量但在多轮会话管理、上下文记忆、参数可视化调节等方面体验有限。为此Ollama 常与 OpenWebUI 搭配使用——OpenWebUI 是一款开源的 Web 对话界面它把模型对话、会话历史、模型切换等操作全部可视化基本不需要命令行操作使用体验好、操作门槛低。整个架构非常简单Ollama 作为本地推理后端模型服务OpenWebUI 作为前端界面浏览器访问两者通过 HTTP 通信。下面按步骤完成部署。第一步确保 Ollama 已正确安装OpenWebUI 本身不包含模型推理能力它依赖 Ollama 提供的本地服务来加载和运行 Yi 模型。因此在继续之前请先按上文完成 Ollama 的安装并确认可以正常执行ollama run。第二步安装 DockerOpenWebUI 官方推荐的运行方式是基于 Docker 容器。Docker 是一种轻量级的虚拟化技术同时是一个开源的应用容器运行环境搭建平台它可以让开发者以便捷方式把应用打包进一个可移植的容器中然后安装至任何运行 Linux 或 Windows 等系统的服务器上。相较于传统虚拟机Docker 容器提供轻量化的虚拟化方式、安装便捷、启停速度快。简单来说我们将通过 Docker 来运行 OpenWebUI。安装也很简单前往 Docker 官方网站根据电脑型号点击 Download 进行下载再按对应系统的安装流程完成安装即可。第三步用 Docker 拉取并启动 OpenWebUI在终端中执行如下命令等待镜像拉取与容器启动完成docker run -d -p 3000:8080 --add-hosthost.docker.internal:host-gateway -v open-webui:/app/backend/data --name open-webui --restart always ghcr.io/open-webui/open-webui:main这条命令的关键参数含义如下便于你按需调整参数作用-d以守护进程后台方式运行容器终端不会阻塞-p 3000:8080端口映射将容器内 OpenWebUI 的 8080 端口映射到宿主机的 3000 端口之后通过浏览器访问本机 3000 端口即可--add-hosthost.docker.internal:host-gateway添加主机映射使容器内可以通过host.docker.internal访问宿主机——这是容器内 OpenWebUI 找到宿主机上 Ollama 服务的关键-v open-webui:/app/backend/data数据卷挂载把 OpenWebUI 的会话、配置等数据持久化到名为open-webui的卷中容器重建后数据不丢失--name open-webui为容器指定名称便于后续docker stop/docker start等管理操作--restart always设置容器在退出或宿主机重启后自动重启保证服务长期可用ghcr.io/open-webui/open-webui:mainOpenWebUI 官方镜像main 分支的最新构建第四步启动 Docker 并打开 OpenWebUI镜像与容器就绪后重新启动 Docker若未运行然后在浏览器中访问http://localhost:3000即可进入 OpenWebUI 的网页界面。首次进入时按界面提示完成账号设置即可。第五步在 OpenWebUI 中下载模型进入 OpenWebUI 后在模型管理/下载区域选择yi:6b并触发下载。OpenWebUI 会通过宿主机上的 Ollama 完成模型拉取这一过程与终端中执行ollama run yi:6b的自动下载机制一致。下载完成后即可在对话界面中选择该模型开始使用。以下图片展示的就是下载完成后的实际使用效果左侧模型栏显示当前模型为yi:6b右侧输入消息后模型正常返回回复并带有编辑、复制、语音等对话操作功能两种方式的对比与选型建议维度终端运行ollama run yi:6bOpenWebUI Docker上手门槛最低一条命令即可需要 Docker 基础但界面友好交互体验纯命令行可视化对话、会话管理、参数调节适用场景快速验证、脚本化、无图形界面的服务器日常使用、多用户/多会话、演示分享部署组件仅 OllamaOllama Docker OpenWebUI 容器两者的后端都是同一个 Ollama 本地推理服务模型权重互通在终端中下载过的模型OpenWebUI 中可直接使用反之亦然。因此建议先用方式一快速验证 Yi 模型可用再按需升级到方式二获得完整可视化体验。常见问题与注意事项端口冲突若本机 3000 端口已被占用可将-p 3000:8080中的左侧端口改为其他值如-p 3001:8080浏览器访问地址相应变为http://localhost:3001。OpenWebUI 无法连接 Ollama多为容器无法访问宿主机所致请确认命令中保留了--add-hosthost.docker.internal:host-gateway参数且宿主机上 Ollama 服务处于运行状态。模型下载较慢或失败Ollama 首次拉取yi:6b需要联网下载权重请确保网络通畅下载为一次性操作成功后本地缓存无需重复下载。硬件资源评估在本地运行 Yi 模型前建议参考 README.md 中的显存要求如 Yi-6B-Chat 全精度约需 15 GB 显存起步评估本机能力Ollama 默认使用量化加载实际占用通常低于全精度推理但仍建议预留充足内存/显存。模型来源与版本以 Ollama 官方模型库中 yi 系列当前可用的标签为准文档示例为yi:6b如需更灵活的精度与量化控制可参考仓库 llama.cpp 本地运行教程 中自行转换 GGUF 与量化的做法或查看 quantization 目录 下的 AWQ/GPTQ 量化方案。至此你已经完成了从安装 Ollama → 终端运行 Yi 模型 → Docker 部署 OpenWebUI 可视化对话的完整本地部署闭环。无论是个人体验、私有化使用还是基于本地服务的二次开发这套方案都能让你以极低的门槛在自有硬件上跑起 Yi 系列大模型。【免费下载链接】YiA series of large language models trained from scratch by developers 01-ai项目地址: https://gitcode.com/GitHub_Trending/yi/Yi创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考