尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

【大模型】Ubuntu下用TaoToken统一Key接入ollama,DeepSeek-R1:32b本地部署与运行

【大模型】Ubuntu下用TaoToken统一Key接入ollama,DeepSeek-R1:32b本地部署与运行 1. 为什么要在 Ubuntu 上折腾 DeepSeek-R1:32b 本地部署DeepSeek-R1:32b 是当前开源推理模型里性价比很高的一档32B 参数量在消费级显卡或单卡 A100 上都能跑起来数学、代码、逻辑推理的表现比同尺寸通用模型明显更稳。把它放在 Ubuntu 服务器上本地跑最大的好处是数据不出内网、推理不依赖外部网络、调用成本固定。但真正落地时会遇到三个绕不开的问题ollama 安装脚本卡在下载、模型默认存到系统盘把根分区撑爆、以及多模型多项目时 API Key 散落各处难以统一管理。这篇就按「Ubuntu 装 ollama → 拉取 DeepSeek-R1:32b → 改模型存储路径 → 用 TaoToken 统一 Key 接入 → curl 验证 → 排障」的顺序走一遍命令都可以直接复制。适合手里有一台 Ubuntu 20.04/22.04 机器、想本地跑 32b 模型、同时希望把 API 通道统一管起来的开发者。如果你只是想在本地快速体验也可以跳过统一 Key 部分但多模型场景下那一步迟早要做。2. TaoToken 前置统一 Key 与 API 通道准备本地 ollama 默认监听11434用api_keyollama这种占位值就能调通单机自用没问题。但一旦你要在多个项目、多个模型本地 32b 云端更大模型之间切换每个客户端都去改 base_url 和 key 就很乱。TaoToken 在这里的角色是统一 API 通道一个 Key 管多模型调用本地 ollama 和远端模型可以走同一套配置骨架切换只改 model 字段。需要提前准备的东西一个 TaoToken 账号登录后到控制台创建 API Key记下 API 地址https://taotoken.net/api注意这个地址不带任何查询参数本地 ollama 服务已经能正常ollama serve起来。创建 Key 的入口在控制台的 API Keys 页面生成后只显示一次复制到安全的地方。接入文档里有各语言 SDK 的 base_url 写法Python 用 OpenAI SDK 时把base_url指向 TaoToken 的 API 地址即可。模型对话页面可以先用网页版验证 Key 是否可用确认能正常返回再写进代码省得在本地反复调试。注意TaoToken 是合规的 API 通道管理服务不要把它和任何非正规中转混为一谈。Key 只放在服务端环境变量或配置文件里不要硬编码进前端。3. 可复制配置ollama 安装、模型路径与 TaoToken 骨架3.1 Ubuntu 安装 ollama官方一键脚本最省事curl -fsSL https://ollama.com/install.sh | sh ollama --version如果脚本卡在Downloading Linux长时间不动说明拉取安装包超时。可以手动下载再装mkdir -p ~/ollama cd ~/ollama curl -fsSL https://ollama.com/install.sh -o ollama_install.sh sh ollama_install.sh在ollama_install.sh里搜索Downloading Linux找到它要下载的ollama-linux-amd64.tgz链接手动下载后放到当前目录然后把脚本里的下载命令注释掉保留下面的解压命令$SUDO tar -xzf ollama-linux-amd64.tgz -C $OLLAMA_INSTALL_DIR再执行sh ollama_install.sh就能装好。3.2 修改模型默认存储路径ollama 默认把模型放在/usr/share/ollama/.ollama/models32b 模型动辄 20GB 以上很容易把根分区写满。建议改到数据盘sudo mkdir -p /opt/ai-platform/lldataset/ollama/ sudo chmod -R 777 /opt/ai-platform/lldataset/ollama/ sudo systemctl stop ollama sudo mkdir -p /etc/systemd/system/ollama.service.d/ sudo tee /etc/systemd/system/ollama.service.d/models.conf /dev/null EOF [Service] EnvironmentOLLAMA_MODELS/opt/ai-platform/lldataset/ollama/ EnvironmentOLLAMA_HOST0.0.0.0:11434 EOF sudo systemctl daemon-reload sudo systemctl restart ollama.service sudo systemctl status ollama.serviceOLLAMA_HOST这里写0.0.0.0:11434而不是127.0.0.1:11434区别在于前者监听所有网卡局域网内其他机器和 Docker 容器都能访问后者只有本机能连。如果你只在单机用写回环地址更安全。3.3 拉取并运行 DeepSeek-R1:32bollama run deepseek-r1:32b首次执行会先拉取模型再进入交互。拉取完成后直接问答即可。想确认模型列表ollama list3.4 TaoToken 接入配置骨架Python 侧用 OpenAI SDK 指向 TaoTokenfrom openai import OpenAI client OpenAI( base_urlhttps://taotoken.net/api, api_key你的_TaoToken_Key ) resp client.chat.completions.create( modeldeepseek-r1:32b, messages[{role: user, content: 用一句话解释二分查找}], streamFalse ) print(resp.choices[0].message.content)如果项目用config.toml管理配置可以这样写骨架[llm] base_url https://taotoken.net/api api_key ${TAOTOKEN_API_KEY} model deepseek-r1:32b timeout 120 [llm.local_ollama] base_url http://localhost:11434/v1 api_key ollama model deepseek-r1:32bsettings.json版本{ llm: { base_url: https://taotoken.net/api, api_key_env: TAOTOKEN_API_KEY, model: deepseek-r1:32b } }Key 通过环境变量注入避免写死在文件里。4. 验证请求curl 打通本地推理与统一通道先验证本地 ollama 服务本身curl http://localhost:11434/api/generate -d { model: deepseek-r1:32b, prompt: 11等于几, stream: false }返回 JSON 里response字段有内容就说明本地推理通了。再验证 TaoToken 通道curl https://taotoken.net/api/v1/chat/completions \ -H Authorization: Bearer $TAOTOKEN_API_KEY \ -H Content-Type: application/json \ -d { model: deepseek-r1:32b, messages: [{role: user, content: 你好}], stream: false }两个都返回正常说明本地模型和统一 Key 通道都可用。4.1 让模型常驻显存ollama 默认闲置约 5 分钟就释放显存32b 模型重新加载要等很久。用空 prompt 加keep_alive:-1挂住curl http://localhost:11434/api/generate -d { model: deepseek-r1:32b, prompt: , keep_alive: -1, stream: false }验证是否驻留curl http://localhost:11434/api/ps看到模型条目且expires_at为0001-01-01T00:00:00Z就是永久驻留。手动卸载用ollama stop deepseek-r1:32b。5. 本篇常见错排查安装脚本卡在下载按 3.1 手动下载 tgz 并注释下载命令这是最常见的坑。端口 11434 被占用sudo lsof -i :11434查占用进程杀掉或改OLLAMA_HOST端口。模型存到系统盘检查/etc/systemd/system/ollama.service.d/models.conf是否生效systemctl show ollama | grep OLLAMA_MODELS确认。局域网连不上确认OLLAMA_HOST是0.0.0.0:11434并检查防火墙sudo ufw allow 11434。TaoToken 返回 401Key 没读到或环境变量没导出echo $TAOTOKEN_API_KEY确认。显存不够加载 32b32b 量化版约需 20GB 显存不够就换更小量化或加num_gpu参数。模型闲置被释放用 4.1 的keep_alive:-1挂住。6. 统一 Key 之后怎么继续用本地 ollama 跑通后日常调用建议统一走 TaoToken 的 base_url本地和远端模型只改model字段。需要长期跑编码任务或 Agent 的可以看 Coding Plan把多模型调度和额度管理交给通道层只是验证模型效果的直接用模型对话页面最快要新建或轮换 Key 的去 API Keys 页面操作接入细节参考接入文档。这样本地 32b 负责隐私敏感和离线场景统一通道负责多模型切换两套配置互不干扰。
返回列表