Day18:Ollama 安装与本地模型运行:把你的电脑变成AI宠物乐园

发布时间:2026/7/26 8:12:43

Day18:Ollama 安装与本地模型运行:把你的电脑变成AI宠物乐园 Day18Ollama 安装与本地模型运行把你的电脑变成AI宠物乐园前言你是否想过在自己电脑上就能拥有一个像ChatGPT一样的AI助手不用联网、无需付费、隐私安全还能随时随地调戏它今天我们就来实现这个愿望借助Ollama这个神器你可以在本地轻松运行大语言模型如Qwen、Llama 3并用Python代码调用它。本文将从零开始手把手教你安装Ollama、拉取模型、编写调用代码并对比本地模型与在线模型的优劣。无论你是AI小白还是老司机都能在这里找到乐趣为什么要在本地跑大模型在开始之前我们先聊聊本地运行模型的三大好处告别网速焦虑在线模型每次提问都要上传数据、等待服务器响应如果网络波动你就只能对着转圈圈发呆。本地模型完全在电脑内运行速度取决于你的硬件配置流畅度拉满隐私是底线你的问题比如“我的银行卡密码忘记了怎么办”如果上传到云端就可能被记录。本地模型让你的数据永远留在本地真正实现隐私无忧。免费才是王道在线API按token收费长对话或频繁调用分分钟烧钱。本地模型一次下载终身免费使用想怎么玩就怎么玩。所以本地运行大模型就像是领养了一只AI宠物它只属于你环境准备Ollama安装指南Ollama 是一个开源工具它将大模型打包成一个个“宠物盒子”只需一条命令就能拉取、运行甚至通过API调用。它支持 macOS、Linux 和 Windows需WSL2或直接使用Windows版。Windows安装方法一直接安装推荐新手访问 Ollama官网 下载 Windows 安装包.exe文件。双击运行一路点击“Next”完成安装。安装完成后打开命令提示符CMD或 PowerShell输入ollama --version检查是否成功。如果显示版本号则安装成功。方法二通过WSL2安装适合开发者如果你熟悉 Linux建议在 WSL2 中安装体验更接近生产环境。安装 WSL2 并启动一个 Linux 发行版如 Ubuntu。在 WSL 终端中执行以下命令curl-fsSL https://ollama.com/install.sh|sh安装完成后同样用ollama --version验证。macOS安装在终端中执行一键安装命令curl-fsSL https://ollama.com/install.sh|sh等待脚本执行完毕即可。macOS用户无需额外配置Ollama会自动下载并安装。Linux安装同样使用官方安装脚本curl-fsSL https://ollama.com/install.sh|sh该脚本会自动检测你的发行版并安装。安装完成后你可以通过systemctl管理Ollama服务sudo systemctlstartollama sudo systemctl enable ollamaOllama基础命令领养你的第一只AI宠物安装好Ollama后我们来学习几个核心命令就像学习如何照顾你的新宠物一样。拉取模型ollama pull使用pull命令从Ollama仓库下载模型。今天推荐两个热门模型通义千问Qwen和 Llama 3都是7B参数版本适合大多数电脑。# 拉取通义千问7Bollama pull qwen:7b# 拉取Llama 3 7Bollama pull llama3:7b模型大小约3.8GB~4.2GB根据网络速度等待一段时间。下载完成后模型就保存在本地了。小贴士如果你显存足够8GB以上也可以试试更大的模型比如qwen:14b或llama3:70b但速度会慢很多。查看本地模型ollama list输入以下命令列出所有已下载的模型ollama list输出示例NAME ID SIZE MODIFIED qwen:7b 123abc... 3.8 GB 2 minutes ago llama3:7b 456def... 4.1 GB 1 hour ago运行模型并对话ollama run这是最有趣的命令运行模型后你就可以直接和它聊天了。ollama run qwen:7b进入交互模式后输入问题模型会实时回复。试试问 你好你是谁模型会回答类似“我是通义千问由阿里云开发的语言模型……”等内容。输入/bye或按CtrlD退出。删除模型ollama rm如果你不再需要某个模型可以用rm命令删除释放磁盘空间ollamarmqwen:7b谨慎操作删除后需要重新下载。API调用用Python代码调戏你的AI宠物Ollama 不仅提供了命令行交互还启动了一个HTTP服务让你可以通过API调用模型。这意味着你可以用Python、JavaScript等语言编写程序让AI自动回答问题简直是为开发者量身定做的功能启动Ollama服务默认情况下Ollama安装后会自动在后台运行服务监听http://localhost:11434。如果没有启动可以手动执行ollama serve该命令会启动服务并保持前台运行你也可以用systemctl管理。服务启动后就可以通过API访问了。API端点简介Ollama 提供了两个主要API端点/api/generate纯文本生成适合简单问答。/v1/chat/completions兼容OpenAI的聊天格式方便迁移代码。我们重点使用/v1/chat/completions因为它格式通用未来如果切换到在线模型也无需大改代码。Python脚本实现本地问答首先安装requests库如果未安装pip install requests然后编写以下Python脚本实现本地模型问答并记录响应时间。脚本中还预留了调用在线模型的接口方便对比。importrequestsimporttime# 本地Ollama API地址LOCAL_URLhttp://localhost:11434/v1/chat/completionsdefask_local(prompt,modelqwen:7b):调用本地Ollama模型payload{model:model,messages:[{role:user,content:prompt}],stream:False}starttime.time()try:responserequests.post(LOCAL_URL,jsonpayload,timeout60)elapsedtime.time()-startifresponse.status_code200:resultresponse.json()answerresult[choices][0][message][content]returnanswer,elapsedelse:returnfHTTP错误{response.status_code},elapsedexceptExceptionase:returnf请求异常{str(e)},time.time()-startdefmain():prompt用一句话解释什么是人工智能。print(f 提问{prompt}\n)# 调用本地模型print( 本地模型 (qwen:7b) 思考中...)answer,cost_timeask_local(prompt)print(f 回答{answer})print(f⏱️ 耗时{cost_time:.2f}秒\n)# 如果你想对比在线模型可以取消注释以下部分并配置API密钥# print( 在线模型 (gpt-3.5-turbo) 思考中...)# online_answer, online_time ask_online(prompt) # ask_online函数需自行实现# print(f 回答{online_answer})# print(f⏱️ 耗时{online_time:.2f} 秒)if__name____main__:main()保存为ollama_demo.py运行python ollama_demo.py你将看到类似输出 提问用一句话解释什么是人工智能。 本地模型(qwen:7b)思考中... 回答人工智能是让机器模拟人类智能行为的科技。 ⏱️ 耗时1.35秒恭喜你已经成功用Python调用了本地模型完成了第一个自动化问答任务。是不是很有成就感本地模型 vs 在线模型谁更胜一筹现在我们来做一个非正式的PK从响应速度、回答质量和隐私成本三个维度对比本地模型与在线模型如GPT-3.5、GPT-4。响应速度对比**本地模型**速度完全取决于硬件。如果你有NVIDIA显卡如RTX 3060 12GB7B模型每秒可生成30-50个token回答一句话只需12秒。如果只用CPU速度会慢一些大约5~10秒但依然比网络延迟服务器排队快除非你拥有超高速光纤且服务器空闲。**在线模型**受网络延迟和服务器负载影响通常需要2~5秒高峰时段可能更长。**结论**本地模型在速度上通常占优尤其是有GPU时。回答质量对比**本地模型**Qwen 7B和Llama 3 7B都是经过指令微调的优秀开源模型能够流畅回答日常问题、进行简单推理。但对于复杂逻辑、创意写作、多语言混合等任务可能不如顶级在线模型。**在线模型**GPT-4、Claude 3.5等拥有更大参数和更丰富的训练数据回答往往更精准、更有深度甚至能完成代码调试、论文写作等高难度任务。**结论**在线模型质量更高但本地模型也能满足大部分通用需求。隐私与成本**隐私**本地模型完胜你的数据永远不会离开电脑。**成本**本地模型一次性下载永久免费在线模型按token收费长对话或频繁调用会产生费用。**最终建议**两者不是替代关系而是互补。日常简单问答、隐私问题用本地模型需要高质量答案、复杂任务时可以临时调用在线模型。这样既省钱又高效总结与展望通过本文你已经学会了安装Ollama工具并在Windows/macOS/Linux上成功运行。使用Ollama基本命令拉取、运行、管理模型。通过Python代码调用Ollama API实现本地模型的自动化问答。对比本地模型与在线模型的优劣做到心中有数。现在你已经成为了一名合格的“AI驯兽师”可以在本地自由调教你的AI宠物了下一步可以尝试拉取更多模型如CodeLlama代码专用、Mistral等。学习如何对模型进行量化降低资源占用。结合LangChain、FastAPI等框架构建更复杂的AI应用。AI的世界广阔无垠而你已经在本地迈出了最关键的一步。如果在实践中遇到问题欢迎留言交流常见问题解答Q1运行 ollama run 时出现“Error: model requires more memory”怎么办A这通常是因为你的内存或显存不足。可以尝试拉取更小的模型如 qwen:0.5b或者关闭其他占用内存的程序。如果使用CPU确保至少有8GB空闲内存。Q2API调用时返回“Connection refused”错误A请确认Ollama服务是否正在运行。可以在终端执行 ollama serve 启动服务或者检查服务是否被防火墙阻止。Q3如何让模型生成更长的回答A在API调用中可以添加 max_tokens 参数例如 “max_tokens”: 500。对于 /v1/chat/completions可以在payload中加入 “max_tokens”: 500。Q4有没有图形化界面可以使用本地模型A有的比如 Open WebUI 可以对接Ollama提供类似ChatGPT的Web界面。你也可以搜索“Ollama GUI”找到更多工具。Q5模型下载速度太慢怎么办A可以尝试更换网络环境或者使用代理。Ollama的模型托管在GitHub和HuggingFace国内用户可能较慢可以寻找镜像源如阿里云、百度云等需自行搜索。

相关新闻