尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

LM Studio本地大模型部署实战:GGUF量化与OpenAI兼容API

LM Studio本地大模型部署实战:GGUF量化与OpenAI兼容API 1. 为什么现在必须亲手部署一个本地大模型——LM Studio 不是玩具而是生产力工具你有没有过这样的时刻在写一份技术方案时卡在第三段反复删改却始终找不到精准的表达调试一段 Python 脚本报错信息像天书查了半小时 Stack Overflow 还没定位到根本原因或者给客户做产品演示突然网络抖动AI 助手直接掉线现场冷场三秒——这三秒就是你专业形象的裂痕。这些不是偶然而是把关键推理能力交到别人服务器上的必然代价。LM Studio 正是为解决这个问题而生它不依赖云端 API、不上传你的文档、不按 token 计费、不看服务商脸色。它是一套开箱即用的本地大模型运行时环境核心关键词是LM Studio、本地大模型、API调用、GGUF、量化模型——这五个词串起来就是一条从下载模型到集成进你日常开发流的完整链路。我第一次在 MacBook Pro M2 上跑通 Qwen2-7B-GGUF 时没有弹出任何“欢迎使用”界面只有一行终端输出Server started on http://127.0.0.1:1234。但当我 curl 发送第一条请求看到返回的 JSON 里content字段准确复述了我刚粘贴进来的 Excel 表头逻辑那一刻我才真正理解什么叫“模型在你手里”。这不是玩具是可控的推理引擎。它适合三类人第一类是开发者需要把大模型能力嵌入内部系统比如用 Java 写个审批流程助手调用本地模型判断报销单是否合规第二类是数据分析师手上有敏感客户行为日志不能上传公有云但又需要快速生成洞察摘要第三类是内容创作者想批量润色文案、生成多版本标题又不想被平台算法限制风格。LM Studio 的价值不在“能跑模型”而在“跑得稳、调得快、管得住”。它不强制你写一行 Python也不要求你编译 CUDA 内核但它把所有底层复杂性封装成一个可配置的 HTTP 接口——这才是它和 Ollama、Text Generation WebUI 的本质区别前者是容器化服务后者是桌面级生产力套件。接下来的内容我会带你从零开始不跳过任何一个真实场景中会卡住的细节比如 GGUF 模型文件该放哪、为什么量化档选 Q5_K_M 而不是 Q8_0、如何用 curl 验证 API 是否真通、怎么把响应结果塞进 VS Code 的 Continue 插件里——全是我在客户现场踩坑后记下来的硬核经验。2. LM Studio 的底层逻辑与设计哲学为什么它能绕过 GPU 显存陷阱2.1 它不是另一个 Llama.cpp 封装器而是“模型即服务”的桌面实现很多人误以为 LM Studio 只是 Llama.cpp 的图形界面。这是最大的认知偏差。Llama.cpp 是 C 实现的推理引擎专注极致性能LM Studio 则是在其之上构建了一整套服务化抽象层。它的核心架构分三层最底层是 Llama.cpp负责加载 GGUF 模型、执行推理计算中间层是 Rust 编写的本地 HTTP 服务器处理请求路由、流式响应、上下文管理最上层才是 Electron 构建的 UI仅负责模型选择、参数调节、聊天界面。这意味着当你点击“Start Server”时它实际启动的是一个标准 RESTful 服务完全兼容 OpenAI API 协议——这点至关重要因为你的 Java 后端、Python 脚本、甚至 Android App都不需要重写 SDK只要把https://api.openai.com/v1/chat/completions换成http://127.0.0.1:1234/v1/chat/completions就能无缝切换到本地模型。提示LM Studio 默认监听127.0.0.1:1234这个地址只能本机访问。如果你要在局域网另一台机器上调用比如用手机浏览器测试必须在设置里勾选“Allow remote connections”并确保防火墙放行 1234 端口。别跳过这步我见过太多人卡在这里两小时。2.2 GGUF 格式为什么它是本地部署的“通用货币”GGUF 是 Llama.cpp 团队推出的全新模型存储格式取代了旧的 GGML。它的设计目标非常明确跨平台兼容性 内存映射加载 量化支持无缝集成。你可以把它理解成模型领域的 PDF 文件——无论你在 Windows、macOS 还是 Linux 上只要用支持 GGUF 的引擎如 LM Studio、Ollama、llama.cpp CLI同一个.gguf文件就能直接运行无需转换。更重要的是GGUF 把模型权重、词汇表、元数据比如是否支持聊天模板、最大上下文长度全部打包进一个文件彻底告别过去那种要同时管理pytorch_model.bin、tokenizer.json、config.json三个文件的混乱局面。量化模型Quantization则是让大模型在消费级硬件上落地的关键。以 Qwen2-7B 为例原始 FP16 版本约 13GB而 Q5_K_M 量化后仅 4.2GB推理速度提升 2.3 倍显存占用从 14GB 降到 4.8GB。LM Studio 内置的量化档位选择不是玄学而是有明确取舍逻辑的Q2_K极致压缩适合 8GB RAM 笔记本但数学推理和代码生成质量明显下降Q4_K_M平衡之选7B 模型在 16GB 内存 Mac 上流畅运行中文理解、基础编程无压力Q5_K_M推荐主力档位精度损失极小对长文本保持力强在 M2 MacBook Air 上实测每秒 18 tokenQ6_K接近 FP16 质量但体积增大 30%仅建议 32GB 内存用户选用Q8_0几乎无损但体积只比 FP16 小 15%失去量化意义。注意不要迷信“越高越好”。我曾用 Q8_0 跑 Qwen2-7B在 M1 Mac 上因内存带宽瓶颈反而比 Q5_K_M 慢 12%。量化不是单纯减小体积而是重新分配数值精度——高频词保留高精度低频词用低位宽表示LM Studio 的档位命名里的_K就代表这种分组量化策略。2.3 为什么它比 Ollama 更适合“开发者直连”Ollama 是优秀的容器化方案但它的设计哲学是“一键拉取、开箱即用”所有模型都通过ollama run qwen2:7b这种命令管理背后是 Docker 镜像和 layer 缓存。这对快速试用很友好但对生产集成却是障碍Java 应用无法直接调用ollama run命令必须起子进程或走 HTTP而 Ollama 的 API 默认不开启需手动ollama serve且不支持 OpenAI 兼容模式。LM Studio 则相反它默认就提供 OpenAI 兼容 API且所有模型文件由你完全掌控——你可以把.gguf文件放在/Users/yourname/models/下任意子目录LM Studio 会自动扫描并列出。这意味着你的 CI/CD 流程可以这样设计Jenkins 构建完 Java 服务后自动从内网 NAS 下载最新版qwen2-7b-Q5_K_M.gguf到指定路径再启动 LM Studio 服务。整个过程无需 Docker、不依赖公网、不产生额外容器开销。3. 从零部署实战MacBook M2 上的完整安装与模型加载流程3.1 安装 LM Studio避开官网镜像陷阱的正确姿势LM Studio 官网lmstudio.ai提供 macOS、Windows、Linux 三端安装包。但这里有个关键细节不要直接点击首页的“Download for macOS”按钮。那个链接指向的是最新稳定版目前是 v0.3.12但它内置的 llama.cpp 版本较旧对 Apple Silicon 的 Metal 加速支持不完善。正确的做法是去 GitHub Releases 页面https://github.com/lmstudio-ai/lm-studio/releases找到v0.3.12-macos-arm64.dmg这个文件——注意后缀必须是arm64不是x64。M1/M2/M3 芯片必须用 arm64 版本否则会触发 Rosetta 2 翻译性能损失高达 40%。下载后双击挂载 DMG将 LM Studio 拖入 Applications 文件夹。首次启动时系统会提示“无法验证开发者”这是正常现象LM Studio 未申请 Apple 开发者证书。解决方案是右键应用图标 → “显示简介” → 勾选“仍要打开”。之后每次启动都会记住此设置。实操心得我建议在启动前先执行一次终端命令预热 Metal 驱动xcode-select --install sudo xcode-select --switch /Applications/Xcode.app这能避免首次加载模型时出现Metal: failed to create command queue错误。Xcode 命令行工具虽不需完整 Xcode但 Metal 运行时依赖其底层库。3.2 模型获取与存放GGUF 文件的“黄金路径”规则LM Studio 不会自动下载模型它只负责加载你提供的 GGUF 文件。模型来源有两个可靠渠道Hugging Face 和 TheBlokeHugging Face 上最活跃的量化模型发布者。搜索关键词qwen2 gguf或deepseek-coder gguf进入模型页面后重点看 Files and versions 标签页。你需要下载的是以.gguf结尾的文件例如qwen2-7b-instruct.Q5_K_M.gguf。切勿下载.safetensors或.bin文件它们是 PyTorch 格式LM Studio 无法识别。下载完成后文件默认保存在~/Downloads/。此时不要直接双击打开——LM Studio 对模型文件路径有严格约定它只扫描两个位置~/Documents/LMStudio/models/用户文档目录下的 models 子目录~/Library/Application Support/LMStudio/models/应用数据目录我强烈推荐使用第一个路径因为~/Documents可被 Time Machine 备份且路径直观易记。创建目录并移动文件mkdir -p ~/Documents/LMStudio/models mv ~/Downloads/qwen2-7b-instruct.Q5_K_M.gguf ~/Documents/LMStudio/models/关键细节文件名中的instruct表示这是指令微调版已内置 ChatML 或 Qwen 模板能直接处理user/assistant角色对话而chat或base版本则需手动指定聊天模板。LM Studio 启动后会自动扫描这两个目录并在左侧模型列表中显示所有.gguf文件。如果没出现检查文件权限ls -l ~/Documents/LMStudio/models/应显示-rw-r--r--若出现符号表示扩展属性执行xattr -c ~/Documents/LMStudio/models/*.gguf清除。3.3 模型加载与参数调优不是点“Load”就完事在 LM Studio 主界面左侧模型列表中找到qwen2-7b-instruct.Q5_K_M.gguf点击右侧的“Load”按钮。此时界面不会立刻变化而是右下角出现一个进度条显示“Loading model...”。这个过程实际在做三件事解压 GGUF 元数据、映射权重到内存、初始化 Metal 引擎。M2 MacBook Air8GB上耗时约 90 秒M2 Max32GB约 35 秒。加载成功后顶部状态栏会显示Model loaded: qwen2-7b-instruct.Q5_K_M并出现“Chat”、“Playground”、“Settings”三个标签页。别急着点 Chat——先去 Settings 页调整关键参数GPU Offload Layers这是 Metal 加速的核心开关。M2 芯片有统一内存架构LM Studio 会自动检测可用 VRAM。设为207B 模型共 32 层20 层 GPU 计算12 层 CPU 计算是实测最佳值。设太高如 28会导致 Metal 内存不足报错设太低如 5则 CPU 成瓶颈。Context Size默认 4096但 Qwen2 支持 32K 上下文。若你处理长文档可改为8192但需确保内存充足每增加 1K context显存占用增约 120MB。Temperature控制输出随机性默认 0.7。写代码时建议降至0.3减少幻觉写创意文案可升至0.9。Stop Sequences添加/s和|eot_id|Qwen2 的 EOS token防止模型无限续写。踩坑记录某次我忘记添加|eot_id|模型在生成 SQL 语句时突然插入一段无关的 Markdown 表格调试半小时才发现是 EOS 截断失效。LM Studio 的 Stop Sequences 是硬性截断不是概率抑制必须精确匹配模型 tokenizer 的 EOS token。3.4 启动 API 服务让本地模型变成真正的“微服务”点击右上角“Start Server”按钮。几秒后状态栏变为Server running on http://127.0.0.1:1234。这就是你的本地 AI 微服务地址。现在用 curl 验证curl -X POST http://127.0.0.1:1234/v1/chat/completions \ -H Content-Type: application/json \ -d { model: qwen2-7b-instruct.Q5_K_M, messages: [ {role: user, content: 用 Python 写一个函数计算斐波那契数列第 n 项} ], temperature: 0.3 }成功响应会返回标准 OpenAI 格式 JSONchoices[0].message.content字段包含完整 Python 代码。如果返回{error: {message: Model not loaded, ...}}说明模型未加载或名称不匹配——检查 Settings 页的 Model Name 是否与 curl 中的model字段完全一致包括大小写和点号。实操技巧把常用 curl 命令存为 shell 脚本比如qwen-test.sh#!/bin/bash curl -X POST http://127.0.0.1:1234/v1/chat/completions \ -H Content-Type: application/json \ -d {\model\:\qwen2-7b-instruct.Q5_K_M\,\messages\:[{\role\:\user\,\content\:\$1\}],\temperature\:0.3}执行./qwen-test.sh 解释量子纠缠即可快速测试。4. API 集成实战Java、Python、VS Code 的三种调用方式4.1 Java 后端集成Spring Boot 项目中调用本地大模型假设你有一个 Spring Boot 电商后台需要在订单审核环节自动识别异常地址如“火星基地收货”。传统做法是调用第三方 NLP API但现在我们用 LM Studio 本地服务替代。首先在pom.xml中添加 OkHttp 依赖比 RestTemplate 更轻量支持连接池dependency groupIdcom.squareup.okhttp3/groupId artifactIdokhttp/artifactId version4.12.0/version /dependency创建AiService.javaComponent public class AiService { private final OkHttpClient client new OkHttpClient.Builder() .connectTimeout(30, TimeUnit.SECONDS) .readTimeout(60, TimeUnit.SECONDS) .build(); // 模型地址固定为本地服务 private static final String LM_STUDIO_URL http://127.0.0.1:1234/v1/chat/completions; public String analyzeAddress(String address) throws IOException { // 构造符合 Qwen2 指令微调格式的 prompt String prompt String.format( 你是一个电商风控助手。请严格按以下格式回答\n 是否异常是/否\n 理由10字简要说明\n 原始地址%s, address); JSONObject request new JSONObject(); request.put(model, qwen2-7b-instruct.Q5_K_M); request.put(messages, new JSONArray() .put(new JSONObject().put(role, user).put(content, prompt))); request.put(temperature, 0.1); // 降低随机性确保格式稳定 RequestBody body RequestBody.create( request.toString(), MediaType.get(application/json; charsetutf-8)); Request okRequest new Request.Builder() .url(LM_STUDIO_URL) .post(body) .build(); try (Response response client.newCall(okRequest).execute()) { if (!response.isSuccessful()) { throw new IOException(LM Studio API error: response); } JSONObject jsonResponse new JSONObject(response.body().string()); return jsonResponse.getJSONArray(choices) .getJSONObject(0) .getJSONObject(message) .getString(content); } } }在 Controller 中调用RestController public class OrderController { Autowired private AiService aiService; PostMapping(/api/orders/verify-address) public ResponseEntityString verifyAddress(RequestBody AddressRequest request) { try { String result aiService.analyzeAddress(request.getAddress()); // 解析 result 中的 是否异常是 部分 boolean isAbnormal result.contains(是否异常是); return ResponseEntity.ok({\isAbnormal\: isAbnormal }); } catch (Exception e) { return ResponseEntity.status(500).body({\error\:\AI service unavailable\}); } } }关键经验Qwen2 的指令微调版对 prompt 格式极其敏感。必须用中文明确指定输出格式如“严格按以下格式回答”否则可能返回自由文本。温度设为0.1是为了压制创造性确保结构化输出。实测中当temperature0.7时模型偶尔会添加额外解释破坏 JSON 解析。4.2 Python 脚本调用自动化文档摘要生成你有一批 PDF 技术文档需要生成摘要但内容涉密不能上传云端。用 Python 调用 LM Studio 是最直接方案。安装requests库pip install requests编写summarize.pyimport requests import fitz # PyMuPDF import sys def extract_text_from_pdf(pdf_path): 提取 PDF 文本按页分割 doc fitz.open(pdf_path) pages [] for page in doc: text page.get_text() if len(text.strip()) 50: # 过滤空白页 pages.append(text[:2000]) # 每页截取前2000字符避免超 context return pages def call_lm_studio(prompt): 调用本地 LM Studio API url http://127.0.0.1:1234/v1/chat/completions payload { model: qwen2-7b-instruct.Q5_K_M, messages: [ {role: user, content: prompt} ], temperature: 0.2, max_tokens: 512 } headers {Content-Type: application/json} try: response requests.post(url, jsonpayload, headersheaders, timeout120) response.raise_for_status() return response.json()[choices][0][message][content] except requests.exceptions.RequestException as e: print(fAPI call failed: {e}) return if __name__ __main__: if len(sys.argv) ! 2: print(Usage: python summarize.py pdf_file) sys.exit(1) pdf_path sys.argv[1] pages extract_text_from_pdf(pdf_path) print(fProcessing {len(pages)} pages...) summaries [] for i, page_text in enumerate(pages): prompt f你是一名资深技术文档工程师。请为以下技术文档片段生成30字以内精准摘要聚焦核心功能和关键技术点 {page_text} summary call_lm_studio(prompt) summaries.append(fPage {i1}: {summary}) print(f✓ Page {i1} summarized) # 输出汇总 with open(f{pdf_path.rsplit(.,1)[0]}_summary.txt, w) as f: f.write(\n.join(summaries)) print(Summary saved!)执行python summarize.py manual.pdf脚本会自动提取每页文本逐页调用 LM Studio 生成摘要并保存为 TXT 文件。全程数据不出本地且响应时间平均 8 秒/页M2 Mac。注意事项PDF 文本提取质量直接影响摘要效果。PyMuPDF 比pdfplumber更稳定尤其对扫描版 PDF 的 OCR 文本兼容性更好。如果遇到公式乱码可在extract_text_from_pdf中添加page.get_text(text, flagsfitz.TEXT_PRESERVE_LIGATURES)参数。4.3 VS Code 集成让 Continue 插件直连本地模型VS Code 的 Continue 插件原 CodeWhisperer 替代品默认调用云端模型但可通过配置切换到本地服务。这让你在写代码时所有补全、注释生成都在本地完成。步骤如下在 VS Code 中按CmdShiftP输入Preferences: Open Settings (JSON)打开settings.json添加以下配置{ continue.serverUrl: http://127.0.0.1:1234, continue.model: qwen2-7b-instruct.Q5_K_M, continue.apiKey: dummy-key, // LM Studio 不校验 key填任意值 continue.provider: openai }重启 VS Code打开任意.py文件输入#后按CmdIContinue 会向本地服务发送请求。实测对比在 200 行 Python 脚本中生成单元测试云端模型平均延迟 1.8 秒本地模型 0.9 秒且无网络波动影响。更重要的是Continue 的上下文感知能力在本地更强——它能实时读取当前文件全部内容作为 context而云端服务受 token 限制常截断。5. 常见问题排查与性能优化那些官方文档不会告诉你的细节5.1 模型加载失败的五大原因及对应解法现象根本原因解决方案点击 Load 后无反应状态栏无变化GGUF 文件损坏或非标准格式用file qwen2-7b.Q5_K_M.gguf命令检查应返回qwen2-7b.Q5_K_M.gguf: data若显示cannot open重新下载加载中报错Failed to load model: invalid magic文件下载不完整常见于浏览器中断删除文件用wget命令重下wget https://huggingface.co/TheBloke/Qwen2-7B-Instruct-GGUF/resolve/main/qwen2-7b-instruct.Q5_K_M.gguf加载成功但 Chat 界面输入后无响应Stop Sequences 未配置或错误进入 Settings → Stop Sequences添加 API 返回context length exceeded请求 message 总 token 数超模型 context用tiktoken库预估python -c import tiktoken; enc tiktoken.get_encoding(cl100k_base); print(len(enc.encode(your text)))Server 启动后 curl 返回Connection refusedLM Studio 未真正启动服务或端口被占用终端执行lsof -i :1234查看占用进程kill -9 PID后重启 LM Studio5.2 性能瓶颈诊断如何判断是 CPU、GPU 还是内存拖慢LM Studio 内置性能监控Settings → Advanced → Show performance metrics但更可靠的诊断方法是终端命令检查 Metal GPU 利用率# 安装 metal-stats需 Homebrew brew install metal-stats metal-stats -d # 观察 GPU Utilization 和 VRAM Used若 GPU 利用率 30% 但推理慢则是 CPU 或内存瓶颈监控内存压力vm_stat 1 # 每秒刷新关注 Pages free 和 Pages inactive # 若 Pages free 持续 5000且 Pages inactive 1000000说明内存不足需关闭其他应用CPU 占用分析top -o cpu -s 2 # 按 CPU 排序观察 LMStudio 进程是否持续 90% # 若是说明 GPU offload 层数过低需在 Settings 中调高实测案例某次在 M1 Mac 上跑 Qwen2-7B推理速度仅 8 token/s。metal-stats显示 GPU 利用率 12%top显示 CPU 占用 98%。调高 GPU Offload Layers 从 10 到 20 后速度升至 18 token/sGPU 利用率升至 65%。5.3 模型选择避坑指南不是越大越好而是“够用即最优”网络热词里常问“ollama 本地部署大模型哪个模型最佳”答案取决于你的场景代码生成DeepSeek-Coder-33B-Q5_K_M33B 参数但专精代码GitHub Issue 理解力远超 Qwen2-72B中文长文本Qwen2-72B-Instruct-Q4_K_M72B 体积大但 Q4_K_M 仅 42GB在 64GB 内存工作站可跑边缘设备AndroidPhi-3-mini-4k-instruct.Q4_K_M.gguf3.8B 参数Q4_K_M 仅 2.1GBMNN 推理框架可直接加载低延迟响应TinyLlama-1.1B-Chat-v1.0.Q5_K_M.gguf1.1BM2 Mac 上达 45 token/s个人体会我曾为一个实时客服系统选型测试了 Qwen2-7B、Qwen2-72B、DeepSeek-Coder-33B。结果 Qwen2-7B 在 95% 场景下响应更快因上下文加载快且错误率最低。72B 模型在复杂推理上略优但 30% 请求超时因 context 加载慢。最终上线选了 Qwen2-7B用多实例负载均衡TPS 提升 2.1 倍。模型选型的本质是 SLA服务等级协议匹配不是参数竞赛。6. 进阶场景拓展让本地大模型突破单机限制6.1 多模型协同用 LM Studio 管理不同专长的“AI 工具箱”LM Studio 支持同时加载多个模型但不支持并发推理。真正的多模型协同需架构设计例如用一个轻量模型Phi-3做意图识别再路由到专用模型DeepSeek-Coder 处理代码、Qwen2 处理中文。实现方式是在 Java 后端加一层路由逻辑public String routeToModel(String input) { // 先用 Phi-3 判断意图 String intent callModel(phi-3-mini-4k.Q5_K_M, 判断以下用户输入属于哪类任务只回答一个词代码/文档/翻译/其他\n input); switch (intent.trim()) { case 代码: return callModel(deepseek-coder-33b.Q5_K_M, input); case 文档: return callModel(qwen2-72b.Q4_K_M, input); default: return callModel(qwen2-7b.Q5_K_M, input); } }关键点Phi-3 模型仅 2.1GB加载快、响应快适合作为“AI 网关”。LM Studio 的模型热加载Unload/LoadAPI 可在运行时切换但频繁切换有开销所以用轻量模型做前置判断更高效。6.2 本地联网搜索给模型装上“实时知识插件”LM Studio 本身不支持联网但可通过外部服务桥接。例如用 Python 写一个搜索代理# search_agent.py import requests from bs4 import BeautifulSoup def google_search(query, num_results3): # 使用 SerpAPI需 API Key或自建爬虫 # 此处简化为本地模拟 return [根据2024年Q2财报苹果营收同比增长5.3%, iOS 18 beta 5 已发布修复了通知中心崩溃问题] def enhance_with_search(user_input): # 提取用户问题中的实体和时间 search_query extract_entities(user_input) # 自定义 NER 函数 search_results google_search(search_query) # 将搜索结果拼入 prompt enhanced_prompt f你是一个专业助理。以下是用户问题和相关实时信息 用户问题{user_input} 实时信息{chr(10).join(search_results)} 请基于以上信息给出准确、简洁的回答。 return call_lm_studio(enhanced_prompt)这样LM Studio 就获得了“联网能力”且所有数据仍在本地处理。6.3 持续学习闭环用用户反馈微调本地模型LM Studio 不支持在线微调但可构建反馈闭环收集用户对模型回答的“赞/踩”数据定期导出为 SFT 数据集用 Unsloth 库在本地微调# 1. 收集 1000 条优质问答对保存为 train.jsonl # 2. 微调脚本 pip install unsloth python -c from unsloth import is_bfloat16_supported from unsloth import ( get_peft_model, prepare_model_for_kbit_training, ) from trl import SFTTrainer from transformers import TrainingArguments # ... 微调代码 微调后的模型导出为 GGUF再导入 LM Studio。整个流程无需 GPU 云服务一台 32GB 内存的 Mac 就能完成。最后分享一个小技巧LM Studio 的模型文件夹~/Documents/LMStudio/models/可以用 iCloud 同步。我在 MacBook、Mac Studio、Mac Mini 三台设备上启用同一 iCloud 目录模型文件自动同步Settings 配置也保持一致。这样无论在哪台机器上curl http://127.0.0.1:1234/...的体验完全一样——真正的“一处配置处处可用”。
返回列表