尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

Jan 升级到 v0.8.0 后模型加载失败,怎么把 KV Cache 类型改回 f16?

Jan 升级到 v0.8.0 后模型加载失败,怎么把 KV Cache 类型改回 f16? Jan 升级到 v0.8.0 后模型加载失败怎么把 KV Cache 类型改回 f16【免费下载链接】janJan is an open source alternative to ChatGPT that runs 100% offline on your computer.项目地址: https://gitcode.com/GitHub_Trending/ja/jan如果你把 Jan 升级到 v0.8.0 之后之前能正常运行的本地模型突然加载失败最可能的原因是 KV Cache 类型早期版本曾把 llama.cpp 的默认 KV cache 类型临时改为q8_0v0.8.0 已将默认值改回f16但这个变更不会自动迁移到现有安装。也就是说你的配置里可能仍保留着旧的q8_0值而部分依赖 flash attention 的模型在这种配置下无法加载。解决办法是在设置里把KV Cache K Type和KV Cache V Type两项手动改回f16。为什么升级后会出现这个问题v0.8.0 的 发布说明对此有两处明确记载默认 KV cache 类型曾在先前版本被临时改为q8_0v0.8.0 将其改回f16作为更安全的默认值同时移除了旧版f16 → q8_0的自动迁移代码现有安装不会被自动迁移——如果升级后模型加载失败需要手动到Settings llama.cpp KV Cache K Type / V Type把两项改回f16。因此升级后突然加载失败这个时间点本身就是判断依据同一模型、同一硬件在旧版本能加载、升级到 v0.8.0 后不能优先按上述路径修改 KV cache 类型。把 KV Cache 类型改回 f16设置入口在 llama.cpp 引擎文档中打开SettingsLlama.cpp位于 Model Providers 下页面截图如下在该页面的Memory Settings (Engine-wide)部分找到两项设置项含义目标值KV Cache K TypeKV cache 中 keys 的精度f16KV Cache V TypeKV cache 中 values 的精度f16文档中三项可选值的说明是f16完整 16-bit 精度占用更多内存但质量最高q8_08-bit 量化内存占用和质量折中q4_04-bit 量化占用内存最少略有质量损失。这两项是引擎级设置会作为 router 预设[*]默认值应用到 router 加载的每个模型上。修改时两项都要改只改其中一项不能消除旧默认值的影响。验证模型是否恢复正常改完后重新触发模型加载打开一个使用该模型的对话即可v0.8.0 的 router 进程会按需加载和卸载模型。如果模型能加载并完成回复说明问题就是 KV cache 类型。如果改回f16后仍然加载失败按 Troubleshooting 文档的方式查看根因Jan 会把模型错误显示在聊天里的模型错误横幅中底层原因写入logs/app.logllama.cpp 相关行带有[llamacpp-router]/[llamacpp-router stdout]前缀是模型加载失败时最有价值的信息。日志文件位于macOS:~/Library/Application Support/Jan/data/logs/app.logWindows:%APPDATA%\Jan\data\logs\app.logLinux:~/.local/share/Jan/data/logs/app.log也可以在终端直接查看macOS 示例来自文档tail -n 50 ~/Library/Application\ Support/Jan/data/logs/app.log也可以从 Jan 界面查看底部状态栏打开System Monitor选择App Log。改回 f16 后仍加载失败的分支处理文档给出的其他相关处理路径升级后出现其他异常设置不生效、模型列表显示不对等v0.8.0 已知问题中建议执行Settings General Factory Reset并启用Keep models and configs。这会清除陈旧的应用状态但不会删除已下载的模型和 provider 配置——比彻底重置更适合升级后遗症。日志指向内存不足out of memory、failed to allocate ... buffer等f16 比 q8_0 更耗内存。如果模型本身在内存上就很紧张文档建议换更小/更高量化的模型、降低 Context Size、减少 GPU 卸载层数而 KV cache 类型q8_0/q4_0正是为节省内存准备的选项可以按需再权衡。后端太旧unknown model architecture更新 llama.cpp 后端Settings Model Providers Llama.cpp Backend。限制说明该设置没有自动迁移每个从旧版本升级的安装都需要手动确认一次 KV Cache K/V Type新装或工厂重置后的环境默认即为f16。f16占用内存高于q8_0。如果你的显存/内存本来就紧张改回f16解决加载问题的同时可能需要配合降低 Context Size 或减少 GPU 层数来腾出空间。本文只覆盖 v0.8.0 升级导致的加载失败这一路径模型与后端架构不兼容、端口占用等问题属于 Troubleshooting 文档中的其他小节不在此展开。【免费下载链接】janJan is an open source alternative to ChatGPT that runs 100% offline on your computer.项目地址: https://gitcode.com/GitHub_Trending/ja/jan创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表