尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

whichllm 完整指南:3 步选对能跑进你显卡的本地 LLM

whichllm 完整指南:3 步选对能跑进你显卡的本地 LLM whichllm 完整指南3 步选对能跑进你显卡的本地 LLM【免费下载链接】whichllmFind the local LLM that actually runs and performs best on your hardware. Ranked by real, recency-aware benchmarks, not parameter count. One command, run it instantly.项目地址: https://gitcode.com/GitHub_Trending/wh/whichllm24G 显卡装得下 70B但真跑起来 2 t/s 根本没法看参数大不等于能用。whichllm 一条命令扫完你的显存、内存和带宽按实时基准分排出真正能跑、还够快的本地 LLM把能跑和跑得快一起锁死。3 步先跑起来不用 clone、不用配环境敲 3 条命令就能出结果。装包pip install whichllm需要 Python 3.11 以上。直接跑whichllm它自动识别你的 GPU/CPU/内存吐出一张按基准分排序的推荐榜默认就带显存、速度、适配方式这几列。不买卡先试whichllm --gpu RTX 4090把目标显卡塞进模拟器先看看能跑多快。第一次跑会从 HuggingFace 拉模型和基准数据并缓存下来之后几秒就能出结果。速度列还按颜色标了实用性红色基本别碰、绿色起才适合日常扫一眼就知道哪几个真能用。下面几个场景都是在这条命令上加几个开关。显存吃紧只看全塞进显卡的模型默认排名会把部分掉到内存纯 CPU的候选也塞进来求稳就只留整卡装得下的。需求怕推荐了会掉显存、加载一半 OOM 的模型。命令whichllm --gpu-only --speed usable --vram-headroom 1GB。结果只留整卡装得下的候选速度低于 10 t/s 的直接砍掉还给运行时留 1GB 余量#1 Qwen/Qwen3.6-27B 27.8B Q5_K_M score 92.8 27 t/s #2 Qwen/Qwen3-32B 32.0B Q4_K_M score 83.0 31 t/s #3 Qwen/Qwen3-30B-A3B 30.0B Q5_K_M score 82.7 102 t/s注意第 3 名那个 102 t/s——它是 MoE速度按激活参数算、质量按总参数算这正是 whichllm 和纯看体积工具的分水岭。给长文本调上下文默认按 4096 上下文估 KV cache你要啃长文档就得往上抬。需求想跑 64k 上下文。命令whichllm --context-length 64k。结果表里每个模型的显存需求按 64k 重算原先勉强能塞的 14B 可能掉出推荐显存富余的大卡依旧稳——上下文一改能跑清单就重新洗牌。要啃代码库或长论文直接--context-length 128k。榜单看完直接上手开聊光看榜不落地等于白忙run能把下载、装依赖、起会话一条龙干了。需求立刻和某个模型对话。命令whichllm run qwen 2.5 1.5b gguf或者干脆whichllm run让它自己挑当前硬件的榜首。结果它用uv建一个隔离环境、拉模型、进交互式聊天不碰你本来的 Python 环境GGUF/AWQ/GPTQ/FP16 都能跑只想抄启动代码不真跑用whichllm snippet qwen 7b拿一段 Python 就行。旧显卡值不值得升级纠结换卡别只看显存数字让数据替你算。需求想知道从老卡升到 4090 / 5090 能多跑多少。命令whichllm upgrade RTX 4090 RTX 5090。结果同一台机器CPU、内存不变、只换 GPU分别排出每张目标卡的 best-N 模型质量和 tok/s 的跳变摆在一起值不值得升级一眼看清加--profile coding还能按编程场景比。参数速查选项作用示例值--top/-n显示前 N 个推荐5--context-length/-cKV cache 上下文长度64k--quant/-q只保留某量化Q4_K_M--profile任务画像 general/coding/vision/math/anycoding--gpu模拟指定显卡可多张RTX 4090--gpu-only只要整卡装得下的无值--speed速度下限 any/usable/fastusable--evidence基准证据门槛 strict/base/anystrict--details改显示下载量等元数据无值--vram覆盖显存大小GB16--vram-headroom运行时预留显存1GB--markdown/-m输出可粘贴的 Markdown 表无值--json输出机器可读 JSON无值--refresh忽略缓存重新拉取无值--cpu-only忽略 GPU按纯 CPU 排无值子命令也常用whichllm hardware只查硬件不排名whichllm plan llama 3 70b反查某模型得配哪张卡。完整选项和输出字段在 docs/cli.md。踩坑提醒分数全是~或?基准证据弱加--evidence strict只留独立实测过的模型。显存/带宽检测不准核显、统一内存手动覆盖whichllm --vram 16 --bandwidth 68多卡再加--gpu-index 0。速度列飘红嫌慢就--speed usable10 t/s 起过滤掉估算原理见 docs/hardware.md。收尾whichllm 把能不能跑和跑得快不快揉进同一个分数省掉你逐个试装的折腾。现在就在终端敲一句whichllm看看你的卡真正该跑哪款本地 LLM。【免费下载链接】whichllmFind the local LLM that actually runs and performs best on your hardware. Ranked by real, recency-aware benchmarks, not parameter count. One command, run it instantly.项目地址: https://gitcode.com/GitHub_Trending/wh/whichllm创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表