程序员老鬼

whichllm:一条命令帮你选本地大模型,别再凭显存瞎猜了

老鬼看这种工具,第一眼通常不看宣传词,先翻命令。

uvx whichllm@latest

就这一行,我停了一下。因为本地跑 LLM 最烦的地方,真不是“能不能装”,而是你明明有一张卡,却不知道该下哪个 GGUF、量化选 Q4 还是 Q5、上下文一拉长会不会直接爆显存。whichllm 做的事很土,但很实用:自动检测 GPU、CPU、内存,然后从 HuggingFace 里挑能跑的模型,给你排个名。

这东西有意思的点,不是“找能塞进显存的最大模型”。

它会把真实评测分数、推理速度、量化损耗、模型新旧、证据可信度一起算进去。README 里还专门说了,分数不是单看参数量;低置信度、搬运仓库、自报 benchmark 这类东西会被打折。啧,这点挺关键。开源模型圈里最不缺的就是“看起来很强”的模型名,真拿来跑,429 没有,502 没有,但电脑风扇先替你骂人。

Image

还有个买卡前很实用的玩法:

whichllm --gpu "RTX 4090"

假装你有某张显卡,先看它能推荐什么。反过来也行,whichllm plan "llama 3 70b",让它告诉你跑某个模型大概需要什么硬件。以前做本地 Demo,最怕的就是模型下完几十 GB,结果发现跑得像幻灯片,删也不是,不删也不是。

先别急着吹。

README 里也写得很清楚,速度是规划范围,不是你机器上的实测 benchmark。驱动、后端、散热、内存带宽,这些脏活最后还是会找上门。所以 whichllm 更像“少踩第一批坑”的工具,不是性能玄学终结器。

Image

选好之后,它还能直接 whichllm run 下载并开聊,或者用 whichllm snippet 打一段可复制的 Python 代码。这个对新手挺香,对老手也省事,至少不用在 repo_id、filename、n_gpu_layers 这种小坑里来回翻。

我会把它放在两个场景里用:一是新机器到手,先扫一眼能跑什么;二是买显卡前,别光看跑分,先模拟一下本地模型清单。

GitHub地址:github.com/Andyyyy64/whichllm