Python技术迷

whichllm:买显卡前,先让命令行告诉你能跑哪个本地大模型

老鬼看这种项目,第一眼一般不看宣传词,先翻命令。

whichllm 最抓人的地方就一行:

uvx whichllm@latest

不用先配一堆环境,不用纠结哪个 GGUF、Q4 还是 Q5,也不用在 HuggingFace 上开十几个标签页。它会自动检测 GPU、CPU、内存,然后把能在你机器上跑的本地模型排个名。项目 README 里说得很直白:它不是找“参数最大、刚好塞进显存”的模型,而是找“真的能跑,而且表现更合适”的模型。

Image

这点挺现实。

以前折腾本地大模型,最烦的不是下载,而是你以为 24GB 显存能跑,结果上下文一拉长、KV cache 一上来,速度掉得像断网。再加上量化版本一堆,Q4、Q5、AWQ、GPTQ,看着都能用,真上手才知道有些只是“能启动”。

whichllm 做的脏活就是把这些东西压到一条推荐里:榜单分数、推理速度、量化损耗、显存估算,混在一起算。它还会参考 LiveBench、Artificial Analysis、Aider、Arena ELO 这些评测源,并给直接证据、继承分数、上传者自报分数做不同置信处理。

当然,先别急着吹。

这种工具最大的风险,是推荐看起来很科学,但你真实场景不一定听它的。比如你就是写代码,那通用榜单没那么有用;你要长上下文,那默认速度估计也只能当规划值。README 里其实也留了口子,速度会带 confidence 和 range,说明它不是现场 benchmark。

但买显卡前,这玩意儿就有点香了。

uvx whichllm@latest --gpu "RTX 4090"
whichllm plan "llama 3 70b"

前者是模拟一张卡,看能跑什么;后者反过来,给一个模型,问你大概需要什么硬件。老鬼对这个很敏感,因为很多人买卡不是输给参数,是输给“我以为能跑”。一张卡差几千块,先用命令行泼盆冷水,不丢人。

Image

还有个小细节:选好模型后,它可以直接 whichllm run 下载并开聊,也能 whichllm snippet 生成 Python 代码片段。 这不是革命,别拔高。但对做 Demo、写小工具、接本地推理的人来说,少翻半小时文档,就是少一次心态爆炸。

老鬼会把它当“显卡和模型选择前的体检表”用。别指望它替你理解业务,也别把分数当圣旨;但在你准备下载几十 GB 模型、或者准备下单新卡之前,先跑一把 whichllm,挺值。

GitHub地址:github.com/Andyyyy64/whichllm