Underdog 团队开源的 Underdog-Saluki-27B-1.0,把 27B 参数的 Qwen3.8-27B 压进了 8 个 G 以内,工具调用的能力还基本留着。它在 Hugging Face 上线 3 天就快 6 万次下载,热度来得很直接。

原版 Qwen3.8-27B 全精度要 54 个 G,普通显卡根本放不下。Saluki 这份 2 比特量化的文件只有 7.89 个 G,用标准的 llama.cpp 就能跑:下载完一条 llama-server 命令把服务起起来,8080 端口上就是 OpenAI 那套接口,你手上现成的代码改个地址就能指过来。工具调用和思考都走 Qwen3.8 原生的模板。

量化最容易砸的就是工具调用,而他们是专门往保住这块调的。官方拿 120 道函数调用题测,它过了 88 道,全量版本反而只有 84;100 道并行调用的题它过了 42 道,全量 35 道;9 项基准平均保住了 96%。

想让它响应快点,把思考关掉、温度设成零,一次调用就完事;想让它在难题上多想想也行,默认就是开着的。需要看图,就再下个 600 多兆的视觉文件,启动时挂上 mmproj 就行。

代价也得说清楚:数学竞赛分大概剩八成到八成五,回文字母顺序、元音规则这类抠字母的题它做不好,并行调用还有 1/5 会带格式上的小毛病,思考开着的时候话偏多。手里只有一张显卡、又想在本地跑 Agent 的兄弟,建议先码住。