Underdog AI 发布 Saluki 27B:2-bit 量化智能体模型,仅 7.89GB
一个只有 7.89GB 的小模型,工具调用能力却反超了它那大它好几倍的「亲爹」。人工智能实验室 …
文章目录
一个只有 7.89GB 的小模型,工具调用能力却反超了它那大它好几倍的「亲爹」。人工智能实验室 Underdog AI 本月发布的 Saluki 27B,正在用「智能体特化」的思路,重新定义什么叫够用就好。
一分钟速览
- Underdog AI 发布 Saluki 27B,是 Qwen3.8-27B 的 2-bit 量化调优版本;
- 仅保留文字输入输出能力,文件大小压缩到 7.89GB;
- 针对智能体应用设计,长于日常推理和工具使用,数学表现相对逊色;
- 工具选择和多工具并行调用的表现,甚至优于全尺寸的 Qwen3.8-27B;
- 使用标准 llama.cpp 格式,可直接在 llama.cpp 及其衍生应用中加载,无需自定义编译。
「减配」反而更强的智能体模型
Saluki 27B 的定位非常清晰:不是为了刷跑分、也不是为了聊天,而是给智能体(Agent)场景量身定做。它基于 Qwen3.8-27B 做了 2-bit 量化调优,砍掉了冗余,把体积压到 7.89GB,换来的是更低的硬件门槛和更快的推理速度。
Underdog 官方的表述相当坦诚:Saluki 长于日常推理和工具使用,数学表现则相对逊色。这其实是一个很务实的取舍——在智能体实际工作里,大部分时间都花在「理解指令、挑选合适的工具、并行调度多个工具」上,而不是解微积分。于是团队把有限的模型容量,集中砸向了工具选择和多工具并行调用这些「吃饭的本事」上。
「小模型打赢大模型」的又一份答卷
最让人意外的是官方的对比结论:Saluki 在工具选择和多工具并行调用上的表现,甚至优于全尺寸的 Qwen3.8-27B。这并不违背直觉——量化本身会带来一定精度损失,但针对特定能力做定向调优,往往能「扬长避短」,让模型在它被训练的任务上反超大而全的通用模型。
在部署层面,Saluki 使用了标准的 llama.cpp 格式,这意味着它能直接跑在庞大的 llama.cpp 生态里——无论是本地推理框架,还是各种基于 llama.cpp 构建的应用,都能即插即用,不需要任何自定义编译。对于想把智能体跑在本地、又不想被显存和体积劝退的开发者来说,这无疑是个相当友好的选择。
从更广的视角看,量化正在成为小模型「平民化」的关键杠杆。一个 27B 的模型,经过 2-bit 量化后体积骤降到 7.89GB,这意味着它能在消费级显卡、甚至部分高配笔记本上跑起来,而不必依赖昂贵的云端推理。对于强调低延迟、高并发的智能体工作负载,这种「本地可跑」的特性,往往比榜单上的绝对分数更有现实意义。更重要的是,智能体应用往往需要反复调用工具、频繁进行多轮交互,本地推理能大幅压缩网络往返带来的延迟开销,也让数据不出本机、隐私更有保障。
从 Qwen 到各种量化特化版,小模型正沿着「专精化」的路越走越远。当 7.89GB 就能撑起一个像样的工具调用智能体,「越大越好」的神话,正在被一次次改写。
本文地址:https://www.163264.com/16648