Qwen3.8-27B GSQ-RCO 无损量化版——GPTQ 原班人马出手,53.8GB 压到 11.8GB 一分不丢

玩本地大模型的朋友都知道那个痛:开源模型榜单上一个比一个能打,一看体积劝退——27B 稠密模型,BF16 全精度要 53.8GB,桌面显卡里除了一卡通吃的旗舰,谁家显存装得下?量化倒是能压,可一路压到 2~3 bit,模型就开始「降智」:数学题算错、代码写崩,压是压下去了,脑子也压没了。

今天五哥要给大家介绍的 Qwen3.8-27B GSQ-RCO 量化版,就是冲着这个来的——量化界祖师爷级团队、GPTQ 的缔造者 IST-DASLab(奥地利科学技术研究所),给千问 27B 做了一套「学习式量化」:53.8GB 压到 11.8GB,体积砍到 1/4.6,AIME25 和 LiveCodeBench 两项硬核基准与全精度完全一致, GPQA-Diamond 也只差 0.51 分。更舒服的是,它不是什么魔改格式——标准 GGUF,llama.cpp、Ollama、LM Studio 拿来就能跑,16GB 显存的消费级卡就能全量吃下。

📌 这套量化是什么来头?

先交代背景。Qwen3.8-27B 是阿里 8 月开源的 27B 稠密多模态模型:64 层混合架构(48 层 Gated DeltaNet 线性注意力 + 16 层全注意力),原生 262K 上下文(YaRN 可扩到 1M),支持看图看视频,还内置 MTP 多 token 预测。SWE-bench Pro 拿了 61.7 分,是开源阵营里最能打的尺寸之一。问题就一个字:大。

而 GSQ-RCO 出自 IST-DASLab 之手——就是 2022 年那个提出 GPTQ、几乎定义了「大模型量化」这件事的团队。这次他们没有继续沿用老思路,而是搞了两套带论文的新方法(GSQ:arXiv 2604.18556,RCO:arXiv 2605.00649),给 Qwen3.8-27B 产出了四档 GGUF。划四个重点:

  • 🧬 GSQ(Gumbel-Softmax 量化)——不再用固定刻度「四舍五入」,而是让每个权重的量化网格本身学出来,在 2~3 bit 的极限区间把标量量化的精度逼向向量量化水平,同时保持标准格式可部署;
  • ⚖️ RCO(黎曼约束优化)——解决「比特该给谁」的问题:把整个文件的体积预算当成约束,用梯度下降直接对着任务损失优化,逐张量分配 2/3/4 bit,重要的层多给精度,不重要的少给;
  • 🎯 任务无损——推荐档 IQ3_S 在 AIME25(100.00)和 LiveCodeBench v6(85.71)上与 BF16 基座分毫不差,任务平均恢复率 99.8%;
  • 📦 零门槛部署——全是标准 GGUF,不改一行代码、不用魔改版 llama.cpp,还附带 0.9GB 的 BF16 视觉投影器,量化版照样能看图。

✨ 量化成绩单:四档随便挑

直接上官方评测表(基座为 53.8GB 的 BF16 全精度版):

版本 平均位宽 体积 AIME25 GPQA-D LiveCodeBench v6 定位
BF16 基线 16.0 53.8 GB 100.00 89.90 85.71 参考基准
IQ3_S 3.50 11.8 GB 100.00 89.39 85.71 推荐,任务无损
IQ3_XXS 3.00 10.1 GB 100.00 88.89 84.57 均衡工作点
IQ2_S 2.75 9.3 GB 100.00 86.36 82.29 小显存之选
IQ2_XS 2.50 8.4 GB 96.67 84.85 76.57 极限压缩

三个看点:

  • 🏆 IQ3_S 是甜点档——11.8GB,数学和代码两项基准精确复现基座,GPQA 只差 0.51 分,困惑度 7.05→7.07 基本就是测量误差水平;
  • 📈 越是低比特优势越大——同为 8.4GB,IQ2_XS 比大家常用的 Unsloth Dynamic 版在 AIME25 上高出 10 分、GPQA 高出 8.59 分,2 bit 档直接从「不可用」变成「能用」;
  • ⛰️ 悬崖位置心里有数——2.75 bit 以下是分水岭,LiveCodeBench 会掉近 6 分,想要无损就别去踩这条线。

🔬 原理一句话:该硬的地方硬,该省的地方省

传统量化(比如 Q4_K_M)是「一刀切」:全模型统一位宽,谁也不多给谁也不少给。GSQ-RCO 的思路完全不同:

  • 🎯 GSQ 负责「每个张量压得好」——通过 Gumbel-Softmax 松弛,把量化的取整网格和缩放系数一起学出来,网格本身是优化出来的而不是拍脑袋定的;
  • ⚖️ RCO 负责「精度分给谁」——把体积预算变成一个可微的黎曼流形约束,对全部 851 个张量做全局搜索:数学推理敏感的层给高精度,冗余的层狠压。

更难得的是可审计性:每个 GGUF 都附带完整的「出生证明」——.rco-allocation.txt 里列着 851 个张量各自分配到的量化类型,量化用的重要性矩阵(imatrix)也一起公开,所有结论都能复现核查。这种把底裤都亮出来的做法,在量化发布里相当少见。

🚀 上手:三条命令跑起来

标准 GGUF 的好处就是工作流完全不变。llama.cpp 路线:

# 下载(推荐 IQ3_S 档)
pip install -U "huggingface_hub[cli]"
hf download ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-GGUF Qwen3.8-27B-GSQ-RCO-IQ3_S.gguf --local-dir .

# 运行
llama-cli -m Qwen3.8-27B-GSQ-RCO-IQ3_S.gguf -p "你好,介绍一下你自己" -ngl 99

嫌麻烦的直接 Ollama 一条命令:

ollama run hf.co/ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-GGUF

LM Studio 用户在搜索框输入仓库名,从文件列表挑一个带 GSQ-RCO- 前缀的下载即可。想用多模态(看图)功能,再补一个 0.9GB 的视觉投影器:

hf download ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-GGUF mmproj-Qwen3.8-27B-BF16.gguf --local-dir .

llama-mtmd-cli -m Qwen3.8-27B-GSQ-RCO-IQ3_S.gguf \
  --mmproj mmproj-Qwen3.8-27B-BF16.gguf \
  --image photo.jpg -p "Describe this image."

另外每档还有可选的 -mtp 版本(多 0.35GB),内置 MTP 投机解码头,llama.cpp 里能白嫖 20~30% 的生成提速,同精度不要钱加速,冲就完了。

🖥️ 显存怎么选?一张表说清

你的显存 推荐档位 体验
24GB(3090/4090) IQ3_S(11.8GB) 全上卡还有大把余量给 KV cache,长上下文随便拉
16GB(4060Ti/5060Ti/4080) IQ3_S 或 IQ3_XXS 正好全塞进卡,社区实测 5060 Ti 平均 ~40 tok/s,112K 上下文预填充 552 tok/s
12GB IQ2_S(9.3GB) 权重全上卡,上下文控制在 8K 以内够用
8GB / 大内存 Mac IQ2_XS(8.4GB) 极限档,或部分层 offload 到内存

作为参照:RTX 5090 跑 IQ3_S 长上下文约 136 tok/s;16GB 的 5060 Ti 平均 40 tok/s,把 112K 上下文填满后落到 17~30 tok/s——日常对话和代码补全完全够用。

🆚 和你正在用的量化比一比

对比项 Q4_K_M(传统) Unsloth Dynamic GSQ-RCO IQ3_S
体积 ~15 GB ~12 GB 11.8 GB
16GB 卡剩余空间 几乎没有,长上下文容易 OOM 少量 3~4GB,100K 上下文无压力
任务精度 接近无损但体积大 2 bit 档明显降智 99.8% 恢复率,AIME/代码精确持平
部署门槛 无 无 无(标准 GGUF)
可审计性 无 部分 851 张量分配清单全公开

一句话:如果你现在跑的是 3.5 bit 以上的量化,GSQ-RCO 的提升有限;但如果你因为显存被迫用 2~3 bit 档,这套量化就是质变。

🤔 还有什么要注意的?

  • ⚠️ 「无损」是任务级不是逐位级——官方说法是 task-lossless:AIME、代码这些硬基准持平,但困惑度和 GPQA 仍有细微差异,别理解成 bit-exact;
  • 💻 吃显存带宽——纯 CPU 也能跑,但解码速度受内存带宽限制,体验会大打折扣,有独显尽量全量 offload;
  • 🧰 引擎版本要新——Qwen3.8 用了 DeltaNet 混合架构,老版本 llama.cpp 可能不认识,报架构错误先升级到最新版;
  • 📉 2.75 bit 以下有悬崖——IQ2_XS 省是省,代码能力掉得比较明显,能上 IQ2_S 就别选它;
  • 🪪 协议Apache 2.0——继承自基座模型,个人玩、商用都没问题。

🎯 总结

GSQ-RCO 干的事,是把「本地跑 27B」的门槛从 24GB 显存拉到了 16GB,还顺手证明了聪明的分配比粗暴的压缩更值钱。如果你符合下面任意一条,都值得下一个试试:

  • 💻 显存 12~16GB,一直眼馋 27B 又跑不了全精度的本地玩家;
  • 🧮 要在本地跑数学、代码推理,被 2 bit 量化的「降智」坑过的;
  • 🦙 Ollama / LM Studio 用户,想一条命令白嫖开源最强档位 27B 的;
  • 🔬 对量化技术本身感兴趣,想看看 GPTQ 原班人马新招数的极客。

🔗 魔搭(国内快):modelscope.cn/models/ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-GGUF
🔗 Hugging Face:huggingface.co/ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-GGUF
🔗 GSQ 论文:arXiv:2604.18556 RCO 论文:arXiv:2605.00649

量化这件事,大家卷了四年「压得多狠」,GPTQ 的老家伙们换个思路卷「压得多聪明」——53.8GB 压到 11.8GB 还能一分不丢,省下的不只是显存,还有本地大模型最后的借口。

— 墨涩

上一篇 ArtCraft——免费开源的 AI 创作「IDE」,2D 搭图层、3D 摆机位,62 个模型一个工作台
下一篇 PhotoCraft——纯 Rust 重写的开源 PS,开源十天狂揽 3.9 万 Star,PSD 文件 135 个能原样打开 134 个