腾讯混元 Hy4 preview 轻量版开源:1.5TB 压到 214GB,4090 笔记本跑起来了

旗舰大模型本地部署,硬件门槛又降了一截。

9月1日,腾讯混元团队发布 Hy4 preview 轻量版,将模型权重从接近 1.5TB 压缩至约 214GB,体积压至原来的七分之一左右。

两项核心技术,不是「一刀切」量化

这次压缩用了两项自研技术。

第一项叫 Sherry 稀疏三值量化算法,作用于路由专家层。具体做法是每四个权重为一组,量化成 {-1, 0, +1} 三种取值,并强制每组里恰好一个为 0。这样每组有 32 种组合,用 5bit 索引编码就能表示,摊到每个权重平均 1.25bit,计入缩放系数等额外开销,实际落在文件里约 1.31bpw。

第二项叫 MIX-STQ1_0 混合精度策略。核心思路是「不是所有层都一样重要」——敏感层保留较高精度,用 2.06bit 的 IQ2_XXS;不敏感层用更激进的 1.31bit STQ1_0。按层分配精度预算,在同等比特数下实现更低的整体量化误差。

两项技术结合,整模约 2.38bpw,既不是无差别压到最低位宽,也不是保持全部高精度。

能力掉得多吗?不多

腾讯混元公布的结果:长文理解与原始 BF16 模型几乎持平;多轮长上下文检索基本在同一水平;数学能力小幅回落,MCP Atlas 从 83.7 微降至 83.2,SWE-Bench multi 从 82.9 降至 81.3。整体领先 UD-IQ1_M 量化版本。

日常任务里,编码辅助、工具调用、长文档处理、常规问答都能覆盖。不追求极限数学推理、但更在意长上下文和部署成本的开发者,这个版本是更好的选择。

异构设备拼机跑:4090 + A4000 一起推理

更值得关注的是腾讯混元验证的一种新玩法。

他们和 prima.cpp 合作,用一台搭载单张 RTX 4090 的笔记本,加一台四卡 A4000 服务器(合计 80GB 显存、64GB 内存,两台机器分属不同局域网),通过 prima.cpp 的异构调度把 MoE 层拆开分配,让计算和权重读取彼此重叠。

结果是:214GB 的轻量版模型跑到 1.02 token/s,比笔记本单机 offload 快了约 6 倍。

几台散装机器拼在一起跑旗舰模型,这条路被验证了。

已经开源,可以下了

量化 GGUF 版本已上线 Hugging Face,支持 llama.cpp、vLLM、SGLang 等主流推理框架。代码仓库同步开源在 GitHub。

对个人开发者和中小企业来说,770B 参数的旗舰模型之前只能云端调用,现在第一次有了在现有硬件上本地跑的可能性。当然 214GB 也不算小,但已经从「需要专业服务器」变成了「有高端游戏显卡加几台家用设备可以拼」。

这不是把大模型「假装变小」,是把精度预算花在该花的层上,然后让手边现有的异构设备协作起来。