1ビット版(IQ1_M)は重量を598GBから85.5 GiBに圧縮し、6.7倍の削減を実現し、96GBの推論グラフィックスカード1枚で展開可能となりました。 4ビット版(Q4_K_M)は169.9 GiBの容量を持ち、2枚のグラフィックスカードをサポートしています。 定量版はエージェント、多言語コード、ツール呼び出し、長文テキスト理解などのタスクにほぼ完全に対応します。 また、チームはvLLM展開をサポートするGPTQ Int4バージョンも提供しています。 MTPの投機的復号では、1ビット版は約50%の復号速度が向上し、4ビット版は約60%向上します。 すべてのバージョンはオープンソースで、GGUF形式でパッケージ化され、llama.cppエコシステムに合わせて適応されています。
腾讯混元团队为旗舰模型 Hy3(295B 参数)推出量化版本。
1bit 版本(IQ1_M)将权重从 598 GB 压缩至 85.5 GiB,缩小 6.7 倍,单张 96GB 推理显卡即可部署;
4bit 版本(Q4_K_M)体积 169.9 GiB,两张显卡可承载。
量化版在 Agent、多语言代码、工具调用、长文理解等任务上表现接近满血模型。
团队还提供 GPTQ Int4 版本,支持 vLLM 部署。
配合 MTP 投机解码,1bit 版本解码速度提升约 50%,4bit 版本提升近 60%。
所有版本已开源并打包为 GGUF 格式,适配 llama.cpp 生态。