Tencent Hunyuan ekibi, amiral gemisi model Hy3'ün (295B parametre) nicel bir versiyonunu piyasaya
sürdü. 1-bit versiyonu (IQ1_M) ağırlığı 598 GB'dan 85.5 GiB'e sıkıştırır; bu 6.7 kat azalma anlamına gelir ve tek bir 96GB çıkarım grafik kartı ile dağıtım imkanı sağlar; 4-bit versiyonu (Q4_K_M) 169,9 GiB hacme sahiptir ve iki grafik kartını destekler. Quant versiyonu ise ajanlar, çok dilli kod, araç çağrıları ve uzun biçimli metin anlama gibi görevleri neredeyse tamamen yerine getirir. Ekip ayrıca vLLM dağıtımını destekleyen bir GPTQ Int4 versiyonu da sunuyor. MTP spekülatif kod çözme ile 1-bit versiyon yaklaşık %50 oranında dekod hızı kazanırken, 4-bit versiyon neredeyse %60 gelişir. Tüm sürümler açık kaynaklıdır ve llama.cpp ekosistemine uyarlanmış GGUF formatında paketlenmiştir.
腾讯混元团队为旗舰模型 Hy3(295B 参数)推出量化版本。
1bit 版本(IQ1_M)将权重从 598 GB 压缩至 85.5 GiB,缩小 6.7 倍,单张 96GB 推理显卡即可部署;
4bit 版本(Q4_K_M)体积 169.9 GiB,两张显卡可承载。
量化版在 Agent、多语言代码、工具调用、长文理解等任务上表现接近满血模型。
团队还提供 GPTQ Int4 版本,支持 vLLM 部署。
配合 MTP 投机解码,1bit 版本解码速度提升约 50%,4bit 版本提升近 60%。
所有版本已开源并打包为 GGUF 格式,适配 llama.cpp 生态。