L’équipe Tencent Hunyuan a lancé une version quantitative du modèle phare Hy3 (paramètres 295B). La
version 1 bit (IQ1_M) comprime le poids de 598 Go à 85,5 Gio, soit une réduction de 6,7 fois, permettant le déploiement avec une seule carte graphique d’inférence de 96 Go ; La version 4 bits (Q4_K_M) a un volume de 169,9 Gio, prenant en charge deux cartes graphiques. La version quant réalise presque entièrement des tâches telles que les agents, le code multilingue, les appels d’outils et la compréhension de texte long. L’équipe propose également une version GPTQ Int4, supportant le déploiement vLLM. Avec le décodage spéculatif MTP, la version 1 bit gagne en vitesse de décodage d’environ 50 %, tandis que la version 4 bits s’améliore de près de 60 %. Toutes les versions sont open source et emballées au format GGUF, adaptées à l’écosystème llama.cpp.
腾讯混元团队为旗舰模型 Hy3(295B 参数)推出量化版本。
1bit 版本(IQ1_M)将权重从 598 GB 压缩至 85.5 GiB,缩小 6.7 倍,单张 96GB 推理显卡即可部署;
4bit 版本(Q4_K_M)体积 169.9 GiB,两张显卡可承载。
量化版在 Agent、多语言代码、工具调用、长文理解等任务上表现接近满血模型。
团队还提供 GPTQ Int4 版本,支持 vLLM 部署。
配合 MTP 投机解码,1bit 版本解码速度提升约 50%,4bit 版本提升近 60%。
所有版本已开源并打包为 GGUF 格式,适配 llama.cpp 生态。
La source fournit un titre, un résumé, une attribution et un lien original. Aioga ne republie pas l’article intégral.