Tencent Hunyuan टीम ने फ्लैगशिप मॉडल Hy3 (295B पैरामीटर) का मात्रात्मक संस्करण लॉन्च किया। 1-बिट
संस्करण (IQ1_M) वजन को 598 जीबी से 85.5 गीब तक संपीड़ित करता है, जो 6.7 गुना की कमी है, जो एकल 96 जीबी अनुमान ग्राफिक्स कार्ड के साथ तैनाती की अनुमति देता है; 4-बिट संस्करण (Q4_K_M) का वॉल्यूम 169.9 GiB है, जो दो ग्राफिक्स कार्ड का समर्थन करता है। क्वांट संस्करण एजेंटों, बहुभाषी कोड, टूल कॉल और लंबी-फॉर्म टेक्स्ट समझ जैसे कार्यों पर लगभग पूरी तरह से प्रदर्शन करता है। टीम एक GPTQ Int4 संस्करण भी प्रदान करती है, जो vLLM परिनियोजन का समर्थन करती है। एमटीपी सट्टा डिकोडिंग के साथ, 1-बिट संस्करण डिकोडिंग गति को लगभग 50% तक प्राप्त करता है, जबकि 4-बिट संस्करण में लगभग 60% का सुधार होता है। सभी संस्करण ओपन-सोर्स हैं और GGUF प्रारूप में पैक किए गए हैं, जिन्हें llama.cpp पारिस्थितिकी तंत्र के लिए अनुकूलित किया गया है।
腾讯混元团队为旗舰模型 Hy3(295B 参数)推出量化版本。
1bit 版本(IQ1_M)将权重从 598 GB 压缩至 85.5 GiB,缩小 6.7 倍,单张 96GB 推理显卡即可部署;
4bit 版本(Q4_K_M)体积 169.9 GiB,两张显卡可承载。
量化版在 Agent、多语言代码、工具调用、长文理解等任务上表现接近满血模型。
团队还提供 GPTQ Int4 版本,支持 vLLM 部署。
配合 MTP 投机解码,1bit 版本解码速度提升约 50%,4bit 版本提升近 60%。
所有版本已开源并打包为 GGUF 格式,适配 llama.cpp 生态。