أطلق فريق تينسنت هونيوان نسخة كمية من الطراز الرئيسي Hy3 (295B معلمات). النسخة ذات البت الواحد
(IQ1_M) تضغط الوزن من 598 جيجابايت إلى 85.5 جيجابايت، أي تقليل بمقدار 6.7 ضعف، مما يسمح بالنشر باستخدام بطاقة رسومات استدلالية واحدة بسعة 96 جيجابايت؛ النسخة ذات 4 بت (Q4_K_M) لها حجم 169.9 جيجابايت، وتدعم بطاقتي رسوميات. النسخة الكمية تعمل تقريبا بالكامل على مهام مثل الوكلاء، والشيفرة متعددة اللغات، واستدعاءات الأدوات، وفهم النصوص الطويل. كما يقدم الفريق نسخة GPTQ Int4، تدعم نشر نماذج vLLM. مع فك الترميز الافتراضي بتقنية MTP، تكتسب نسخة 1-بت سرعة فك التشفير بحوالي 50٪، بينما تتحسن نسخة 4-بت بنسبة تقارب 60٪. جميع الإصدارات مفتوحة المصدر ومغلفة بصيغة GGUF، مكيفة لنظام llama.cpp البيئي.
腾讯混元团队为旗舰模型 Hy3(295B 参数)推出量化版本。
1bit 版本(IQ1_M)将权重从 598 GB 压缩至 85.5 GiB,缩小 6.7 倍,单张 96GB 推理显卡即可部署;
4bit 版本(Q4_K_M)体积 169.9 GiB,两张显卡可承载。
量化版在 Agent、多语言代码、工具调用、长文理解等任务上表现接近满血模型。
团队还提供 GPTQ Int4 版本,支持 vLLM 部署。
配合 MTP 投机解码,1bit 版本解码速度提升约 50%,4bit 版本提升近 60%。
所有版本已开源并打包为 GGUF 格式,适配 llama.cpp 生态。