Das Tencent Hunyuan-Team brachte eine quantitative Version des Flaggschiffmodells Hy3 (295
Milliarden Parameter) auf den Markt. Die 1-Bit-Version (IQ1_M) reduziert das Gewicht von 598 GB auf 85,5 GiB, was eine 6,7-fache Reduzierung darstellt und die Bereitstellung mit einer einzigen 96-GB-Inferenzgrafikkarte ermöglicht; Die 4-Bit-Version (Q4_K_M) hat ein Volumen von 169,9 GiB und unterstützt zwei Grafikkarten. Die Quant-Version erledigt nahezu vollständig Aufgaben wie Agenten, mehrsprachigen Code, Toolaufrufe und das Verständnis von Langformtexten. Das Team bietet außerdem eine GPTQ Int4-Version an, die die vLLM-Bereitstellung unterstützt. Mit der spekulativen MTP-Dekodierung steigert die 1-Bit-Version die Dekodiergeschwindigkeit um etwa 50 %, während die 4-Bit-Version sich um fast 60 % verbessert. Alle Versionen sind Open Source und im GGUF-Format verpackt, angepasst an das llama.cpp-Ökosystem.
腾讯混元团队为旗舰模型 Hy3(295B 参数)推出量化版本。
1bit 版本(IQ1_M)将权重从 598 GB 压缩至 85.5 GiB,缩小 6.7 倍,单张 96GB 推理显卡即可部署;
4bit 版本(Q4_K_M)体积 169.9 GiB,两张显卡可承载。
量化版在 Agent、多语言代码、工具调用、长文理解等任务上表现接近满血模型。
团队还提供 GPTQ Int4 版本,支持 vLLM 部署。
配合 MTP 投机解码,1bit 版本解码速度提升约 50%,4bit 版本提升近 60%。
所有版本已开源并打包为 GGUF 格式,适配 llama.cpp 生态。