El equipo de Tencent Hunyuan lanzó una versión cuantitativa del modelo insignia Hy3 (parámetros de
295B). La versión de 1 bit (IQ1_M) comprime el peso de 598 GB a 85,5 GiB, una reducción de 6,7 veces, permitiendo su despliegue con una única tarjeta gráfica de inferencia de 96 GB; La versión de 4 bits (Q4_K_M) tiene un volumen de 169,9 GiB, compatible con dos tarjetas gráficas. La versión cuantitativa realiza casi por completo tareas como agentes, código multilingüe, llamadas a herramientas y comprensión de texto de formato largo. El equipo también ofrece una versión GPTQ Int4, que soporta el despliegue de vLLM. Con la decodificación especulativa MTP, la versión de 1 bit gana velocidad de decodificación en aproximadamente un 50%, mientras que la versión de 4 bits mejora casi un 60%. Todas las versiones son de código abierto y se empaquetan en formato GGUF, adaptadas al ecosistema llama.cpp.
腾讯混元团队为旗舰模型 Hy3(295B 参数)推出量化版本。
1bit 版本(IQ1_M)将权重从 598 GB 压缩至 85.5 GiB,缩小 6.7 倍,单张 96GB 推理显卡即可部署;
4bit 版本(Q4_K_M)体积 169.9 GiB,两张显卡可承载。
量化版在 Agent、多语言代码、工具调用、长文理解等任务上表现接近满血模型。
团队还提供 GPTQ Int4 版本,支持 vLLM 部署。
配合 MTP 投机解码,1bit 版本解码速度提升约 50%,4bit 版本提升近 60%。
所有版本已开源并打包为 GGUF 格式,适配 llama.cpp 生态。
La fuente proporciona título, resumen, atribución y enlace original. Aioga no republica el artículo completo.