Nhóm Tencent Hunyuan đã tung ra phiên bản định lượng của mẫu hàng đầu Hy3 (thông số 295B). Phiên bản
1-bit (IQ1_M) nén trọng lượng từ 598 GB xuống 85,5 GiB, giảm 6,7 lần, cho phép triển khai với một card đồ họa suy luận 96GB duy nhất; Phiên bản 4-bit (Q4_K_M) có dung lượng 169,9 GiB, hỗ trợ hai card đồ họa. Phiên bản định lượng thực hiện gần như đầy đủ các tác vụ như tác nhân, mã đa ngôn ngữ, gọi công cụ và hiểu văn bản dạng dài. Nhóm cũng cung cấp phiên bản GPTQ Int4, hỗ trợ triển khai vLLM. Với giải mã suy đoán MTP, phiên bản 1-bit tăng tốc độ giải mã khoảng 50%, trong khi phiên bản 4-bit cải thiện gần 60%. Tất cả các phiên bản đều được mã nguồn mở và đóng gói ở định dạng GGUF, được điều chỉnh cho phù hợp với hệ sinh thái llama.cpp.
腾讯混元团队为旗舰模型 Hy3(295B 参数)推出量化版本。
1bit 版本(IQ1_M)将权重从 598 GB 压缩至 85.5 GiB,缩小 6.7 倍,单张 96GB 推理显卡即可部署;
4bit 版本(Q4_K_M)体积 169.9 GiB,两张显卡可承载。
量化版在 Agent、多语言代码、工具调用、长文理解等任务上表现接近满血模型。
团队还提供 GPTQ Int4 版本,支持 vLLM 部署。
配合 MTP 投机解码,1bit 版本解码速度提升约 50%,4bit 版本提升近 60%。
所有版本已开源并打包为 GGUF 格式,适配 llama.cpp 生态。