Команда Tencent Hunyuan выпустила количественную версию флагманской модели Hy3 (параметры 295B).
1-битная версия (IQ1_M) сжимает вес с 598 ГБ до 85,5 ГиБ, что составляет 6,7-кратное сокращение, что позволяет развертывать с помощью одной видеокарты inference на 96 ГБ; 4-битная версия (Q4_K_M) имеет объём 169,9 ГиБ и поддерживает две видеокарты. Квантовая версия почти полностью выполняет задачи, такие как агенты, многоязычный код, вызовы инструментов и понимание длинного текста. Команда также предлагает версию GPTQ Int4, поддерживающую развертывание vLLM. С помощью MTP-спекулятивного декодирования 1-битная версия увеличивает скорость декодирования примерно на 50%, а 4-битная версия улучшается почти на 60%. Все версии имеют открытый исходный код и упакованы в формате GGUF, адаптированных для экосистемы llama.cpp.
腾讯混元团队为旗舰模型 Hy3(295B 参数)推出量化版本。
1bit 版本(IQ1_M)将权重从 598 GB 压缩至 85.5 GiB,缩小 6.7 倍,单张 96GB 推理显卡即可部署;
4bit 版本(Q4_K_M)体积 169.9 GiB,两张显卡可承载。
量化版在 Agent、多语言代码、工具调用、长文理解等任务上表现接近满血模型。
团队还提供 GPTQ Int4 版本,支持 vLLM 部署。
配合 MTP 投机解码,1bit 版本解码速度提升约 50%,4bit 版本提升近 60%。
所有版本已开源并打包为 GGUF 格式,适配 llama.cpp 生态。