텐센트 훈위안 팀은 플래그십 모델 Hy3(295B 파라미터)의 정량 버전을 출시했습니다. 1비트 버전(IQ1_M)은 무게를 598GB에서 85.5GiB로 압축하여 6.7배 줄여
단일 96GB 추론 그래픽 카드로 배포할 수 있게 합니다; 4비트 버전(Q4_K_M)은 169.9 GiB의 용량을 가지며, 두 개의 그래픽 카드를 지원합니다. 정량 버전은 에이전트, 다국어 코드, 도구 호출, 장기 텍스트 이해와 같은 작업을 거의 전적으로 수행합니다. 또한 vLLM 배포를 지원하는 GPTQ Int4 버전도 제공합니다. MTP 투기적 디코딩을 통해 1비트 버전은 약 50% 증가하는 반면, 4비트 버전은 거의 60% 향상됩니다. 모든 버전은 오픈 소스이며 GGUF 형식으로 포장되어 llama.cpp 생태계에 맞게 조정되었습니다.
腾讯混元团队为旗舰模型 Hy3(295B 参数)推出量化版本。
1bit 版本(IQ1_M)将权重从 598 GB 压缩至 85.5 GiB,缩小 6.7 倍,单张 96GB 推理显卡即可部署;
4bit 版本(Q4_K_M)体积 169.9 GiB,两张显卡可承载。
量化版在 Agent、多语言代码、工具调用、长文理解等任务上表现接近满血模型。
团队还提供 GPTQ Int4 版本,支持 vLLM 部署。
配合 MTP 投机解码,1bit 版本解码速度提升约 50%,4bit 版本提升近 60%。
所有版本已开源并打包为 GGUF 格式,适配 llama.cpp 生态。
수집 피드는 제목, 요약, 출처와 원문 링크를 제공합니다. Aioga는 원문 전체를 재게시하지 않습니다.