{"@context":"https://schema.org","@type":"NewsArticle","generatedAt":"2026-07-23T07:21:26.498Z","headline":"腾讯混元 Hy3 量化版发布：1bit 版本单卡可部署，4bit 版本接近满血性能","description":"腾讯混元团队为旗舰模型 Hy3（295B 参数）推出量化版本。1bit 版本（IQ1_M）将权重从 598 GB 压缩至 85.5 GiB，缩小 6.7 倍，单张 96GB 推理显卡即可部署；4bit 版本（Q4_K_M）体积 169.9 GiB，两张显卡可承载。量化版在 Agent、多语言代码、工具调用、长文理解等任务上表现接近满血模型。团队还提供 GPTQ Int4 版本，支持 vLLM 部署。配合 MTP 投机解码，1bit 版本解码速度提升约 50%，4bit 版本提升近 60%。所有版本已开源并打包为 GGUF 格式，适配 llama.cpp 生态。","url":"https://www.aioga.com/news/cmrkf8gun01a4bizsthjytx6c/","mainEntityOfPage":"https://www.aioga.com/news/cmrkf8gun01a4bizsthjytx6c/","datePublished":"2026-07-14T08:56:07.000Z","dateModified":"2026-07-14T08:56:07.000Z","inLanguage":"zh-CN","publisher":{"@type":"NewsMediaOrganization","name":"Aioga","url":"https://www.aioga.com"},"citation":["https://mp.weixin.qq.com/s/Kq30ftirASryPrUtjK2xSw","https://aihot.virxact.com/items/cmrkf8gun01a4bizsthjytx6c"],"canonicalUrl":"https://www.aioga.com/news/cmrkf8gun01a4bizsthjytx6c/","directAnswer":{"@type":"Answer","text":"腾讯混元为295B参数的Hy3发布1bit、4bit及GPTQ Int4量化版本。1bit权重压缩至85.5 GiB，可在单张96GB推理显卡部署；4bit体积为169.9 GiB，可由两张显卡承载。","url":"https://www.aioga.com/news/cmrkf8gun01a4bizsthjytx6c/","dateCreated":"2026-07-14T08:56:07.000Z","author":{"@type":"Organization","@id":"https://www.aioga.com/authors/aioga-editorial/#editorial-team","name":"Aioga Editorial Team","url":"https://www.aioga.com/authors/aioga-editorial/"}},"evidence":[{"@type":"CreativeWork","name":"公众号：腾讯混元 source article","url":"https://mp.weixin.qq.com/s/Kq30ftirASryPrUtjK2xSw","datePublished":"2026-07-14T08:56:07.000Z","provider":{"@type":"Organization","name":"公众号：腾讯混元","url":"https://mp.weixin.qq.com/s/Kq30ftirASryPrUtjK2xSw"}},{"@type":"CreativeWork","name":"AIHot archive record","url":"https://aihot.virxact.com/items/cmrkf8gun01a4bizsthjytx6c","datePublished":"2026-07-14T08:56:07.000Z","provider":{"@type":"Organization","name":"AIHot","url":"https://aihot.virxact.com/items/cmrkf8gun01a4bizsthjytx6c"}}],"aggregationSource":"公众号：腾讯混元","originalPublisher":{"name":"公众号：腾讯混元","url":"https://mp.weixin.qq.com/s/Kq30ftirASryPrUtjK2xSw"},"article":{"id":"cmrkf8gun01a4bizsthjytx6c","slug":"cmrkf8gun01a4bizsthjytx6c","url":"https://www.aioga.com/news/cmrkf8gun01a4bizsthjytx6c/","title":"腾讯混元 Hy3 量化版发布：1bit 版本单卡可部署，4bit 版本接近满血性能","title_en":"极致量化，近三千亿参数 Hy3 单卡即可部署","summary":"腾讯混元团队为旗舰模型 Hy3（295B 参数）推出量化版本。1bit 版本（IQ1_M）将权重从 598 GB 压缩至 85.5 GiB，缩小 6.7 倍，单张 96GB 推理显卡即可部署；4bit 版本（Q4_K_M）体积 169.9 GiB，两张显卡可承载。量化版在 Agent、多语言代码、工具调用、长文理解等任务上表现接近满血模型。团队还提供 GPTQ Int4 版本，支持 vLLM 部署。配合 MTP 投机解码，1bit 版本解码速度提升约 50%，4bit 版本提升近 60%。所有版本已开源并打包为 GGUF 格式，适配 llama.cpp 生态。","source":"公众号：腾讯混元","sourceUrl":"https://mp.weixin.qq.com/s/Kq30ftirASryPrUtjK2xSw","aiHotUrl":"https://aihot.virxact.com/items/cmrkf8gun01a4bizsthjytx6c","publishedAt":"2026-07-14T08:56:07.000Z","category":"模型更新","score":73,"selected":true,"articleBody":["腾讯混元团队为旗舰模型 Hy3（295B 参数）推出量化版本。","1bit 版本（IQ1_M）将权重从 598 GB 压缩至 85.5 GiB，缩小 6.7 倍，单张 96GB 推理显卡即可部署；","4bit 版本（Q4_K_M）体积 169.9 GiB，两张显卡可承载。","量化版在 Agent、多语言代码、工具调用、长文理解等任务上表现接近满血模型。","团队还提供 GPTQ Int4 版本，支持 vLLM 部署。","配合 MTP 投机解码，1bit 版本解码速度提升约 50%，4bit 版本提升近 60%。","所有版本已开源并打包为 GGUF 格式，适配 llama.cpp 生态。"],"articleImages":[],"mediaStatus":"none","articleBodyZh":[],"translationStatus":"","bodyOrigin":"summary-fallback","editorial":{"summary":"腾讯混元为295B参数的Hy3发布1bit、4bit及GPTQ Int4量化版本。1bit权重压缩至85.5 GiB，可在单张96GB推理显卡部署；4bit体积为169.9 GiB，可由两张显卡承载。","background":"此次量化以Hy3原始598 GB权重为基础，1bit版本缩小6.7倍。各版本已开源，其中GGUF格式适配llama.cpp生态，GPTQ Int4版本支持通过vLLM部署。","viewpoint":"Aioga判断，此次更新的重点不只是压缩模型体积，还包括对不同推理生态的适配。单卡承载1bit版本，可能扩大开发者在有限显存条件下测试和部署Hy3的空间。","implications":"值得关注的是，材料称量化版在Agent、多语言代码、工具调用和长文理解任务上接近满血模型；配合MTP投机解码，1bit与4bit版本解码速度分别提升约50%和近60%。","nextStep":"后续值得关注不同硬件与实际业务负载下的性能表现，包括量化版本与满血模型的任务差异、显存占用、解码速度，以及GGUF和GPTQ Int4两条部署路径的适用范围。","evidenceRefs":["title","summary","articleBody","source"],"status":"published","aiGenerated":true,"autoApproved":true,"generatedBy":"aioga-editorial:gpt-5.6-sol","reviewedBy":"aioga-editorial-review:gpt-5.6-sol","generatedAt":"2026-07-22T22:51:16.536Z","sourceHash":"680abc7f213abb28","review":{"approved":true,"groundedness":96,"clarity":92,"duplicationRisk":22,"blockingIssues":[],"notes":["“Aioga判断”及“可能扩大……”已明确标示为观点和推测，没有冒充来源事实。","“各版本已开源，其中GGUF格式适配llama.cpp生态”基本符合来源；若需更严谨，可改为“所有版本已开源并提供GGUF格式，GPTQ Int4版本支持vLLM部署”。","候选内容未提及4bit版本接近满血性能的标题表述，但在implications中概括了量化版相关任务表现，不影响事实完整性。"]},"validation":{"passed":true,"mode":"ai-auto","revisions":0,"checks":["schema","length","source-attribution","low-source-overlap","no-html","independent-ai-review"]}},"tags":["模型更新","公众号：腾讯混元"],"translations":{"zh-CN":{"title":"腾讯混元 Hy3 量化版发布：1bit 版本单卡可部署，4bit 版本接近满血性能","summary":"腾讯混元团队为旗舰模型 Hy3（295B 参数）推出量化版本。1bit 版本（IQ1_M）将权重从 598 GB 压缩至 85.5 GiB，缩小 6.7 倍，单张 96GB 推理显卡即可部署；4bit 版本（Q4_K_M）体积 169.9 GiB，两张显卡可承载。量化版在 Agent、多语言代码、工具调用、长文理解等任务上表现接近满血模型。团队还提供 GPTQ Int4 版本，支持 vLLM 部署。配合 MTP 投机解码，1bit 版本解码速度提升约 50%，4bit 版本提升近 60%。所有版本已开源并打包为 GGUF 格式，适配 llama.cpp 生态。","category":"模型更新","source":"公众号：腾讯混元","pageTitle":"腾讯混元 Hy3 量化版发布：1bit 版本单卡可部署，4bit 版本接近满血性能 - Aioga AI资讯","description":"腾讯混元团队为旗舰模型 Hy3（295B 参数）推出量化版本。1bit 版本（IQ1_M）将权重从 598 GB 压缩至 85.5 GiB，缩小 6.7 倍，单张 96GB 推理显卡即可部署；4bit 版本（Q4_K_M）体积 169.9 GiB，两张显卡可承载。量化版在 Agent、多语言代码、工具调用、长文理解等任务上表现接近满血模型。团队还提供 GPT","url":"https://www.aioga.com/news/cmrkf8gun01a4bizsthjytx6c/"},"en":{"title":"Tencent Hunyuan Hy3 Quant Edition released: 1-bit version can be deployed as a single card, 4-bit version nears full performance","summary":"The Tencent Hunyuan team launched a quantitative version of the flagship model Hy3 (295B parameters). The 1-bit version (IQ1_M) compresses the weight from 598 GB to 85.5 GiB, a 6.7-fold reduction, allowing deployment with a single 96GB inference graphics card; The 4-bit version (Q4_K_M) has a volume of 169.9 GiB, supporting two graphics cards. The quant version performs almost fully on tasks such as agents, multilingual code, tool calls, and long-form text understanding. The team also offers a GPTQ Int4 version, supporting vLLM deployment. With MTP speculative decoding, the 1-bit version gains decoding speed by about 50%, while the 4-bit version improves by nearly 60%. All versions are open-sourced and packaged in GGUF format, adapted for the llama.cpp ecosystem.","category":"Models","source":"公众号：腾讯混元","pageTitle":"Tencent Hunyuan Hy3 Quant Edition released: 1-bit version can be deployed as a single card, 4-bit version nears full performance - Aioga AI News","description":"The Tencent Hunyuan team launched a quantitative version of the flagship model Hy3 (295B parameters). The 1-bit version (IQ1_M) compresses the weight from 598 GB to 85.5 GiB, a 6.7","url":"https://www.aioga.com/en/news/cmrkf8gun01a4bizsthjytx6c/","contentTranslated":true,"sourceHash":"187b9c5f04a6e558","translatedAt":"2026-07-19T13:34:04.372Z"},"ja":{"title":"騰訊 魂源 Hy3 Quant Edition 発売:1ビット版は1枚のカードとして展開可能、4ビット版はほぼフルパフォーマンス","summary":"騰訊の環源チームは、旗艦モデルHy3(295Bパラメータ)の定量版を発表しました。 1ビット版(IQ1_M)は重量を598GBから85.5 GiBに圧縮し、6.7倍の削減を実現し、96GBの推論グラフィックスカード1枚で展開可能となりました。 4ビット版(Q4_K_M)は169.9 GiBの容量を持ち、2枚のグラフィックスカードをサポートしています。 定量版はエージェント、多言語コード、ツール呼び出し、長文テキスト理解などのタスクにほぼ完全に対応します。 また、チームはvLLM展開をサポートするGPTQ Int4バージョンも提供しています。 MTPの投機的復号では、1ビット版は約50%の復号速度が向上し、4ビット版は約60%向上します。 すべてのバージョンはオープンソースで、GGUF形式でパッケージ化され、llama.cppエコシステムに合わせて適応されています。","category":"モデル更新","source":"公众号：腾讯混元","pageTitle":"騰訊 魂源 Hy3 Quant Edition 発売:1ビット版は1枚のカードとして展開可能、4ビット版はほぼフルパフォーマンス - Aioga AIニュース","description":"騰訊の環源チームは、旗艦モデルHy3(295Bパラメータ)の定量版を発表しました。 1ビット版(IQ1_M)は重量を598GBから85.5 GiBに圧縮し、6.7倍の削減を実現し、96GBの推論グラフィックスカード1枚で展開可能となりました。 4ビット版(Q4_K_M)は169.9 GiBの容量を持ち、2枚のグラフィックスカードをサポートしています。 定量版","url":"https://www.aioga.com/ja/news/cmrkf8gun01a4bizsthjytx6c/","contentTranslated":true,"sourceHash":"187b9c5f04a6e558","translatedAt":"2026-07-19T13:34:04.580Z"},"ko":{"title":"텐센트 훈위안 Hy3 Quant 에디션 출시: 1비트 버전은 단일 카드로 배포 가능, 4비트 버전은 거의 완전한 성능에 가깝습니다","summary":"텐센트 훈위안 팀은 플래그십 모델 Hy3(295B 파라미터)의 정량 버전을 출시했습니다. 1비트 버전(IQ1_M)은 무게를 598GB에서 85.5GiB로 압축하여 6.7배 줄여 단일 96GB 추론 그래픽 카드로 배포할 수 있게 합니다; 4비트 버전(Q4_K_M)은 169.9 GiB의 용량을 가지며, 두 개의 그래픽 카드를 지원합니다. 정량 버전은 에이전트, 다국어 코드, 도구 호출, 장기 텍스트 이해와 같은 작업을 거의 전적으로 수행합니다. 또한 vLLM 배포를 지원하는 GPTQ Int4 버전도 제공합니다. MTP 투기적 디코딩을 통해 1비트 버전은 약 50% 증가하는 반면, 4비트 버전은 거의 60% 향상됩니다. 모든 버전은 오픈 소스이며 GGUF 형식으로 포장되어 llama.cpp 생태계에 맞게 조정되었습니다.","category":"모델 업데이트","source":"公众号：腾讯混元","pageTitle":"텐센트 훈위안 Hy3 Quant 에디션 출시: 1비트 버전은 단일 카드로 배포 가능, 4비트 버전은 거의 완전한 성능에 가깝습니다 - Aioga AI 뉴스","description":"텐센트 훈위안 팀은 플래그십 모델 Hy3(295B 파라미터)의 정량 버전을 출시했습니다. 1비트 버전(IQ1_M)은 무게를 598GB에서 85.5GiB로 압축하여 6.7배 줄여 단일 96GB 추론 그래픽 카드로 배포할 수 있게 합니다; 4비트 버전(Q4_K_M)은 169.9 GiB의 용량을 가지며, 두 개의 그래픽 카드를","url":"https://www.aioga.com/ko/news/cmrkf8gun01a4bizsthjytx6c/","contentTranslated":true,"sourceHash":"187b9c5f04a6e558","translatedAt":"2026-07-19T13:34:04.538Z"},"es":{"title":"Tencent Hunyuan Hy3 Quant Edition lanzada: La versión de 1 bit puede desplegarse como una sola tarjeta, la versión de 4 bits cerca del rendimiento completo","summary":"El equipo de Tencent Hunyuan lanzó una versión cuantitativa del modelo insignia Hy3 (parámetros de 295B). La versión de 1 bit (IQ1_M) comprime el peso de 598 GB a 85,5 GiB, una reducción de 6,7 veces, permitiendo su despliegue con una única tarjeta gráfica de inferencia de 96 GB; La versión de 4 bits (Q4_K_M) tiene un volumen de 169,9 GiB, compatible con dos tarjetas gráficas. La versión cuantitativa realiza casi por completo tareas como agentes, código multilingüe, llamadas a herramientas y comprensión de texto de formato largo. El equipo también ofrece una versión GPTQ Int4, que soporta el despliegue de vLLM. Con la decodificación especulativa MTP, la versión de 1 bit gana velocidad de decodificación en aproximadamente un 50%, mientras que la versión de 4 bits mejora casi un 60%. Todas las versiones son de código abierto y se empaquetan en formato GGUF, adaptadas al ecosistema llama.cpp.","category":"Modelos","source":"公众号：腾讯混元","pageTitle":"Tencent Hunyuan Hy3 Quant Edition lanzada: La versión de 1 bit puede desplegarse como una sola tarjeta, la versión de 4 bits cerca del rendimiento completo - Aioga Noticias de IA","description":"El equipo de Tencent Hunyuan lanzó una versión cuantitativa del modelo insignia Hy3 (parámetros de 295B). La versión de 1 bit (IQ1_M) comprime el peso de 598 GB a 85,5 GiB, una red","url":"https://www.aioga.com/es/news/cmrkf8gun01a4bizsthjytx6c/","contentTranslated":true,"sourceHash":"187b9c5f04a6e558","translatedAt":"2026-07-19T13:34:04.677Z"},"fr":{"title":"Tencent Hunyuan Hy3 Quant Edition sortie : la version 1 bit peut être déployée en carte unique, la version 4 bits atteint presque les performances complètes","summary":"L’équipe Tencent Hunyuan a lancé une version quantitative du modèle phare Hy3 (paramètres 295B). La version 1 bit (IQ1_M) comprime le poids de 598 Go à 85,5 Gio, soit une réduction de 6,7 fois, permettant le déploiement avec une seule carte graphique d’inférence de 96 Go ; La version 4 bits (Q4_K_M) a un volume de 169,9 Gio, prenant en charge deux cartes graphiques. La version quant réalise presque entièrement des tâches telles que les agents, le code multilingue, les appels d’outils et la compréhension de texte long. L’équipe propose également une version GPTQ Int4, supportant le déploiement vLLM. Avec le décodage spéculatif MTP, la version 1 bit gagne en vitesse de décodage d’environ 50 %, tandis que la version 4 bits s’améliore de près de 60 %. Toutes les versions sont open source et emballées au format GGUF, adaptées à l’écosystème llama.cpp.","category":"Modèles","source":"公众号：腾讯混元","pageTitle":"Tencent Hunyuan Hy3 Quant Edition sortie : la version 1 bit peut être déployée en carte unique, la version 4 bits atteint presque les performances complètes - Aioga Actualités IA","description":"L’équipe Tencent Hunyuan a lancé une version quantitative du modèle phare Hy3 (paramètres 295B). La version 1 bit (IQ1_M) comprime le poids de 598 Go à 85,5 Gio, soit une réduction","url":"https://www.aioga.com/fr/news/cmrkf8gun01a4bizsthjytx6c/","contentTranslated":true,"sourceHash":"187b9c5f04a6e558","translatedAt":"2026-07-19T13:34:04.600Z"},"de":{"title":"Tencent Hunyuan Hy3 Quant Edition veröffentlicht: Die 1-Bit-Version kann als Einzelkarte bereitgestellt werden, die 4-Bit-Version erreicht nahe der vollen Leistung","summary":"Das Tencent Hunyuan-Team brachte eine quantitative Version des Flaggschiffmodells Hy3 (295 Milliarden Parameter) auf den Markt. Die 1-Bit-Version (IQ1_M) reduziert das Gewicht von 598 GB auf 85,5 GiB, was eine 6,7-fache Reduzierung darstellt und die Bereitstellung mit einer einzigen 96-GB-Inferenzgrafikkarte ermöglicht; Die 4-Bit-Version (Q4_K_M) hat ein Volumen von 169,9 GiB und unterstützt zwei Grafikkarten. Die Quant-Version erledigt nahezu vollständig Aufgaben wie Agenten, mehrsprachigen Code, Toolaufrufe und das Verständnis von Langformtexten. Das Team bietet außerdem eine GPTQ Int4-Version an, die die vLLM-Bereitstellung unterstützt. Mit der spekulativen MTP-Dekodierung steigert die 1-Bit-Version die Dekodiergeschwindigkeit um etwa 50 %, während die 4-Bit-Version sich um fast 60 % verbessert. Alle Versionen sind Open Source und im GGUF-Format verpackt, angepasst an das llama.cpp-Ökosystem.","category":"模型更新","source":"公众号：腾讯混元","pageTitle":"Tencent Hunyuan Hy3 Quant Edition veröffentlicht: Die 1-Bit-Version kann als Einzelkarte bereitgestellt werden, die 4-Bit-Version erreicht nahe der vollen Leistung - Aioga KI-News","description":"Das Tencent Hunyuan-Team brachte eine quantitative Version des Flaggschiffmodells Hy3 (295 Milliarden Parameter) auf den Markt. Die 1-Bit-Version (IQ1_M) reduziert das Gewicht von ","url":"https://www.aioga.com/de/news/cmrkf8gun01a4bizsthjytx6c/","contentTranslated":true,"sourceHash":"187b9c5f04a6e558","translatedAt":"2026-07-19T13:34:10.277Z"},"pt-BR":{"title":"Tencent Hunyuan Hy3 Quant Edition lançada: A versão de 1 bit pode ser implantada como uma única placa, a versão de 4 bits atinge quase o desempenho total","summary":"A equipe da Tencent Hunyuan lançou uma versão quantitativa do modelo topo de linha Hy3 (parâmetros de 295B). A versão de 1 bit (IQ1_M) comprime o peso de 598 GB para 85,5 GiB, uma redução de 6,7 vezes, permitindo implantação com uma única placa de vídeo de inferência de 96GB; A versão de 4 bits (Q4_K_M) tem um volume de 169,9 GiB, suportando duas placas de vídeo. A versão quant executa quase totalmente tarefas como agentes, código multilíngue, chamadas de ferramentas e compreensão de texto longo. A equipe também oferece uma versão GPTQ Int4, que suporta implantação de vLLM. Com a decodificação especulativa MTP, a versão de 1 bit ganha velocidade de decodificação em cerca de 50%, enquanto a versão de 4 bits melhora quase 60%. Todas as versões são de código aberto e embaladas no formato GGUF, adaptadas para o ecossistema llama.cpp.","category":"模型更新","source":"公众号：腾讯混元","pageTitle":"Tencent Hunyuan Hy3 Quant Edition lançada: A versão de 1 bit pode ser implantada como uma única placa, a versão de 4 bits atinge quase o desempenho total - Aioga Notícias de IA","description":"A equipe da Tencent Hunyuan lançou uma versão quantitativa do modelo topo de linha Hy3 (parâmetros de 295B). A versão de 1 bit (IQ1_M) comprime o peso de 598 GB para 85,5 GiB, uma ","url":"https://www.aioga.com/pt-BR/news/cmrkf8gun01a4bizsthjytx6c/","contentTranslated":true,"sourceHash":"187b9c5f04a6e558","translatedAt":"2026-07-19T13:34:07.000Z"},"ru":{"title":"Выпущена версия Tencent Hunyuan Hy3 Quant Edition: 1-битная версия может быть развернута как одна карта, 4-битная версия близка к полной производительности","summary":"Команда Tencent Hunyuan выпустила количественную версию флагманской модели Hy3 (параметры 295B). 1-битная версия (IQ1_M) сжимает вес с 598 ГБ до 85,5 ГиБ, что составляет 6,7-кратное сокращение, что позволяет развертывать с помощью одной видеокарты inference на 96 ГБ; 4-битная версия (Q4_K_M) имеет объём 169,9 ГиБ и поддерживает две видеокарты. Квантовая версия почти полностью выполняет задачи, такие как агенты, многоязычный код, вызовы инструментов и понимание длинного текста. Команда также предлагает версию GPTQ Int4, поддерживающую развертывание vLLM. С помощью MTP-спекулятивного декодирования 1-битная версия увеличивает скорость декодирования примерно на 50%, а 4-битная версия улучшается почти на 60%. Все версии имеют открытый исходный код и упакованы в формате GGUF, адаптированных для экосистемы llama.cpp.","category":"模型更新","source":"公众号：腾讯混元","pageTitle":"Выпущена версия Tencent Hunyuan Hy3 Quant Edition: 1-битная версия может быть развернута как одна карта, 4-битная версия близка к полной производительности - Aioga Новости ИИ","description":"Команда Tencent Hunyuan выпустила количественную версию флагманской модели Hy3 (параметры 295B). 1-битная версия (IQ1_M) сжимает вес с 598 ГБ до 85,5 ГиБ, что составляет 6,7-кратно","url":"https://www.aioga.com/ru/news/cmrkf8gun01a4bizsthjytx6c/","contentTranslated":true,"sourceHash":"187b9c5f04a6e558","translatedAt":"2026-07-19T13:34:07.272Z"},"ar":{"title":"إصدار تينسنت هونيوان Hy3 Quant Edition: يمكن نشر نسخة 1-بت كبطاقة واحدة، ونسخة 4-بت تقترب من الأداء الكامل","summary":"أطلق فريق تينسنت هونيوان نسخة كمية من الطراز الرئيسي Hy3 (295B معلمات). النسخة ذات البت الواحد (IQ1_M) تضغط الوزن من 598 جيجابايت إلى 85.5 جيجابايت، أي تقليل بمقدار 6.7 ضعف، مما يسمح بالنشر باستخدام بطاقة رسومات استدلالية واحدة بسعة 96 جيجابايت؛ النسخة ذات 4 بت (Q4_K_M) لها حجم 169.9 جيجابايت، وتدعم بطاقتي رسوميات. النسخة الكمية تعمل تقريبا بالكامل على مهام مثل الوكلاء، والشيفرة متعددة اللغات، واستدعاءات الأدوات، وفهم النصوص الطويل. كما يقدم الفريق نسخة GPTQ Int4، تدعم نشر نماذج vLLM. مع فك الترميز الافتراضي بتقنية MTP، تكتسب نسخة 1-بت سرعة فك التشفير بحوالي 50٪، بينما تتحسن نسخة 4-بت بنسبة تقارب 60٪. جميع الإصدارات مفتوحة المصدر ومغلفة بصيغة GGUF، مكيفة لنظام llama.cpp البيئي.","category":"模型更新","source":"公众号：腾讯混元","pageTitle":"إصدار تينسنت هونيوان Hy3 Quant Edition: يمكن نشر نسخة 1-بت كبطاقة واحدة، ونسخة 4-بت تقترب من الأداء الكامل - Aioga أخبار الذكاء الاصطناعي","description":"أطلق فريق تينسنت هونيوان نسخة كمية من الطراز الرئيسي Hy3 (295B معلمات). النسخة ذات البت الواحد (IQ1_M) تضغط الوزن من 598 جيجابايت إلى 85.5 جيجابايت، أي تقليل بمقدار 6.7 ضعف، مما يس","url":"https://www.aioga.com/ar/news/cmrkf8gun01a4bizsthjytx6c/","contentTranslated":true,"sourceHash":"187b9c5f04a6e558","translatedAt":"2026-07-19T13:34:10.128Z"},"hi":{"title":"Tencent Hunyuan Hy3 क्वांट संस्करण जारी: 1-बिट संस्करण को एकल कार्ड के रूप में तैनात किया जा सकता है, 4-बिट संस्करण पूर्ण प्रदर्शन के करीब है","summary":"Tencent Hunyuan टीम ने फ्लैगशिप मॉडल Hy3 (295B पैरामीटर) का मात्रात्मक संस्करण लॉन्च किया। 1-बिट संस्करण (IQ1_M) वजन को 598 जीबी से 85.5 गीब तक संपीड़ित करता है, जो 6.7 गुना की कमी है, जो एकल 96 जीबी अनुमान ग्राफिक्स कार्ड के साथ तैनाती की अनुमति देता है; 4-बिट संस्करण (Q4_K_M) का वॉल्यूम 169.9 GiB है, जो दो ग्राफिक्स कार्ड का समर्थन करता है। क्वांट संस्करण एजेंटों, बहुभाषी कोड, टूल कॉल और लंबी-फॉर्म टेक्स्ट समझ जैसे कार्यों पर लगभग पूरी तरह से प्रदर्शन करता है। टीम एक GPTQ Int4 संस्करण भी प्रदान करती है, जो vLLM परिनियोजन का समर्थन करती है। एमटीपी सट्टा डिकोडिंग के साथ, 1-बिट संस्करण डिकोडिंग गति को लगभग 50% तक प्राप्त करता है, जबकि 4-बिट संस्करण में लगभग 60% का सुधार होता है। सभी संस्करण ओपन-सोर्स हैं और GGUF प्रारूप में पैक किए गए हैं, जिन्हें llama.cpp पारिस्थितिकी तंत्र के लिए अनुकूलित किया गया है।","category":"模型更新","source":"公众号：腾讯混元","pageTitle":"Tencent Hunyuan Hy3 क्वांट संस्करण जारी: 1-बिट संस्करण को एकल कार्ड के रूप में तैनात किया जा सकता है, 4-बिट संस्करण पूर्ण प्रदर्शन के करीब है - Aioga AI समाचार","description":"Tencent Hunyuan टीम ने फ्लैगशिप मॉडल Hy3 (295B पैरामीटर) का मात्रात्मक संस्करण लॉन्च किया। 1-बिट संस्करण (IQ1_M) वजन को 598 जीबी से 85.5 गीब तक संपीड़ित करता है, जो 6.7 गुना की कमी","url":"https://www.aioga.com/hi/news/cmrkf8gun01a4bizsthjytx6c/","contentTranslated":true,"sourceHash":"187b9c5f04a6e558","translatedAt":"2026-07-19T13:34:07.895Z"},"it":{"title":"Tencent Hunyuan Hy3 Quant Edition rilasciato: la versione a 1 bit può essere implementata come scheda singola, la versione a 4 bit si avvicina alle prestazioni complete","summary":"Il team Tencent Hunyuan ha lanciato una versione quantitativa del modello di punta Hy3 (parametri 295B). La versione a 1 bit (IQ1_M) comprime il peso da 598 GB a 85,5 GiB, una riduzione di 6,7 volte, permettendo il dispiegamento con una singola scheda grafica inferenza da 96GB; La versione a 4 bit (Q4_K_M) ha un volume di 169,9 GiB, supportando due schede grafiche. La versione quantitativa si occupa quasi completamente di compiti come agenti, codice multilingue, chiamate di strumenti e comprensione di testi in formato lungo. Il team offre anche una versione GPTQ Int4, che supporta il deployment vLLM. Con la decodifica speculativa MTP, la versione a 1 bit aumenta la velocità di decodifica di circa il 50%, mentre quella a 4 bit migliora di quasi il 60%. Tutte le versioni sono open source e confezionate in formato GGUF, adattate all'ecosistema llama.cpp.","category":"模型更新","source":"公众号：腾讯混元","pageTitle":"Tencent Hunyuan Hy3 Quant Edition rilasciato: la versione a 1 bit può essere implementata come scheda singola, la versione a 4 bit si avvicina alle prestazioni complete - Aioga Notizie IA","description":"Il team Tencent Hunyuan ha lanciato una versione quantitativa del modello di punta Hy3 (parametri 295B). La versione a 1 bit (IQ1_M) comprime il peso da 598 GB a 85,5 GiB, una ridu","url":"https://www.aioga.com/it/news/cmrkf8gun01a4bizsthjytx6c/","contentTranslated":true,"sourceHash":"187b9c5f04a6e558","translatedAt":"2026-07-19T13:34:10.791Z"},"nl":{"title":"Tencent Hunyuan Hy3 Quant Edition uitgebracht: 1-bit versie kan als enkele kaart worden ingezet, 4-bit versie nadert volledige prestaties","summary":"Het Tencent Hunyuan-team lanceerde een kwantitatieve versie van het vlaggenschipmodel Hy3 (295B parameters). De 1-bit versie (IQ1_M) comprimeert het gewicht van 598 GB naar 85,5 GiB, een 6,7-voudige vermindering, waardoor inzet met één enkele inferentie-grafische kaart van 96 GB mogelijk is; De 4-bit versie (Q4_K_M) heeft een volume van 169,9 GiB en ondersteunt twee grafische kaarten. De quant-versie voert vrijwel volledig taken uit zoals agenten, meertalige code, toolcalls en langtekstbegrip. Het team biedt ook een GPTQ Int4-versie aan, die vLLM-implementatie ondersteunt. Met MTP speculatieve decodering verbetert de 1-bit versie de decodeersnelheid met ongeveer 50%, terwijl de 4-bit versie met bijna 60% verbetert. Alle versies zijn open source en verpakt in GGUF-formaat, aangepast aan het llama.cpp ecosysteem.","category":"模型更新","source":"公众号：腾讯混元","pageTitle":"Tencent Hunyuan Hy3 Quant Edition uitgebracht: 1-bit versie kan als enkele kaart worden ingezet, 4-bit versie nadert volledige prestaties - Aioga AI-nieuws","description":"Het Tencent Hunyuan-team lanceerde een kwantitatieve versie van het vlaggenschipmodel Hy3 (295B parameters). De 1-bit versie (IQ1_M) comprimeert het gewicht van 598 GB naar 85,5 Gi","url":"https://www.aioga.com/nl/news/cmrkf8gun01a4bizsthjytx6c/","contentTranslated":true,"sourceHash":"187b9c5f04a6e558","translatedAt":"2026-07-19T13:34:07.398Z"},"tr":{"title":"Tencent Hunyuan Hy3 Quant Edition çıktı: 1-bit versiyonu tek kart olarak dağıtılabilir, 4-bit versiyonu neredeyse tam performansa ulaşır","summary":"Tencent Hunyuan ekibi, amiral gemisi model Hy3'ün (295B parametre) nicel bir versiyonunu piyasaya sürdü. 1-bit versiyonu (IQ1_M) ağırlığı 598 GB'dan 85.5 GiB'e sıkıştırır; bu 6.7 kat azalma anlamına gelir ve tek bir 96GB çıkarım grafik kartı ile dağıtım imkanı sağlar; 4-bit versiyonu (Q4_K_M) 169,9 GiB hacme sahiptir ve iki grafik kartını destekler. Quant versiyonu ise ajanlar, çok dilli kod, araç çağrıları ve uzun biçimli metin anlama gibi görevleri neredeyse tamamen yerine getirir. Ekip ayrıca vLLM dağıtımını destekleyen bir GPTQ Int4 versiyonu da sunuyor. MTP spekülatif kod çözme ile 1-bit versiyon yaklaşık %50 oranında dekod hızı kazanırken, 4-bit versiyon neredeyse %60 gelişir. Tüm sürümler açık kaynaklıdır ve llama.cpp ekosistemine uyarlanmış GGUF formatında paketlenmiştir.","category":"模型更新","source":"公众号：腾讯混元","pageTitle":"Tencent Hunyuan Hy3 Quant Edition çıktı: 1-bit versiyonu tek kart olarak dağıtılabilir, 4-bit versiyonu neredeyse tam performansa ulaşır - Aioga AI Haberleri","description":"Tencent Hunyuan ekibi, amiral gemisi model Hy3'ün (295B parametre) nicel bir versiyonunu piyasaya sürdü. 1-bit versiyonu (IQ1_M) ağırlığı 598 GB'dan 85.5 GiB'e sıkıştırır; bu 6.7 k","url":"https://www.aioga.com/tr/news/cmrkf8gun01a4bizsthjytx6c/","contentTranslated":true,"sourceHash":"187b9c5f04a6e558","translatedAt":"2026-07-19T13:34:11.205Z"},"vi":{"title":"Tencent Hunyuan Hy3 Quant Edition được phát hành: Phiên bản 1-bit có thể được triển khai dưới dạng một thẻ duy nhất, phiên bản 4-bit gần đạt hiệu suất đầy đủ","summary":"Nhóm Tencent Hunyuan đã tung ra phiên bản định lượng của mẫu hàng đầu Hy3 (thông số 295B). Phiên bản 1-bit (IQ1_M) nén trọng lượng từ 598 GB xuống 85,5 GiB, giảm 6,7 lần, cho phép triển khai với một card đồ họa suy luận 96GB duy nhất; Phiên bản 4-bit (Q4_K_M) có dung lượng 169,9 GiB, hỗ trợ hai card đồ họa. Phiên bản định lượng thực hiện gần như đầy đủ các tác vụ như tác nhân, mã đa ngôn ngữ, gọi công cụ và hiểu văn bản dạng dài. Nhóm cũng cung cấp phiên bản GPTQ Int4, hỗ trợ triển khai vLLM. Với giải mã suy đoán MTP, phiên bản 1-bit tăng tốc độ giải mã khoảng 50%, trong khi phiên bản 4-bit cải thiện gần 60%. Tất cả các phiên bản đều được mã nguồn mở và đóng gói ở định dạng GGUF, được điều chỉnh cho phù hợp với hệ sinh thái llama.cpp.","category":"模型更新","source":"公众号：腾讯混元","pageTitle":"Tencent Hunyuan Hy3 Quant Edition được phát hành: Phiên bản 1-bit có thể được triển khai dưới dạng một thẻ duy nhất, phiên bản 4-bit gần đạt hiệu suất đầy đủ - Tin tức AI Aioga","description":"Nhóm Tencent Hunyuan đã tung ra phiên bản định lượng của mẫu hàng đầu Hy3 (thông số 295B). Phiên bản 1-bit (IQ1_M) nén trọng lượng từ 598 GB xuống 85,5 GiB, giảm 6,7 lần, cho phép ","url":"https://www.aioga.com/vi/news/cmrkf8gun01a4bizsthjytx6c/","contentTranslated":true,"sourceHash":"187b9c5f04a6e558","translatedAt":"2026-07-19T13:34:07.768Z"},"id":{"title":"Tencent Hunyuan Hy3 Quant Edition dirilis: Versi 1-bit dapat digunakan sebagai kartu tunggal, versi 4-bit mendekati kinerja penuh","summary":"Tim Tencent Hunyuan meluncurkan versi kuantitatif dari model unggulan Hy3 (parameter 295B). Versi 1-bit (IQ1_M) memampatkan bobot dari 598 GB menjadi 85,5 GiB, pengurangan 6,7 kali lipat, memungkinkan penerapan dengan satu kartu grafis inferensi 96GB; Versi 4-bit (Q4_K_M) memiliki volume 169,9 GiB, mendukung dua kartu grafis. Versi kuantitatif melakukan hampir sepenuhnya pada tugas-tugas seperti agen, kode multibahasa, panggilan alat, dan pemahaman teks bentuk panjang. Tim juga menawarkan versi GPTQ Int4, mendukung penerapan vLLM. Dengan decoding spekulatif MTP, versi 1-bit mendapatkan kecepatan decoding sekitar 50%, sedangkan versi 4-bit meningkat hampir 60%. Semua versi bersumber terbuka dan dikemas dalam format GGUF, disesuaikan untuk ekosistem llama.cpp.","category":"模型更新","source":"公众号：腾讯混元","pageTitle":"Tencent Hunyuan Hy3 Quant Edition dirilis: Versi 1-bit dapat digunakan sebagai kartu tunggal, versi 4-bit mendekati kinerja penuh - Berita AI Aioga","description":"Tim Tencent Hunyuan meluncurkan versi kuantitatif dari model unggulan Hy3 (parameter 295B). Versi 1-bit (IQ1_M) memampatkan bobot dari 598 GB menjadi 85,5 GiB, pengurangan 6,7 kali","url":"https://www.aioga.com/id/news/cmrkf8gun01a4bizsthjytx6c/","contentTranslated":true,"sourceHash":"187b9c5f04a6e558","translatedAt":"2026-07-19T13:34:11.252Z"},"th":{"title":"เปิดตัว Tencent Hunyuan Hy3 Quant Edition: เวอร์ชัน 1 บิตสามารถปรับใช้เป็นการ์ดใบเดียวได้ เวอร์ชัน 4 บิตใกล้ประสิทธิภาพเต็มที่","summary":"ทีมงาน Tencent Hunyuan เปิดตัวรุ่นเรือธง Hy3 รุ่นเชิงปริมาณ (พารามิเตอร์ 295B) เวอร์ชัน 1 บิต (IQ1_M) บีบอัดน้ําหนักจาก 598 GB เป็น 85.5 GiB ซึ่งลดลง 6.7 เท่า ทําให้สามารถปรับใช้ด้วยการ์ดกราฟิกอนุมาน 96GB ตัวเดียว เวอร์ชัน 4 บิต (Q4_K_M) มีโวลุ่ม 169.9 GiB รองรับกราฟิกการ์ดสองตัว เวอร์ชันควอนตัมทํางานเกือบเต็มที่ เช่น ตัวแทน โค้ดหลายภาษา การเรียกใช้เครื่องมือ และความเข้าใจข้อความแบบยาว ทีมงานยังมีเวอร์ชัน GPTQ Int4 ที่รองรับการปรับใช้ vLLM ด้วยการถอดรหัสแบบเก็งกําไร MTP เวอร์ชัน 1 บิตจะได้รับความเร็วในการถอดรหัสประมาณ 50% ในขณะที่เวอร์ชัน 4 บิตดีขึ้นเกือบ 60% ทุกเวอร์ชันเป็นโอเพ่นซอร์สและบรรจุในรูปแบบ GGUF ซึ่งปรับให้เข้ากับระบบนิเวศของ llama.cpp","category":"模型更新","source":"公众号：腾讯混元","pageTitle":"เปิดตัว Tencent Hunyuan Hy3 Quant Edition: เวอร์ชัน 1 บิตสามารถปรับใช้เป็นการ์ดใบเดียวได้ เวอร์ชัน 4 บิตใกล้ประสิทธิภาพเต็มที่ - ข่าว AI Aioga","description":"ทีมงาน Tencent Hunyuan เปิดตัวรุ่นเรือธง Hy3 รุ่นเชิงปริมาณ (พารามิเตอร์ 295B) เวอร์ชัน 1 บิต (IQ1_M) บีบอัดน้ําหนักจาก 598 GB เป็น 85.5 GiB ซึ่งลดลง 6.7 เท่า ทําให้สามารถปรับใช้ด้","url":"https://www.aioga.com/th/news/cmrkf8gun01a4bizsthjytx6c/","contentTranslated":true,"sourceHash":"187b9c5f04a6e558","translatedAt":"2026-07-19T13:34:08.303Z"},"pl":{"title":"Wydanie Tencent Hunyuan Hy3 Quant Edition: Wersja 1-bitowa może być wdrożona jako pojedyncza karta, wersja 4-bitowa zbliża się do pełnej wydajności","summary":"Zespół Tencent Hunyuan wprowadził ilościową wersję flagowego modelu Hy3 (parametrów 295B). Wersja 1-bitowa (IQ1_M) kompresuje wagę z 598 GB do 85,5 GiB, co oznacza 6,7-krotne zmniejszenie i pozwala na wdrożenie z jedną kartą graficzną inferencyjną o wartości 96 GB; Wersja 4-bitowa (Q4_K_M) ma pojemność 169,9 GiB, obsługując dwie karty graficzne. Wersja ilościowa wykonuje niemal w pełni zadania takie jak agenci, kod wielojęzyczny, wywołania narzędzi oraz rozumienie tekstu długiego. Zespół oferuje także wersję GPTQ Int4, wspierającą wdrażanie vLLM. Dzięki spekulatywnemu dekodowaniu MTP wersja 1-bitowa zyskuje na szybkości dekodowania o około 50%, podczas gdy wersja 4-bitowa poprawia się o prawie 60%. Wszystkie wersje są otwartoźródłowe i zapakowane w formacie GGUF, dostosowane do ekosystemu llama.cpp.","category":"模型更新","source":"公众号：腾讯混元","pageTitle":"Wydanie Tencent Hunyuan Hy3 Quant Edition: Wersja 1-bitowa może być wdrożona jako pojedyncza karta, wersja 4-bitowa zbliża się do pełnej wydajności - Aioga Wiadomości AI","description":"Zespół Tencent Hunyuan wprowadził ilościową wersję flagowego modelu Hy3 (parametrów 295B). Wersja 1-bitowa (IQ1_M) kompresuje wagę z 598 GB do 85,5 GiB, co oznacza 6,7-krotne zmnie","url":"https://www.aioga.com/pl/news/cmrkf8gun01a4bizsthjytx6c/","contentTranslated":true,"sourceHash":"187b9c5f04a6e558","translatedAt":"2026-07-19T13:34:11.122Z"}}}}