{"@context":"https://schema.org","@type":"NewsArticle","generatedAt":"2026-07-23T07:21:26.498Z","headline":"腾讯混元发布 1bit 与 4bit 量化版 Hy3 模型，旗舰 AI 模型可单卡本地运行","description":"腾讯混元将 295B 参数的旗舰模型 Hy3 量化至 1bit 与 4bit，并打包成 GGUF 格式。1bit 版本（IQ1_M）将权重从 598 GB 压缩至 85.5 GiB，单张 96GB 推理显卡即可部署；4bit 版本（Q4_K_M）体积 169.9 GiB，需两张显卡。量化版本在 Agent 能力、多语言代码、工具调用和长文理解等任务上贴近满血模型。团队还开发了 llama.cpp 的 MTP 投机解码 patch，开启后 1bit 版本解码速度提升约 50%，4bit 版本提升接近 60%。此外还提供 GPTQ Int4 版本，可通过 vLLM 部署。","url":"https://www.aioga.com/news/cmrkiod0302e6bizs13am6r64/","mainEntityOfPage":"https://www.aioga.com/news/cmrkiod0302e6bizs13am6r64/","datePublished":"2026-07-14T09:39:02.000Z","dateModified":"2026-07-14T09:39:02.000Z","inLanguage":"zh-CN","publisher":{"@type":"NewsMediaOrganization","name":"Aioga","url":"https://www.aioga.com"},"citation":["https://www.ithome.com/0/976/642.htm","https://aihot.virxact.com/items/cmrkiod0302e6bizs13am6r64"],"canonicalUrl":"https://www.aioga.com/news/cmrkiod0302e6bizs13am6r64/","directAnswer":{"@type":"Answer","text":"Aioga 编辑摘要：腾讯混元将 295B 参数的旗舰模型 Hy3 量化至 1bit 与 4bit，并打包成 GGUF 格式。 Aioga 将其归入「产品更新」方向，重点关注它对真实使用和行业竞争的影响。","url":"https://www.aioga.com/news/cmrkiod0302e6bizs13am6r64/","dateCreated":"2026-07-14T09:39:02.000Z","author":{"@type":"Organization","@id":"https://www.aioga.com/authors/aioga-editorial/#editorial-team","name":"Aioga Editorial Team","url":"https://www.aioga.com/authors/aioga-editorial/"}},"evidence":[{"@type":"CreativeWork","name":"IT之家 source article","url":"https://www.ithome.com/0/976/642.htm","datePublished":"2026-07-14T09:39:02.000Z","provider":{"@type":"Organization","name":"IT之家","url":"https://www.ithome.com/0/976/642.htm"}},{"@type":"CreativeWork","name":"AIHot archive record","url":"https://aihot.virxact.com/items/cmrkiod0302e6bizs13am6r64","datePublished":"2026-07-14T09:39:02.000Z","provider":{"@type":"Organization","name":"AIHot","url":"https://aihot.virxact.com/items/cmrkiod0302e6bizs13am6r64"}}],"aggregationSource":"IT之家（RSS）","originalPublisher":{"name":"IT之家","url":"https://www.ithome.com/0/976/642.htm"},"article":{"id":"cmrkiod0302e6bizs13am6r64","slug":"cmrkiod0302e6bizs13am6r64","url":"https://www.aioga.com/news/cmrkiod0302e6bizs13am6r64/","title":"腾讯混元发布 1bit 与 4bit 量化版 Hy3 模型，旗舰 AI 模型可单卡本地运行","title_en":"","summary":"腾讯混元将 295B 参数的旗舰模型 Hy3 量化至 1bit 与 4bit，并打包成 GGUF 格式。1bit 版本（IQ1_M）将权重从 598 GB 压缩至 85.5 GiB，单张 96GB 推理显卡即可部署；4bit 版本（Q4_K_M）体积 169.9 GiB，需两张显卡。量化版本在 Agent 能力、多语言代码、工具调用和长文理解等任务上贴近满血模型。团队还开发了 llama.cpp 的 MTP 投机解码 patch，开启后 1bit 版本解码速度提升约 50%，4bit 版本提升接近 60%。此外还提供 GPTQ Int4 版本，可通过 vLLM 部署。","source":"IT之家（RSS）","sourceUrl":"https://www.ithome.com/0/976/642.htm","aiHotUrl":"https://aihot.virxact.com/items/cmrkiod0302e6bizs13am6r64","publishedAt":"2026-07-14T09:39:02.000Z","category":"产品更新","score":69,"selected":false,"articleBody":["IT之家：https://www.ithome.com/ 7 月 14 日消息，今日腾讯混元发文表示，Hy3 上线并开源后，社区一直在呼吁量化版本，希望单卡跑参数量达 295B 的 Hy3。团队针对开源社区需求，把 Hy3 的权重量化到 1bit 与 4bit 并打包成 GGUF，配合 llama.cpp 生态，让原本只能跑在多卡集群上的模型，最少一张推理显卡、乃至内存充足的本地机器也能跑起来。","从模型上看，腾讯混元 Hy3 是一个 295B 参数的旗舰模型，展现出显著强于同尺寸模型的智能水平，并比肩更大尺寸旗舰模型的效果，大幅提升了在各类产品和生产力任务中的实用价值，但是它的 BF16 权重接近 600 GB，要完整发挥实力，离不开多卡服务器这样的部署环境。","我们首先提供了 1bit 极限量化版本 IQ1_M，把权重从 598 GB 一路压到 85.5GiB，整整缩小了 6.7 倍。这意味着一张 96GB 的推理显卡就能部署。对于硬件最受限、又想在本地把旗舰模型跑起来的场景，Hy3 1bit 版本是我们所推荐的。","同时，我们也提供了 4bit 量化版本 Q4_K_M，体积 169.9GiB，两张推理显卡即可承载，如果目标是在有限资源成本内拿到更接近满血模型的效果，推荐就选 Hy3 4bit 版本。","我们还提供了 GPTQ Int4 版本，它可以直接通过 vLLM 部署对外提供服务，天然享受 vLLM 生态在高并发、低延迟上的红利，更贴合服务端部署的需求。","判断量化好不好，最直接的是看它和原始模型的输出分布有多接近。4bit 版本在这一点上表现得相当出色，绝大多数位置上给出的首选答案以及 Top-K 概率分布都和 BF16 模型保持一致。落到实际任务上同样如此，无论是 Agent 能力，多语言代码、工具调用，还是长文理解，成绩都贴近满血模型。除此之外，GPTQ Int4 模型在评测集上的掉点幅度也非常有限，整体完全在可接受范围内。","真正让我们有些意外的是 1bit 版本。按直觉，压到 1bit 附近模型多少会变笨，但我们的 Hy3 1bit 版本在主流任务上依然站得很稳。长文理解几乎和原始模型持平，Agent 与代码方向也保持得相当好，只有小幅回落。放到日常的编码辅助、工具调用、长文档处理和常规问答任务上，它已经完全够用。","要让 Hy3 真正跑顺，MTP 投机解码必不可少。为此我们专门开发了 llama.cpp 的 patch，补齐了对 Hy3 模型结构的 MTP 的支持，并直接发布了可用的构建与部署指引（详见 https://huggingface.co/ AngelSlim / Hy3-GGUF ），开启 MTP 后，接受率稳定在 60% 左右，1bit 版本的解码速度提升约 50% ，4bit 版本提升接近 60% ，实际交互体验依然流畅。"],"articleImages":[{"sourceUrl":"https://img.ithome.com/newsuploadfiles/2026/7/3bf7c4ce-7d80-4f76-86ee-2c0cacf10aac.png?x-bce-process=image/format,f_auto","alt":"","afterParagraph":3,"url":"/media/articles/cmrkiod0302e6bizs13am6r64/a04cee75bd5fbc57.webp"},{"sourceUrl":"https://img.ithome.com/newsuploadfiles/2026/7/b5ff665d-8045-4a73-981d-515ef5e115d4.png?x-bce-process=image/format,f_auto","alt":"","afterParagraph":4,"url":"/media/articles/cmrkiod0302e6bizs13am6r64/268d96f6ff745876.webp"},{"sourceUrl":"https://img.ithome.com/newsuploadfiles/2026/7/d6275db1-2aa9-4728-97ca-1922e2c75a6f.png?x-bce-process=image/format,f_auto","alt":"","afterParagraph":5,"url":"/media/articles/cmrkiod0302e6bizs13am6r64/5f008cf01ea17012.webp"},{"sourceUrl":"https://img.ithome.com/newsuploadfiles/2026/7/e90d4909-0335-4060-a750-2bfb58ab3604.png?x-bce-process=image/format,f_auto","alt":"","afterParagraph":6,"url":"/media/articles/cmrkiod0302e6bizs13am6r64/70997ec952b3321a.webp"}],"mediaStatus":"ok","articleBodyZh":[],"translationStatus":"","bodyOrigin":"source-page","editorial":{"summary":"Aioga 编辑摘要：腾讯混元将 295B 参数的旗舰模型 Hy3 量化至 1bit 与 4bit，并打包成 GGUF 格式。 Aioga 将其归入「产品更新」方向，重点关注它对真实使用和行业竞争的影响。","background":"背景分析：模型与研究类动态需要结合能力边界、开放方式、成本、可用性和真实任务表现判断，单项指标领先不等于已经形成稳定采用。","viewpoint":"Aioga 判断：这条动态更适合作为行业观察信号，当前信息足以建立线索，但不足以推导长期结论。","implications":"影响分析：对相关团队而言，短期应先核对来源、可用范围和实际成本，再判断是否值得接入或跟进。","nextStep":"后续观察：继续观察官方文档、实际可用性、价格变化、开发者反馈和竞品回应。","evidenceRefs":["title","summary","articleBody"],"confidence":"medium","status":"published","aiGenerated":false,"autoApproved":true,"generatedBy":"rule-safe-fallback","generatedAt":"2026-07-23T07:30:40.732Z","sourceHash":"e089b0526876a1ed","validation":{"passed":true,"mode":"rule-safe-fallback","checks":["schema","length","source-attribution","no-html"]}},"tags":["产品更新","IT之家（RSS）"],"translations":{"zh-CN":{"title":"腾讯混元发布 1bit 与 4bit 量化版 Hy3 模型，旗舰 AI 模型可单卡本地运行","summary":"腾讯混元将 295B 参数的旗舰模型 Hy3 量化至 1bit 与 4bit，并打包成 GGUF 格式。1bit 版本（IQ1_M）将权重从 598 GB 压缩至 85.5 GiB，单张 96GB 推理显卡即可部署；4bit 版本（Q4_K_M）体积 169.9 GiB，需两张显卡。量化版本在 Agent 能力、多语言代码、工具调用和长文理解等任务上贴近满血模型。团队还开发了 llama.cpp 的 MTP 投机解码 patch，开启后 1bit 版本解码速度提升约 50%，4bit 版本提升接近 60%。此外还提供 GPTQ Int4 版本，可通过 vLLM 部署。","category":"产品更新","source":"IT之家（RSS）","pageTitle":"腾讯混元发布 1bit 与 4bit 量化版 Hy3 模型，旗舰 AI 模型可单卡本地运行 - Aioga AI资讯","description":"腾讯混元将 295B 参数的旗舰模型 Hy3 量化至 1bit 与 4bit，并打包成 GGUF 格式。1bit 版本（IQ1_M）将权重从 598 GB 压缩至 85.5 GiB，单张 96GB 推理显卡即可部署；4bit 版本（Q4_K_M）体积 169.9 GiB，需两张显卡。量化版本在 Agent 能力、多语言代码、工具调用和长文理解等任务上贴近满血","url":"https://www.aioga.com/news/cmrkiod0302e6bizs13am6r64/"},"en":{"title":"腾讯混元发布 1bit 与 4bit 量化版 Hy3 模型，旗舰 AI 模型可单卡本地运行","summary":"Aioga tracks this update from IT之家（RSS） under Products. 腾讯混元将 295B 参数的旗舰模型 Hy3 量化至 1bit 与 4bit，并打包成 GGUF 格式。1bit 版本（IQ1_M）将权重从 598 GB 压缩至 85.5 GiB，单张 96GB 推理显卡即可部署；4bit 版本（Q4_K_M）体积 169.9 GiB，需两张显卡。量化版本在 Agent 能力、多语言代码、工具调用和长文理解等任务上贴近满血模型。团队还开发了 llama.cpp 的 MTP 投机解码 patch，开启后 1bit 版本解码速度提升约 50%，4bit 版本提升接近 60%。此外还提供 GPTQ Int4 版本，可通过 vLLM 部署。","category":"Products","source":"IT之家（RSS）","pageTitle":"腾讯混元发布 1bit 与 4bit 量化版 Hy3 模型，旗舰 AI 模型可单卡本地运行 - Aioga AI News","description":"Aioga tracks this update from IT之家（RSS） under Products. 腾讯混元将 295B 参数的旗舰模型 Hy3 量化至 1bit 与 4bit，并打包成 GGUF 格式。1bit 版本（IQ1_M）将权重从 598 GB 压缩至 85.5 GiB，单张 96GB 推理显卡即可部署；4bit 版本（Q4_K_M）体","url":"https://www.aioga.com/en/news/cmrkiod0302e6bizs13am6r64/"},"ja":{"title":"腾讯混元发布 1bit 与 4bit 量化版 Hy3 模型，旗舰 AI 模型可单卡本地运行","summary":"Aiogaは「製品更新」の動きとして、IT之家（RSS） からの更新を追跡しています。腾讯混元将 295B 参数的旗舰模型 Hy3 量化至 1bit 与 4bit，并打包成 GGUF 格式。1bit 版本（IQ1_M）将权重从 598 GB 压缩至 85.5 GiB，单张 96GB 推理显卡即可部署；4bit 版本（Q4_K_M）体积 169.9 GiB，需两张显卡。量化版本在 Agent 能力、多语言代码、工具调用和长文理解等任务上贴近满血模型。团队还开发了 llama.cpp 的 MTP 投机解码 patch，开启后 1bit 版本解码速度提升约 50%，4bit 版本提升接近 60%。此外还提供 GPTQ Int4 版本，可通过 vLLM 部署。","category":"製品更新","source":"IT之家（RSS）","pageTitle":"腾讯混元发布 1bit 与 4bit 量化版 Hy3 模型，旗舰 AI 模型可单卡本地运行 - Aioga AIニュース","description":"Aiogaは「製品更新」の動きとして、IT之家（RSS） からの更新を追跡しています。腾讯混元将 295B 参数的旗舰模型 Hy3 量化至 1bit 与 4bit，并打包成 GGUF 格式。1bit 版本（IQ1_M）将权重从 598 GB 压缩至 85.5 GiB，单张 96GB 推理显卡即可部署；4bit 版本（Q4_K_M）体积 169.9 GiB，需","url":"https://www.aioga.com/ja/news/cmrkiod0302e6bizs13am6r64/"},"ko":{"title":"腾讯混元发布 1bit 与 4bit 量化版 Hy3 模型，旗舰 AI 模型可单卡本地运行","summary":"Aioga는 IT之家（RSS）의 업데이트를 제품 업데이트 흐름으로 추적합니다. 腾讯混元将 295B 参数的旗舰模型 Hy3 量化至 1bit 与 4bit，并打包成 GGUF 格式。1bit 版本（IQ1_M）将权重从 598 GB 压缩至 85.5 GiB，单张 96GB 推理显卡即可部署；4bit 版本（Q4_K_M）体积 169.9 GiB，需两张显卡。量化版本在 Agent 能力、多语言代码、工具调用和长文理解等任务上贴近满血模型。团队还开发了 llama.cpp 的 MTP 投机解码 patch，开启后 1bit 版本解码速度提升约 50%，4bit 版本提升接近 60%。此外还提供 GPTQ Int4 版本，可通过 vLLM 部署。","category":"제품 업데이트","source":"IT之家（RSS）","pageTitle":"腾讯混元发布 1bit 与 4bit 量化版 Hy3 模型，旗舰 AI 模型可单卡本地运行 - Aioga AI 뉴스","description":"Aioga는 IT之家（RSS）의 업데이트를 제품 업데이트 흐름으로 추적합니다. 腾讯混元将 295B 参数的旗舰模型 Hy3 量化至 1bit 与 4bit，并打包成 GGUF 格式。1bit 版本（IQ1_M）将权重从 598 GB 压缩至 85.5 GiB，单张 96GB 推理显卡即可部署；4bit 版本（Q4_K_M）体积 169.9 GiB，","url":"https://www.aioga.com/ko/news/cmrkiod0302e6bizs13am6r64/"},"es":{"title":"腾讯混元发布 1bit 与 4bit 量化版 Hy3 模型，旗舰 AI 模型可单卡本地运行","summary":"Aioga sigue esta actualización de IT之家（RSS） dentro de Productos. 腾讯混元将 295B 参数的旗舰模型 Hy3 量化至 1bit 与 4bit，并打包成 GGUF 格式。1bit 版本（IQ1_M）将权重从 598 GB 压缩至 85.5 GiB，单张 96GB 推理显卡即可部署；4bit 版本（Q4_K_M）体积 169.9 GiB，需两张显卡。量化版本在 Agent 能力、多语言代码、工具调用和长文理解等任务上贴近满血模型。团队还开发了 llama.cpp 的 MTP 投机解码 patch，开启后 1bit 版本解码速度提升约 50%，4bit 版本提升接近 60%。此外还提供 GPTQ Int4 版本，可通过 vLLM 部署。","category":"Productos","source":"IT之家（RSS）","pageTitle":"腾讯混元发布 1bit 与 4bit 量化版 Hy3 模型，旗舰 AI 模型可单卡本地运行 - Aioga Noticias de IA","description":"Aioga sigue esta actualización de IT之家（RSS） dentro de Productos. 腾讯混元将 295B 参数的旗舰模型 Hy3 量化至 1bit 与 4bit，并打包成 GGUF 格式。1bit 版本（IQ1_M）将权重从 598 GB 压缩至 85.5 GiB，单张 96GB 推理显卡即可部署；4bit 版本","url":"https://www.aioga.com/es/news/cmrkiod0302e6bizs13am6r64/"},"fr":{"title":"腾讯混元发布 1bit 与 4bit 量化版 Hy3 模型，旗舰 AI 模型可单卡本地运行","summary":"Aioga suit cette mise à jour de IT之家（RSS） dans la catégorie Produits. 腾讯混元将 295B 参数的旗舰模型 Hy3 量化至 1bit 与 4bit，并打包成 GGUF 格式。1bit 版本（IQ1_M）将权重从 598 GB 压缩至 85.5 GiB，单张 96GB 推理显卡即可部署；4bit 版本（Q4_K_M）体积 169.9 GiB，需两张显卡。量化版本在 Agent 能力、多语言代码、工具调用和长文理解等任务上贴近满血模型。团队还开发了 llama.cpp 的 MTP 投机解码 patch，开启后 1bit 版本解码速度提升约 50%，4bit 版本提升接近 60%。此外还提供 GPTQ Int4 版本，可通过 vLLM 部署。","category":"Produits","source":"IT之家（RSS）","pageTitle":"腾讯混元发布 1bit 与 4bit 量化版 Hy3 模型，旗舰 AI 模型可单卡本地运行 - Aioga Actualités IA","description":"Aioga suit cette mise à jour de IT之家（RSS） dans la catégorie Produits. 腾讯混元将 295B 参数的旗舰模型 Hy3 量化至 1bit 与 4bit，并打包成 GGUF 格式。1bit 版本（IQ1_M）将权重从 598 GB 压缩至 85.5 GiB，单张 96GB 推理显卡即可部署；4b","url":"https://www.aioga.com/fr/news/cmrkiod0302e6bizs13am6r64/"},"de":{"title":"腾讯混元发布 1bit 与 4bit 量化版 Hy3 模型，旗舰 AI 模型可单卡本地运行","summary":"Aioga tracks this update from IT之家（RSS） under 产品更新. 腾讯混元将 295B 参数的旗舰模型 Hy3 量化至 1bit 与 4bit，并打包成 GGUF 格式。1bit 版本（IQ1_M）将权重从 598 GB 压缩至 85.5 GiB，单张 96GB 推理显卡即可部署；4bit 版本（Q4_K_M）体积 169.9 GiB，需两张显卡。量化版本在 Agent 能力、多语言代码、工具调用和长文理解等任务上贴近满血模型。团队还开发了 llama.cpp 的 MTP 投机解码 patch，开启后 1bit 版本解码速度提升约 50%，4bit 版本提升接近 60%。此外还提供 GPTQ Int4 版本，可通过 vLLM 部署。","category":"产品更新","source":"IT之家（RSS）","pageTitle":"腾讯混元发布 1bit 与 4bit 量化版 Hy3 模型，旗舰 AI 模型可单卡本地运行 - Aioga KI-News","description":"Aioga tracks this update from IT之家（RSS） under 产品更新. 腾讯混元将 295B 参数的旗舰模型 Hy3 量化至 1bit 与 4bit，并打包成 GGUF 格式。1bit 版本（IQ1_M）将权重从 598 GB 压缩至 85.5 GiB，单张 96GB 推理显卡即可部署；4bit 版本（Q4_K_M）体积 16","url":"https://www.aioga.com/de/news/cmrkiod0302e6bizs13am6r64/"},"pt-BR":{"title":"腾讯混元发布 1bit 与 4bit 量化版 Hy3 模型，旗舰 AI 模型可单卡本地运行","summary":"Aioga tracks this update from IT之家（RSS） under 产品更新. 腾讯混元将 295B 参数的旗舰模型 Hy3 量化至 1bit 与 4bit，并打包成 GGUF 格式。1bit 版本（IQ1_M）将权重从 598 GB 压缩至 85.5 GiB，单张 96GB 推理显卡即可部署；4bit 版本（Q4_K_M）体积 169.9 GiB，需两张显卡。量化版本在 Agent 能力、多语言代码、工具调用和长文理解等任务上贴近满血模型。团队还开发了 llama.cpp 的 MTP 投机解码 patch，开启后 1bit 版本解码速度提升约 50%，4bit 版本提升接近 60%。此外还提供 GPTQ Int4 版本，可通过 vLLM 部署。","category":"产品更新","source":"IT之家（RSS）","pageTitle":"腾讯混元发布 1bit 与 4bit 量化版 Hy3 模型，旗舰 AI 模型可单卡本地运行 - Aioga Notícias de IA","description":"Aioga tracks this update from IT之家（RSS） under 产品更新. 腾讯混元将 295B 参数的旗舰模型 Hy3 量化至 1bit 与 4bit，并打包成 GGUF 格式。1bit 版本（IQ1_M）将权重从 598 GB 压缩至 85.5 GiB，单张 96GB 推理显卡即可部署；4bit 版本（Q4_K_M）体积 16","url":"https://www.aioga.com/pt-BR/news/cmrkiod0302e6bizs13am6r64/"},"ru":{"title":"腾讯混元发布 1bit 与 4bit 量化版 Hy3 模型，旗舰 AI 模型可单卡本地运行","summary":"Aioga tracks this update from IT之家（RSS） under 产品更新. 腾讯混元将 295B 参数的旗舰模型 Hy3 量化至 1bit 与 4bit，并打包成 GGUF 格式。1bit 版本（IQ1_M）将权重从 598 GB 压缩至 85.5 GiB，单张 96GB 推理显卡即可部署；4bit 版本（Q4_K_M）体积 169.9 GiB，需两张显卡。量化版本在 Agent 能力、多语言代码、工具调用和长文理解等任务上贴近满血模型。团队还开发了 llama.cpp 的 MTP 投机解码 patch，开启后 1bit 版本解码速度提升约 50%，4bit 版本提升接近 60%。此外还提供 GPTQ Int4 版本，可通过 vLLM 部署。","category":"产品更新","source":"IT之家（RSS）","pageTitle":"腾讯混元发布 1bit 与 4bit 量化版 Hy3 模型，旗舰 AI 模型可单卡本地运行 - Aioga Новости ИИ","description":"Aioga tracks this update from IT之家（RSS） under 产品更新. 腾讯混元将 295B 参数的旗舰模型 Hy3 量化至 1bit 与 4bit，并打包成 GGUF 格式。1bit 版本（IQ1_M）将权重从 598 GB 压缩至 85.5 GiB，单张 96GB 推理显卡即可部署；4bit 版本（Q4_K_M）体积 16","url":"https://www.aioga.com/ru/news/cmrkiod0302e6bizs13am6r64/"},"ar":{"title":"腾讯混元发布 1bit 与 4bit 量化版 Hy3 模型，旗舰 AI 模型可单卡本地运行","summary":"Aioga tracks this update from IT之家（RSS） under 产品更新. 腾讯混元将 295B 参数的旗舰模型 Hy3 量化至 1bit 与 4bit，并打包成 GGUF 格式。1bit 版本（IQ1_M）将权重从 598 GB 压缩至 85.5 GiB，单张 96GB 推理显卡即可部署；4bit 版本（Q4_K_M）体积 169.9 GiB，需两张显卡。量化版本在 Agent 能力、多语言代码、工具调用和长文理解等任务上贴近满血模型。团队还开发了 llama.cpp 的 MTP 投机解码 patch，开启后 1bit 版本解码速度提升约 50%，4bit 版本提升接近 60%。此外还提供 GPTQ Int4 版本，可通过 vLLM 部署。","category":"产品更新","source":"IT之家（RSS）","pageTitle":"腾讯混元发布 1bit 与 4bit 量化版 Hy3 模型，旗舰 AI 模型可单卡本地运行 - Aioga أخبار الذكاء الاصطناعي","description":"Aioga tracks this update from IT之家（RSS） under 产品更新. 腾讯混元将 295B 参数的旗舰模型 Hy3 量化至 1bit 与 4bit，并打包成 GGUF 格式。1bit 版本（IQ1_M）将权重从 598 GB 压缩至 85.5 GiB，单张 96GB 推理显卡即可部署；4bit 版本（Q4_K_M）体积 16","url":"https://www.aioga.com/ar/news/cmrkiod0302e6bizs13am6r64/"},"hi":{"title":"腾讯混元发布 1bit 与 4bit 量化版 Hy3 模型，旗舰 AI 模型可单卡本地运行","summary":"Aioga tracks this update from IT之家（RSS） under 产品更新. 腾讯混元将 295B 参数的旗舰模型 Hy3 量化至 1bit 与 4bit，并打包成 GGUF 格式。1bit 版本（IQ1_M）将权重从 598 GB 压缩至 85.5 GiB，单张 96GB 推理显卡即可部署；4bit 版本（Q4_K_M）体积 169.9 GiB，需两张显卡。量化版本在 Agent 能力、多语言代码、工具调用和长文理解等任务上贴近满血模型。团队还开发了 llama.cpp 的 MTP 投机解码 patch，开启后 1bit 版本解码速度提升约 50%，4bit 版本提升接近 60%。此外还提供 GPTQ Int4 版本，可通过 vLLM 部署。","category":"产品更新","source":"IT之家（RSS）","pageTitle":"腾讯混元发布 1bit 与 4bit 量化版 Hy3 模型，旗舰 AI 模型可单卡本地运行 - Aioga AI समाचार","description":"Aioga tracks this update from IT之家（RSS） under 产品更新. 腾讯混元将 295B 参数的旗舰模型 Hy3 量化至 1bit 与 4bit，并打包成 GGUF 格式。1bit 版本（IQ1_M）将权重从 598 GB 压缩至 85.5 GiB，单张 96GB 推理显卡即可部署；4bit 版本（Q4_K_M）体积 16","url":"https://www.aioga.com/hi/news/cmrkiod0302e6bizs13am6r64/"},"it":{"title":"腾讯混元发布 1bit 与 4bit 量化版 Hy3 模型，旗舰 AI 模型可单卡本地运行","summary":"Aioga tracks this update from IT之家（RSS） under 产品更新. 腾讯混元将 295B 参数的旗舰模型 Hy3 量化至 1bit 与 4bit，并打包成 GGUF 格式。1bit 版本（IQ1_M）将权重从 598 GB 压缩至 85.5 GiB，单张 96GB 推理显卡即可部署；4bit 版本（Q4_K_M）体积 169.9 GiB，需两张显卡。量化版本在 Agent 能力、多语言代码、工具调用和长文理解等任务上贴近满血模型。团队还开发了 llama.cpp 的 MTP 投机解码 patch，开启后 1bit 版本解码速度提升约 50%，4bit 版本提升接近 60%。此外还提供 GPTQ Int4 版本，可通过 vLLM 部署。","category":"产品更新","source":"IT之家（RSS）","pageTitle":"腾讯混元发布 1bit 与 4bit 量化版 Hy3 模型，旗舰 AI 模型可单卡本地运行 - Aioga Notizie IA","description":"Aioga tracks this update from IT之家（RSS） under 产品更新. 腾讯混元将 295B 参数的旗舰模型 Hy3 量化至 1bit 与 4bit，并打包成 GGUF 格式。1bit 版本（IQ1_M）将权重从 598 GB 压缩至 85.5 GiB，单张 96GB 推理显卡即可部署；4bit 版本（Q4_K_M）体积 16","url":"https://www.aioga.com/it/news/cmrkiod0302e6bizs13am6r64/"},"nl":{"title":"腾讯混元发布 1bit 与 4bit 量化版 Hy3 模型，旗舰 AI 模型可单卡本地运行","summary":"Aioga tracks this update from IT之家（RSS） under 产品更新. 腾讯混元将 295B 参数的旗舰模型 Hy3 量化至 1bit 与 4bit，并打包成 GGUF 格式。1bit 版本（IQ1_M）将权重从 598 GB 压缩至 85.5 GiB，单张 96GB 推理显卡即可部署；4bit 版本（Q4_K_M）体积 169.9 GiB，需两张显卡。量化版本在 Agent 能力、多语言代码、工具调用和长文理解等任务上贴近满血模型。团队还开发了 llama.cpp 的 MTP 投机解码 patch，开启后 1bit 版本解码速度提升约 50%，4bit 版本提升接近 60%。此外还提供 GPTQ Int4 版本，可通过 vLLM 部署。","category":"产品更新","source":"IT之家（RSS）","pageTitle":"腾讯混元发布 1bit 与 4bit 量化版 Hy3 模型，旗舰 AI 模型可单卡本地运行 - Aioga AI-nieuws","description":"Aioga tracks this update from IT之家（RSS） under 产品更新. 腾讯混元将 295B 参数的旗舰模型 Hy3 量化至 1bit 与 4bit，并打包成 GGUF 格式。1bit 版本（IQ1_M）将权重从 598 GB 压缩至 85.5 GiB，单张 96GB 推理显卡即可部署；4bit 版本（Q4_K_M）体积 16","url":"https://www.aioga.com/nl/news/cmrkiod0302e6bizs13am6r64/"},"tr":{"title":"腾讯混元发布 1bit 与 4bit 量化版 Hy3 模型，旗舰 AI 模型可单卡本地运行","summary":"Aioga tracks this update from IT之家（RSS） under 产品更新. 腾讯混元将 295B 参数的旗舰模型 Hy3 量化至 1bit 与 4bit，并打包成 GGUF 格式。1bit 版本（IQ1_M）将权重从 598 GB 压缩至 85.5 GiB，单张 96GB 推理显卡即可部署；4bit 版本（Q4_K_M）体积 169.9 GiB，需两张显卡。量化版本在 Agent 能力、多语言代码、工具调用和长文理解等任务上贴近满血模型。团队还开发了 llama.cpp 的 MTP 投机解码 patch，开启后 1bit 版本解码速度提升约 50%，4bit 版本提升接近 60%。此外还提供 GPTQ Int4 版本，可通过 vLLM 部署。","category":"产品更新","source":"IT之家（RSS）","pageTitle":"腾讯混元发布 1bit 与 4bit 量化版 Hy3 模型，旗舰 AI 模型可单卡本地运行 - Aioga AI Haberleri","description":"Aioga tracks this update from IT之家（RSS） under 产品更新. 腾讯混元将 295B 参数的旗舰模型 Hy3 量化至 1bit 与 4bit，并打包成 GGUF 格式。1bit 版本（IQ1_M）将权重从 598 GB 压缩至 85.5 GiB，单张 96GB 推理显卡即可部署；4bit 版本（Q4_K_M）体积 16","url":"https://www.aioga.com/tr/news/cmrkiod0302e6bizs13am6r64/"},"vi":{"title":"腾讯混元发布 1bit 与 4bit 量化版 Hy3 模型，旗舰 AI 模型可单卡本地运行","summary":"Aioga tracks this update from IT之家（RSS） under 产品更新. 腾讯混元将 295B 参数的旗舰模型 Hy3 量化至 1bit 与 4bit，并打包成 GGUF 格式。1bit 版本（IQ1_M）将权重从 598 GB 压缩至 85.5 GiB，单张 96GB 推理显卡即可部署；4bit 版本（Q4_K_M）体积 169.9 GiB，需两张显卡。量化版本在 Agent 能力、多语言代码、工具调用和长文理解等任务上贴近满血模型。团队还开发了 llama.cpp 的 MTP 投机解码 patch，开启后 1bit 版本解码速度提升约 50%，4bit 版本提升接近 60%。此外还提供 GPTQ Int4 版本，可通过 vLLM 部署。","category":"产品更新","source":"IT之家（RSS）","pageTitle":"腾讯混元发布 1bit 与 4bit 量化版 Hy3 模型，旗舰 AI 模型可单卡本地运行 - Tin tức AI Aioga","description":"Aioga tracks this update from IT之家（RSS） under 产品更新. 腾讯混元将 295B 参数的旗舰模型 Hy3 量化至 1bit 与 4bit，并打包成 GGUF 格式。1bit 版本（IQ1_M）将权重从 598 GB 压缩至 85.5 GiB，单张 96GB 推理显卡即可部署；4bit 版本（Q4_K_M）体积 16","url":"https://www.aioga.com/vi/news/cmrkiod0302e6bizs13am6r64/"},"id":{"title":"腾讯混元发布 1bit 与 4bit 量化版 Hy3 模型，旗舰 AI 模型可单卡本地运行","summary":"Aioga tracks this update from IT之家（RSS） under 产品更新. 腾讯混元将 295B 参数的旗舰模型 Hy3 量化至 1bit 与 4bit，并打包成 GGUF 格式。1bit 版本（IQ1_M）将权重从 598 GB 压缩至 85.5 GiB，单张 96GB 推理显卡即可部署；4bit 版本（Q4_K_M）体积 169.9 GiB，需两张显卡。量化版本在 Agent 能力、多语言代码、工具调用和长文理解等任务上贴近满血模型。团队还开发了 llama.cpp 的 MTP 投机解码 patch，开启后 1bit 版本解码速度提升约 50%，4bit 版本提升接近 60%。此外还提供 GPTQ Int4 版本，可通过 vLLM 部署。","category":"产品更新","source":"IT之家（RSS）","pageTitle":"腾讯混元发布 1bit 与 4bit 量化版 Hy3 模型，旗舰 AI 模型可单卡本地运行 - Berita AI Aioga","description":"Aioga tracks this update from IT之家（RSS） under 产品更新. 腾讯混元将 295B 参数的旗舰模型 Hy3 量化至 1bit 与 4bit，并打包成 GGUF 格式。1bit 版本（IQ1_M）将权重从 598 GB 压缩至 85.5 GiB，单张 96GB 推理显卡即可部署；4bit 版本（Q4_K_M）体积 16","url":"https://www.aioga.com/id/news/cmrkiod0302e6bizs13am6r64/"},"th":{"title":"腾讯混元发布 1bit 与 4bit 量化版 Hy3 模型，旗舰 AI 模型可单卡本地运行","summary":"Aioga tracks this update from IT之家（RSS） under 产品更新. 腾讯混元将 295B 参数的旗舰模型 Hy3 量化至 1bit 与 4bit，并打包成 GGUF 格式。1bit 版本（IQ1_M）将权重从 598 GB 压缩至 85.5 GiB，单张 96GB 推理显卡即可部署；4bit 版本（Q4_K_M）体积 169.9 GiB，需两张显卡。量化版本在 Agent 能力、多语言代码、工具调用和长文理解等任务上贴近满血模型。团队还开发了 llama.cpp 的 MTP 投机解码 patch，开启后 1bit 版本解码速度提升约 50%，4bit 版本提升接近 60%。此外还提供 GPTQ Int4 版本，可通过 vLLM 部署。","category":"产品更新","source":"IT之家（RSS）","pageTitle":"腾讯混元发布 1bit 与 4bit 量化版 Hy3 模型，旗舰 AI 模型可单卡本地运行 - ข่าว AI Aioga","description":"Aioga tracks this update from IT之家（RSS） under 产品更新. 腾讯混元将 295B 参数的旗舰模型 Hy3 量化至 1bit 与 4bit，并打包成 GGUF 格式。1bit 版本（IQ1_M）将权重从 598 GB 压缩至 85.5 GiB，单张 96GB 推理显卡即可部署；4bit 版本（Q4_K_M）体积 16","url":"https://www.aioga.com/th/news/cmrkiod0302e6bizs13am6r64/"},"pl":{"title":"腾讯混元发布 1bit 与 4bit 量化版 Hy3 模型，旗舰 AI 模型可单卡本地运行","summary":"Aioga tracks this update from IT之家（RSS） under 产品更新. 腾讯混元将 295B 参数的旗舰模型 Hy3 量化至 1bit 与 4bit，并打包成 GGUF 格式。1bit 版本（IQ1_M）将权重从 598 GB 压缩至 85.5 GiB，单张 96GB 推理显卡即可部署；4bit 版本（Q4_K_M）体积 169.9 GiB，需两张显卡。量化版本在 Agent 能力、多语言代码、工具调用和长文理解等任务上贴近满血模型。团队还开发了 llama.cpp 的 MTP 投机解码 patch，开启后 1bit 版本解码速度提升约 50%，4bit 版本提升接近 60%。此外还提供 GPTQ Int4 版本，可通过 vLLM 部署。","category":"产品更新","source":"IT之家（RSS）","pageTitle":"腾讯混元发布 1bit 与 4bit 量化版 Hy3 模型，旗舰 AI 模型可单卡本地运行 - Aioga Wiadomości AI","description":"Aioga tracks this update from IT之家（RSS） under 产品更新. 腾讯混元将 295B 参数的旗舰模型 Hy3 量化至 1bit 与 4bit，并打包成 GGUF 格式。1bit 版本（IQ1_M）将权重从 598 GB 压缩至 85.5 GiB，单张 96GB 推理显卡即可部署；4bit 版本（Q4_K_M）体积 16","url":"https://www.aioga.com/pl/news/cmrkiod0302e6bizs13am6r64/"}}}}