Aioga
AI资讯 / 模型更新
返回 AI资讯

Bonsai 27B:首款可在手机上运行的27B级多模态模型

Hacker News 热门(buzzing.cc 中文翻译)Aioga 编辑团队2026-07-14T19:51:19.560Z热度 76

Bonsai 27B 基于 Qwen3.6 27B,提供三元(1.71 有效比特/权重,5.9 GB)和 1-bit(1.125 有效比特/权重,3.9 GB)两个变体,后者首...

模型更新Hacker News 热门(buzzing.cc 中文翻译)

今日 AI 情报摘要

Bonsai 27B 基于 Qwen3.6 27B,提供三元(1.71 有效比特/权重,5.9 GB)和 1-bit(1.125 有效比特/权重,3.9 GB)两个变体,后者首次将 27B 级模型装入

iPhone 17 Pro。 模型支持多步推理、结构化工具调用、视觉任务和计算机使用智能体循环,拥有 262K token 上下文窗口,支持推测解码加速。 在 15 项基准测试中,三元变体保留全精度基线 95% 的性能,1-bit 变体保留 90%,数学和编码能力几乎无损。 采用 Apache 2.0 许可证开源。

中文正文 · AI 翻译

今天,我们宣布推出 Bonsai 27B,它基于 Qwen3.6 27B,是 Bonsai 系列的新多模态旗舰,也是首款可在手机上运行的同类能力模型。

我们之前的版本证明,使用 1-bit 和三值权重的模型也可以产生商业上有用的语言模型。Bonsai 27B 将这一前沿扩展到新的能力等级:多步推理、结构化工具调用、视觉任务以及可在多步中保持连贯性的计算机使用型代理循环。在今天之前,本地部署这一能力层是不切实际的,原因很具体:27B 模型在 16-bit 精度下大约占用 54GB,即使是较好的 4-bit 构建,18GB 的大小也对于手机及大多数笔记本电脑来说过大。

Bonsai 27B 改变了这一局面。它有两个变体:

三值 Bonsai 27B 使用三值 {−1, 0, 1} 权重和 FP16 分组缩放,每个权重的有效位数为 1.71 位。其大小为 5.9 GB,是面向质量的变体:它可以在普通笔记本电脑上运行,具备完整的推理、工具调用和代理能力。

1-bit Bonsai 27B 使用二值 {−1, 1} 权重,并使用相同的分组缩放,每个权重的有效位数为 1.125 位。其大小为 3.9 GB,是面向占用空间的变体,可在 iPhone 17 Pro 的内存预算内运行,使 27B 级模型首次能在手机上使用。

与每一次 Bonsai 发布一样,这种低位表示运行覆盖语言网络、嵌入、注意力、MLP 和语言模型头部的端到端过程,不依赖更高精度的逃逸路径。两个变体都是多模态的,视觉模块以紧凑的 4-bit 形式提供,使设备端工作流能够识别屏幕截图、文档和摄像头输入,而不仅仅是文本。Bonsai 27B 支持完整的 262K 令牌上下文,并支持预测式解码,通过无损的草稿-验证加速来提高速度。所有内容今天都已在 Apache 2.0 许可下提供。

在一个涵盖知识、推理、数学、编程、指令遵循、工具调用和视觉的 15 个基准测试套件中(在“思考模式”下评估,即模型的全部推理能力被使用),三值 Bonsai 27B 保留了 95% 的全精度基线性能,而 1-bit Bonsai 27B 保留了 90% 的性能。

通过能力读取表格,故事比平均水平更清晰:数学和编码几乎未受影响,工具调用保持在接近完全精度的几个点内——正是智能工作负载依赖的能力。作为对比,同一基础模型最激进的常规模型低位构建,其得分显著低于1-bit Bonsai 27B,同时占用的内存多2.5倍。

这与我们在早期语言和图像模型中展示的帕累托变化相同,现在在27B规模下实现:在占用比全精度2B模型更小的内存下实现27B级别的能力。按照智能密度——我们在1-bit Bonsai 8B中引入的衡量标准——1-bit Bonsai 27B每GB提供0.53的能力:是全精度基线的10倍以上,大约是现有最佳低位替代品的2.7倍。

Bonsai 27B:首款可在手机上运行的27B级多模态模型

最有价值的AI工作负载正在从单次响应转向持续工作:操作真实工具的助手、在无人干预下运行工作流程然后返回结果的系统,以及汇总几十份文档的研究。这个变化改变了工作负载的形态——一个智能体不只调用一次模型,而是调用数百次,每次都携带上下文,生成结构化输出,并用于下一步操作。

云API仍将是许多产品的正确选择。但对于智能工作负载,仅靠云执行会带来结构性限制:每一步都是远程请求,每个标记的成本随着每次迭代累积,每个计划、工具调用和中间结果都需通过网络,包括用户的私有文件、屏幕和数据。

本地执行改变了这一计算方式。当一个能够持续进行智能工作的模型能够适配到设备上时,智能体可以运行在产品内部:百步循环的边际成本为零,而且用户的数据永远不会离开设备。这开辟了全新的类别——持久化本地智能体、离线工作的助手、能够基于本地私有数据进行推理的助手。此前缺少的,是一个既小巧到可以这样部署,又足够强大可以信赖其处理工作的模型。Bonsai 27B正是这样的模型。

Bonsai 27B在NVIDIA GeForce RTX 5090上,1-bit模式下速度可达每秒163个标记,Ternary模式下为每秒134个标记。在M5 Max上,1-bit模式下速度可达每秒87个标记,Ternary模式下为每秒58个标记。

在手机上部署模型比存储容量数字显示的更严格。手机不会将其全部内存暴露给应用——一部 12 GB 的 iPhone 大约只提供 6 GB 给模型在设备上使用,而且模型还要与其 KV 缓存和激活共享这部分内存。没有常规构建的 27B 模型能接近清空这部分内存。约 4 GB 时,1-bit Bonsai 27B 是第一个能够通过并有操作空间的模型。

正因为这个限制,这个系列提供了两个特意设计的操作点,特别考虑到了这一点:三值(ternary)用于笔记本级质量,1-bit 用于手机级占用。

每一个 Bonsai 版本都推动了每 GB 智能密度的边界,而 Bonsai 27B 将其推过了一个实际阈值:现代模型的全部能力集,包括思考、多模态理解、视觉、可靠的工具使用,现在都能适配人们已有的设备上。

我们相信智能密度将成为下一阶段 AI 进展的决定性轴之一。原始能力决定模型能做什么;密度决定它能在哪做。边界的每一次左移都会扩大高级 AI 可运行的设备、产品和环境,并改变它触及的每一个部署场景的经济效益,从手机到单 GPU 服务节点。Bonsai 的方法论与架构无关,边界将继续推进:更大模型和新架构正在开发中。

早期计算机占据整个房间;今天它们存在于我们的口袋里。智能正在经历同样的旅程,而 Bonsai 27B 是迄今为止最大的跨步。平台覆盖

Bonsai 27B 可以通过 MLX 在 Apple 设备(Mac、iPhone、iPad)上原生运行,也可以通过 CUDA 在 NVIDIA GPU 上运行,通过为其混合注意力架构定制的低比特核实现。模型权重今日即可在 Apache 2.0 许可证下获取。基于此次发布,我们提供免费的限时开发者预览 API,方便开发者轻松试用我们的模型。

我们关于压缩、评估和基准测试流程的完整技术细节可参考白皮书:https://github.com/PrismML-Eng/Bonsai-demo/blob/main/bonsai-27b-whitepaper.pdf

PrismML 起源于一支加州理工学院的研究团队,并在 Khosla Ventures、Cerberus 和 Google 的支持下成立,同时持续获得三星的支持。我们花了多年时间攻克该领域最难的问题之一:在不牺牲神经网络推理能力的前提下进行压缩。

如果你想帮助构建下一代最先进的人工智能,我们非常希望听到你的声音。请查看我们的招聘页面:/careers。

Bonsai 27B:首款可在手机上运行的27B级多模态模型

情报判断

Aioga 编辑摘要

Bonsai 27B 基于 Qwen3.6 27B,提供5.9 GB三元版与3.9 GB的1-bit版。材料称后者可装入 iPhone 17 Pro,并支持多模态、工具调用、262K上下文及推测解码。

背景分析

公开材料称,27B模型以16位精度部署约需54 GB,常规4位构建仍约18 GB。Bonsai通过端到端低比特权重压缩语言网络,并将视觉塔以紧凑的4位形式发布。

Aioga 观点

Aioga 判断,此次更新的核心价值不是单项能力增加,而是把27B级多模态模型的本地部署体积降至手机和日常笔记本可承载的范围,同时尽量维持推理与智能体相关能力。

影响与后续

这可能扩大端侧文档、截图和相机输入处理的可行空间,并降低部分工作流对远程推理的依赖。值得关注的是,材料中的性能结论来自15项基准,尚不能替代真实设备体验。 建议后续核验公开模型、许可证与运行代码,并在实际设备上比较内存占用、速度、能耗和长上下文稳定性;同时复测工具调用、视觉任务以及多步智能体循环的完成质量。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: 摘要聚合 · 原始域名: prismml.com

来源: Hacker News 热门(buzzing.cc 中文翻译)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-07-14T19:51:19.560Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

Bonsai 27B 基于 Qwen3.6 27B,提供三元(1.71 有效比特/权重,5.9 GB)和 1-bit(1.125 有效比特/权重,3.9 GB)两个变体,后者首...

Hacker News 热门(buzzing.cc 中文翻译)2026-07-14T19:51:19.560Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。