Aioga
AI资讯 / 行业动态
返回 AI资讯

在 M4 Pro Mac mini 上搭建本地 LLM 环境的完整方案

Hacker News 热门(buzzing.cc 中文翻译)Aioga 编辑团队2026-09-02T04:17:22.000Z热度 58

作者分享在 48GB 内存 M4 Pro Mac mini 上运行本地 LLM 的完整方案,主模型为 Qwen3.6-35B-A3B-OptiQ-4bit(约占用 20GB 内...

行业动态Hacker News 热门(buzzing.cc 中文翻译)

今日 AI 情报摘要

作者分享在 48GB 内存 M4 Pro Mac mini 上运行本地 LLM 的完整方案,主模型为 Qwen3.6-35B-A3B-OptiQ-4bit(约占用 20GB 内存),轻量模型为

Gemma-4-E4B,推理服务用 oMLX,通过 Tailscale 让 iPhone、MacBook 共用同一后端,并接入 Hermes、Pi、Apollo 和 Raycast。

中文正文 · AI 翻译

我在我的 M4 Pro Mac mini 上运行本地 LLM 服务器,配备 48 GB 内存。它处理从我的 Hermes 代理后台到手机上的快速聊天查询的一切。整个设置大约需要 30 分钟。

Hermes 作为 Mac mini 上的代理后台运行,我的 MacBook 运行桌面客户端,手机运行 Telegram。对于非 Hermes 的使用,我在 iOS 上使用 Apollo 进行快速聊天(类似 Claude,适合随问随答的问题),Pi 作为我的编程代理(我已经写过这个设置:https://lws.io/blog/pi-harness-cold-start/),以及在我的 Mac 上使用 Raycast AI 来处理随机的事情。

运行本地的主要原因:云 API 是租用的土地。它们可以修改价格、达到你的使用限制,或者在任何时候在后台更换所提供的模型。我经常用尽两个每月 200 美元的订阅,而且感觉在不同时间得到的东西也不同。有时候一个模型很好,有时候它会在没有通知的情况下退化。

还有 AI 主权。我一直在关注美国政府如何限制各种模型的推广。政府可以在任何时候、出于任何原因进行这种限制,而你无法控制。如果你的工作流程依赖于受到限制的云模型,你就必须停止或临时应对。避免这种情况的唯一方法是拥有自己的计算能力。

Mac mini 一直开着。它放在我的桌子上,除了我需要使用它时,我几乎不会注意到它。

Hermes 也运行在 Mac mini 上,使用同一台机器上的本地模型。我通过 Telegram(在手机上)和 MacBook 上的 Hermes 桌面应用访问我的代理。Hermes 桌面应用充当一个‘外壳’,连接到另一台设备上的 Hermes 后台(本例为 Mac mini)。这意味着我可以在所有设备间共享后台、对话历史和技能集。

重点不是替代基于 API 的模型。而是处理 80% 不需要 GPT-5 或 Claude Opus 的请求。当我确实需要这些模型时,它们已经可用。本地模型只是覆盖更多我日常使用的部分,且是免费的。

本地运行大型模型归结为一个问题:它实际在内存中需要多少 RAM。大多数人只看参数数量就会产生误解,因为稠密模型和专家混合(MoE)模型在消费级硬件上的差别非常大。

以下是读取该标识符的方法:

关键区别在于A3B部分。一个密集的27B模型,每个令牌都被加载在RAM中,始终有270亿个参数。像Qwen3.6-35B-A3B这样的MoE模型,总共有350亿个参数,分布在256位专家身上,但每个令牌实际激活的只有大约30亿个。另外320亿个则放在RAM中,什么都不做。

在我的48GB Mac mini上,Qwen3.6-35B-A3B的4位内存大约占用20GB。剩下的28GB用于上下文Windows、操作系统以及机器上运行的其他所有设备。Gemma-4-E4B大约是2.4GB。体积小,可以保留用于简单任务,而使用完整的20GB版本则显得过于繁琐。

我朋友的MacBook Air总共有16GB。4位密集的27B大约需要14GB。这几乎是机器所有的容量,除了操作系统空间。所以它能用一会儿,然后不行就切换到SSD变得很痛苦。

MoE改变了这一点。我标识符中的35B模型可以装在同一台MacBook上,因为每个令牌实际上只有3B的权重是激活的,这意味着GPU/媒体内存占用更接近6B密度模型所需的容量。350亿个总参数权重都放在统一内存中。

如何检查某个型号是否能在你的硬件上运行:

这是没人提的部分。你可以每隔几周更换一次本地模型,因为有新模型发布。这实际上就是下载和重启。

oMLX管理仪表盘内置了HuggingFace模型浏览器。找到模型,点击下载。在Hermes、Pi、Raycast和Apollo中更改模型,我就完成了。

很多操作也可以通过CLI完成,所以我可以从任何设备SSH连接到Mac mini。

为什么这很重要:本地模型和API模型之间的差距正在迅速缩小。一年前的“一般”质量现在在大多数实际任务中都具有竞争力。编码、推理、工具使用才是关键所在。而OptiQ的4位量化技术出乎意料地保持了高质量。35B-A3B在4位测试中相比BF16(16位浮点,未压缩基线)只损失大约1-2分。这是48GB内存使用而非70GB的合理权衡。

Tailscale 在我所有设备之间创建了一个网格。Mac mini、iPhone、MacBook 都在同一个私有网络中。没有任何东西暴露在公共互联网。

oMLX 服务器监听 8000 端口。任何在 tailnet 中的设备都可以连接。Raycast、Apollo iOS、Hermes 桌面客户端在我的 MacBook 上都连接同一个端点。设备之间没有配置漂移。

oMLX 的 KV 缓存持久化在 tailnet 环境下也很重要。编码代理会在会话中反复回到之前的上下文。oMLX 会将每个区块缓存到 SSD 上,所以当代理返回到之前的前缀时,数据可以从磁盘毫秒级恢复,而不是重新计算。这使得本地设置对于代理工作来说实际上是可行的,这也是 Hermes 存在的地方。

Apple Silicon 上的本地模型不再是一个次要实验。M4 Pro Mac mini 轻松应对,模型对于大多数任务已经足够,而且你可以随时更换模型。你不需要按 token 付费。你也不需要通过第三方端点路由敏感数据。当下周出现更好的模型时,你几乎不费力就可以尝试,成本仅是一些硬盘空间。

我已经预订了一台 128GB 的 M5 Max Mac Studio,将在今年晚些时候交付,但到目前为止,我对这台 M4 Pro Mac mini 的性能非常满意。如果你有其他 Apple Silicon 设备,可以试试——可能需要根据你的规格调整模型,但整体设置是一样的。

情报判断

Aioga 编辑摘要

作者介绍了一套运行在 48GB 内存 M4 Pro Mac mini 上的本地 LLM 环境,主模型为 Qwen3.6-35B-A3B-OptiQ-4bit,轻量模型为 Gemma-4-E4B,推理服务使用 oMLX,并通过 Tailscale 连接 iPhone 与 MacBook。

背景分析

该方案将 Hermes 后端部署在 Mac mini,MacBook 使用桌面客户端,手机通过 Telegram 访问;作者还使用 Apollo、Pi 和 Raycast 处理不同任务。作者称本地模型主要覆盖不需要 GPT-5 或 Claude Opus 的日常请求。

Aioga 观点

Aioga 判断:这篇材料的核心价值在于展示本地模型、代理后端与多设备访问的组合方式,同时强调内存需求、稠密模型与 MoE 模型差异对消费级硬件部署的影响。

影响与后续

可能影响:本地部署可能减少部分云端模型调用,并让用户保有统一的后端、对话历史和技能配置;但材料不代表本地模型能够替代所有 API 模型,也不足以证明该方案适用于所有硬件或工作负载。 后续观察:需要关注该模型组合在不同任务中的实际效果、长期运行稳定性与资源占用,也应进一步核验 Tailscale、多设备客户端和各应用之间的配置成本。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: 摘要聚合 · 原始域名: lws.io

来源: Hacker News 热门(buzzing.cc 中文翻译)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-09-02T04:17:22.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

作者分享在 48GB 内存 M4 Pro Mac mini 上运行本地 LLM 的完整方案,主模型为 Qwen3.6-35B-A3B-OptiQ-4bit(约占用 20GB 内...

Hacker News 热门(buzzing.cc 中文翻译)2026-09-02T04:17:22.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。