跳到文章正文
模型框架 编辑推荐

嫌 Mac 内存不够?有人拿 iPhone 当「外挂显存」,跑大模型预填充提速 44%

手头只有一台 24GB 统一内存的 MacBook Pro,却想跑一个动辄几十 GB 的大模型,…

手头只有一台 24GB 统一内存的 MacBook Pro,却想跑一个动辄几十 GB 的大模型,怎么办?买新机器的钱一时半会儿凑不齐,但口袋里那台 iPhone 17 Pro Max 倒是性能强悍。于是一位用户干脆把 iPhone 用 USB-C 线接到 Mac 上,让两台设备分工协作,硬是把大模型推理的预填充速度拉高了最多 44%。

一分钟速览

  • 一台 24GB 内存的 M4 Pro MacBook Pro 跑大模型时,预填充速度受内存限制。
  • 用户通过 USB-C 外接 iPhone 17 Pro Max,把运算任务拆分给两台设备协同。
  • Mac 处理每批 256 个 token 的第 1–40 层,iPhone 的 A19 Pro GPU 处理第 41–64 层。
  • 16K 上下文下,预填充从每秒 109 token 提升到 157 token,增幅达 44%。
  • 整套自制软件已开源,项目名为 backburner,但仍存在不少局限。

它是怎么拆的

问题的起点是模型 Qwen3.8-27B:性能不错,但前提是设备有足够的显存与系统内存。搭载 M4 Pro、只有 24GB 统一内存的 MacBook Pro 在跑它时,预填充速度被卡住。为突破这个上限,一位 Reddit 用户采用了「任务拆分」的思路,把计算交给 Mac 本机和 iPhone 17 Pro Max 协同处理。

针对预填充加速,MacBook Pro 负责处理每一批 256 个 token 中的第 1 至 40 层,再把激活值数据流传输到手机端;与此同时,iPhone 利用 A19 Pro 的 GPU 运行第 41 至 64 层,而 Mac 这边已经开始处理下一批数据。依靠 GPU 运算,手机端的运行速度相比不使用 GPU 时提升约 2.4 倍。

整套方案里,神经网络引擎也没闲着。每段 16K 长度的旧上下文会被编译成一套神经网络引擎模型。在 140K 上下文长度下,相较于仅使用 A19 Pro 的 GPU,单 token 写入耗时从 279 毫秒缩短到 176 毫秒。

数据支撑:不同上下文下的提速

以「把一份 2000 token 的文件预填充并保存会话」这项任务为例:

  • 上下文 8K:仅靠 Mac 本机每秒 132 个 token,外接 iPhone 后达每秒 177 个 token,提升 35%;
  • 上下文 16K:从每秒 109 个 token 提升到 157 个 token,增幅 44%;
  • 上下文 32K:从每秒 101 个 token 提升到 130 个 token,提升 29%。

别高兴太早:局限也不少

正如这位用户自己指出的,这套方案远没到「完美」。例如在 64K 以内的场景,手机并不会加速文本生成,文本生成的工作仍全部交由 Mac 完成。另外值得一提的是,下一代 A20 Pro 芯片有望提供更大性能余量:它本身整体性能更强,还配备双 16 核神经网络引擎;据称针对专门适配神经网络处理器的任务,这款引擎的数据吞吐能力甚至超过该系统级芯片内置的 7 核 GPU。这套自制软件目前已开源,项目名叫「backburner」,可在 GitHub 上下载。

产品链接

趋势洞察

这个实验的价值不在于「省了一台 Mac」,而在于它展示了一种思路:当单台设备的显存/内存成为瓶颈,把算力「拼」起来——甚至跨设备、跨芯片——是一条现实可行的路。随着手机端 NPU 越来越强,未来「手机给电脑当协处理器」未必只是极客玩具。不过它也提醒我们另一件事:如果连 iPhone 这样的设备都要被拉进 AI 算力池,消费级硬件的供货紧张,恐怕还会继续蔓延。

本文地址:https://www.163264.com/16189