IT之家 10 月 4 日消息,Qwen3.8‑27B 作为一个 AI 模型表现尚可,但前提是设备具备充足的显存和系统内存。配备 M4 Pro 芯片的 MacBook Pro 仅提供 24GB 统一内存,运行该模型时,预填充速度因此受限。根据 Wccftech 的报道,一名用户通过 USB‑C 接口将 iPhone 17 Pro Max 连接到这台便携 Mac 电脑,并利用自研软件,使该 AI 模型的预填充性能最高提升了 44%。

IT之家注意到,为了突破这台 Mac 24GB 统一内存的瓶颈,Reddit 用户“u/StayLameBro”采用了两种方法,将计算任务拆分给 Mac 本机和 iPhone 17 Pro Max 协同处理。在预填充加速方面,MacBook Pro 负责处理每批 256 个 token 中的第 1 至 40 层,并将激活值数据流传输到手机端;同时,iPhone 利用 A19 Pro 的 GPU 运行第 41 至 64 层,而 Mac 则开始处理下一批数据。借助 GPU 运算,手机端的运行速度相比不使用 GPU 时提升了约 2.4 倍。
整个方案中,神经网络引擎也没有被闲置。每 16K 长度的旧上下文会被编译成一个神经网络引擎模型。在 140K 上下文长度下,相比仅使用 A19 Pro 的 GPU,单 token 写入耗时从 279 毫秒减少至 176 毫秒。以预填充一份 2000 token 的文件并保存会话为例:在上下文设为 8K 时,仅靠 Mac 本机的速度为每秒 132 个 token;外接 iPhone 后达到每秒 177 个 token,性能提升 35%。上下文设为 16K 时,速度从每秒 109 个 token 提高到每秒 157 个 token,增幅达到 44%。
当上下文窗口设置为 32K 时,预填充速度从每秒 101 个 token 提升至每秒 130 个 token,性能改善 29%。将 iPhone 17 Pro Max 外接到 M4 Pro 版 MacBook Pro 上,使用这套自研软件,理论上可以获得非常出色的预填充速度。但正如这位 Reddit 用户指出的,实际情况并非如此理想,该方案仍存在一些局限。例如,在 64K 以内的场景中,手机不会加速文本生成,文本生成工作仍全部由 Mac 完成。
此外,值得注意的是,驱动 iPhone 18 Pro 和 iPhone 18 Pro Max 的 A20 Pro 芯片有望提供更大的性能余量。一方面,它本身的整体性能更强;另一方面,它配备双 16 核神经网络引擎。据称,针对专门适配神经网络处理器的任务,这款引擎的数据吞吐能力甚至超过该系统级芯片内置的 7 核 GPU。这套自研软件目前已开源,可在 GitHub 上下载,项目名称为“backburner”。
即使仅作为一项实验,也能看出预填充速度提升带来的收益相当显著。后续自然还有继续挖掘性能潜力的空间;不过这也可能意味着,未来 iPhone 这类设备也可能步入与内存和固态硬盘类似的供货紧缺阶段。