返回首页

一周热榜

91作者: gitpusher426 天前
各位 HN 用户: 我开发了一个专门的推理引擎,可以在任何 M 系列 Mac 上运行 4 位 Gemma 4 26B-A4B-IT 模型,仅需约 2 GB RAM。该引擎名为 TurboFieldfare,使用 Swift 和 Metal 编写。 我一直很喜欢设备端 AI。能在 Mac 或 iPhone 上运行强大的神经网络,感觉就像魔法一样。因此,我想稍微突破一下界限,运行一个权重无法完全载入内存的模型。 该模型的 4 位量化权重约占 14 GB,这意味着在 8 GB 甚至 16 GB 的 Mac 上,一旦算上操作系统、应用程序和 KV 缓存,使用传统的推理工具几乎无法运行。 诀窍在于将模型的共享部分和 KV 缓存保留在 RAM 中,然后仅从 SSD 流式传输每个 token 所需的路由专家。SSD 的速度远慢于 RAM,因此运行时会使用一个小的专家缓存和有界的并行 `pread` 操作。在这些读取操作进行期间,GPU 会运行层的共享部分。 我进行了 100 多次实验,大多数都失败了,少数几次才有了今天的成果。实验细节已在 GitHub 仓库中描述。 目前,在 8 GB M2 MacBook Air 上,该引擎的生成速度为 5-6 token/秒;在 M5 MacBook Pro 上,速度可达 31-35 token/秒。 我还添加了一个实验性的、兼容 OpenAI 的本地服务器。它支持流式传输和工具调用,并从 KV 缓存中重用一个提示前缀。 快来试试吧!Mac 应用安装非常简单。首次运行时,它将从 Hugging Face 下载 15 GB 的权重。该模型的能力令人惊讶。 我非常期待任何形式的反馈!