328 分•作者: marcobambini•4 天前
返回首页
一周热榜
278 分•作者: NDlurker•大约 5 小时前
197 分•作者: meysamazad•大约 11 小时前
168 分•作者: surprisetalk•大约 10 小时前
133 分•作者: tedsanders•5 天前
131 分•作者: dnhkng•5 天前
131 分•作者: ai2027•2 天前
127 分•作者: speckx•5 天前
112 分•作者: akolbe•2 天前
110 分•作者: MaxMussio•1 天前
104 分•作者: arto•5 天前
99 分•作者: stymaar•大约 1 小时前
96 分•作者: pmg101•大约 23 小时前
94 分•作者: ai2027•5 天前
91 分•作者: gitpusher42•6 天前
各位 HN 用户:
我开发了一个专门的推理引擎,可以在任何 M 系列 Mac 上运行 4 位 Gemma 4 26B-A4B-IT 模型,仅需约 2 GB RAM。该引擎名为 TurboFieldfare,使用 Swift 和 Metal 编写。
我一直很喜欢设备端 AI。能在 Mac 或 iPhone 上运行强大的神经网络,感觉就像魔法一样。因此,我想稍微突破一下界限,运行一个权重无法完全载入内存的模型。
该模型的 4 位量化权重约占 14 GB,这意味着在 8 GB 甚至 16 GB 的 Mac 上,一旦算上操作系统、应用程序和 KV 缓存,使用传统的推理工具几乎无法运行。
诀窍在于将模型的共享部分和 KV 缓存保留在 RAM 中,然后仅从 SSD 流式传输每个 token 所需的路由专家。SSD 的速度远慢于 RAM,因此运行时会使用一个小的专家缓存和有界的并行 `pread` 操作。在这些读取操作进行期间,GPU 会运行层的共享部分。
我进行了 100 多次实验,大多数都失败了,少数几次才有了今天的成果。实验细节已在 GitHub 仓库中描述。
目前,在 8 GB M2 MacBook Air 上,该引擎的生成速度为 5-6 token/秒;在 M5 MacBook Pro 上,速度可达 31-35 token/秒。
我还添加了一个实验性的、兼容 OpenAI 的本地服务器。它支持流式传输和工具调用,并从 KV 缓存中重用一个提示前缀。
快来试试吧!Mac 应用安装非常简单。首次运行时,它将从 Hugging Face 下载 15 GB 的权重。该模型的能力令人惊讶。
我非常期待任何形式的反馈!
89 分•作者: tambourine_man•6 天前
89 分•作者: depr•大约 2 小时前
87 分•作者: pudgywalsh•3 天前
86 分•作者: speckx•5 天前
81 分•作者: ngruhn•1 天前