11作者: MediaSquirrel4 个月前
大约六个月前,我开始着手一个项目,目标是在我的 M2 Ultra Mac Studio 上本地微调 Whisper 模型,但计算资源有限。我全身心投入其中。当时我遇到的问题是,我在 Google Cloud Storage 上有 15,000 小时的音频数据,而我的本地机器根本无法容纳所有音频,所以我构建了一个系统,在训练期间将数据从 GCS 流式传输到我的机器上。 后来,Gemma 3n 发布了,我就把它加了进去。说实话,当时有点疯了。 然后我就把它搁置了。 几天前,Gemma 4 发布后,我把它掸了掸灰,清理了一下,把 Whisper 微调中的 Gemma 部分分离出来,并增加了对 Gemma 4 的支持。 今天我把它展示在这里,供大家试用、fork 和改进。 到目前为止,我学到的一件事是:在较长的序列上进行微调时,很容易出现 OOM(内存溢出)错误!我的本地 Mac Studio 有 64GB 内存,所以我经常会耗尽内存。 总之,鉴于大家对 Gemma 4 的兴趣如此之大,而且坦白说,你实际上无法使用 MLX 进行音频微调,这才是这个项目存在的原因(除了我个人的兴趣)。我本来更希望使用 MLX,这样就不用做这个了,但现在就这样吧。欢迎来到我的小副业。 所以我就做了这个。希望大家用得开心,就像我制作它一样开心。 -Matt