陌生人使用 Hugging Face 的 PR(拉取请求)和 cron 作业预训练了一个语言模型。

1作者: somevyn3 天前
上周,我们几个人从零开始预训练了一个拥有 1500 万参数的语言模型—— 它已经超出了 Chinchilla 最优的 token 预算——没有集群,没有服务器,也没有预算。训练协调器是一个 GitHub Actions 的 cron 作业。梯度是 pull requests。最终,一个我们从未见过的人加入了进来,并训练了其中的 2300 万个 token。 github.com/commonsense-ai/coop — 模型 + 卡片 · huggingface.co/commonsense-ai/tinystories-15m — 梯度收件箱 — 排行榜
查看原文
Last week a few of us pretrained a 15M-parameter language model from scratch — past its Chinchilla-optimal token budget — with no cluster, no server, and no budget. The training coordinator is a GitHub Actions cron job. The gradients are pull requests. By the end, someone we'd never met had joined and trained 23M tokens of it. github.com/commonsense-ai/coop — Model + card · huggingface.co/commonsense-ai/tinystories-15m — Gradient inbox — Leaderboard