1 分•作者: fatihturker•6 个月前
大家好,
我开发了 OpenGraviton,一个开源的 AI 推理引擎,旨在挑战在消费级硬件上运行超大型 LLM 的极限。通过结合 1.58 位三元量化、基于 Top-K 剪枝的动态稀疏性、MoE 路由以及基于 mmap 的层流技术,OpenGraviton 能够运行远大于系统 RAM 的模型——即使在 Mac Mini 上也能实现。
初步基准测试结果:
* TinyLlama-1.1B 从大约 2GB(FP16)降至大约 0.24GB(使用三元量化)。
* 在 1400 亿参数规模下,通常需要大约 280GB 的模型,现在压缩到大约 35GB。
* 针对 Apple Silicon 进行了优化,采用 Metal + C++ 张量解包,以及用于加速生成的推测解码。
可以在这里查看基准测试结果、架构和详细信息:<https://opengraviton.github.io>
GitHub:<https://github.com/opengraviton>
这个项目的意义不仅仅在于将庞大的模型压缩到小型硬件上——更在于实现无需云成本即可访问巨型 LLM 的民主化。欢迎提供反馈、Fork 和想法!