2 分•作者: py4•大约 2 个月前
尽管我对生成式人工智能(GenAI)的进展可能影响我的职业生涯感到担忧,但我对其在个性化学习方面的应用感到兴奋。您是如何利用大型语言模型(LLMs)更好地学习高级技术知识的?<p>例如,苏格拉底式提问法
11 分•作者: HenryNdubuaku•大约 2 个月前
大家好,我是 Cactus 的 Henry! 我们之前发布了 Cactus Needle,一个 14MB 的智能 LLM,用于手机、可穿戴设备、智能家居、小型机器人和微控制器上的工具调用、设备使用和结构化提取。我们在这里收到了非常好的反馈,并根据大家的建议发布了 Needle 2。 整个模型是一个单一的 14MB 二进制文件,在 28MB RAM 中运行完整的会话;拥有 4500 万参数,采用 2bit 压缩。Needle 在树莓派 5 上可以达到 500 tokens/秒 的解码速度,在 Meta Quest 3S 和 Apple Vision Pro 等 VR 设备上速度介于 400-1500 tokens/秒 之间,在三星 A 系列等低于 200 美元的手机上速度范围为 300-700 tokens/秒。 在工具调用和移动设备使用基准测试中,Needle 2 与 LFM2.5 230M 和 Apple Foundation Model 等最接近的小型模型相比,在 5 倍到 70 倍更小的体积下,在 f16 精度下表现相当,而 Needle 2 使用的是 2bit 精度。Needle 基于我们论文中的简单注意力网络(https://arxiv.org/abs/2607.18363)。 最近,边缘 AI 主要指 Mac 和 PC,但这只是当今全球 210 亿连接 IoT 设备中的 15 亿。在新兴市场,大多数手机售价低于 200 美元,没有 NPU,GPU 也很便宜。这些设备包括入门级手机、树莓派、微控制器、可穿戴设备、Reachy Mini 等小型机器人以及智能家居设备。 一个与 Needle 宽度和深度相当的传统 Transformer 模型每个 token 需要 164 MFLOPs,即使是压缩到 Needle 参数数量的模型也需要 87 MFLOPs,而 Needle 仅需 70 MFLOPs。即使在高端手机上,一个始终在线的助手也必须在功耗预算内运行;每个 MFLOP 都代表毫瓦时,Needle 每个 token 的 MFLOPs 比最小的性能 LLM 少 7 到 85 倍。有关架构的更多信息,请参阅链接。 当我们为消费类设备构建智能时,将其结构化为带有类型化参数的函数,唯一困难的部分是将一个混乱的句子映射到这些函数上;即哪个函数,以及使用哪些参数。我们的研究发现,当这样表述时,这个问题不需要世界知识,也不需要开放式的散文,这就是为什么 4500 万参数就足够了。 Needle 2 扩展到结构化提取,其中模式可以代替工具传入,模型会返回结构化输出。您可以将 Needle 用作文本分类模型(带有枚举字段),用作摘要模型(通过提供提取关键字段的模式),除了自由形式的解码之外,几乎可以完成所有任务。 每个产品都有自己的工具词汇表,微调 Needle 可以帮助它在自定义任务上达到前沿水平的性能。因此,使用 Python 包(https://github.com/cactus-compute/needle),可以在几分钟到几小时内,在 Mac/PC 上对 Needle 进行微调,并带有自动化的数据生成管道,只需提供几个样本即可。 尽管如此,每个响应都带有基于我们 Cactus Hybrid 技术的学习置信度分数。如果高于您的阈值,则执行操作;低于阈值,则升级到云端或更大的模型。将 Needle 2 与私有的 DeepSeek-v4-Flash 部署结合使用,对于企业级任务来说效果尤其好,成本几乎可以忽略不计,我们可以协助进行此设置。 我们对 Needle 2 进行了大量思考,但可能仍有许多不足之处,请使用提供的链接中的 Playground 来测试 Needle 并分享您的想法,我们非常感谢!