3 分•作者: HenryNdubuaku•6 天前
各位 HN 的朋友,我是 Cactus 的 Henry。
几周前我们在这里发布了 Needle 2,非常感谢大家在讨论串中提供的宝贵反馈!正是基于这些反馈,我们得以快速推出 Needle 3,并希望再次听取大家的意见。
主要特性:
1. **自动化(工具调用和结构化 JSON 输出)**:Needle 的设计初衷并非闲聊,在小型模型中实现通用能力极具挑战,因此我们专注于工具调用和结构化 JSON。如果找不到匹配您请求的工具,将返回一个空列表(在试用演示时请注意)。
2. **智能分层**:每一层(2 到 20 层)都是一个可部署的子网络,使用一套权重,2500 万到 1.21 亿参数(2 位精度),打包为 8-29MB 的二进制文件。在树莓派 5 上,它的解码速度可达 4k token/秒,预填充速度可达 10k token/秒。
3. **Monarch Hadamard MLP**:用三个可学习的、经过 Walsh-Hadamard 初始化和 Kronecker(Monarch)因子分解的 MLP 替换了密集的前馈网络(FFN),并交织了每个通道的对角线缩放、固定的排列、SiLU 非线性激活以及一个基于输入条件控制的秩为 8 的门控。这样,每个 token 都能获得其 d_model 通道的全混合非线性变换,参数量和计算量为 O(d√d),而非密集 4 倍扩展 MLP 的 O(d²)。
4. **性能**:在 Mobile Actions(手机指令,精确匹配调用评分)任务上,20 层模型通过发布的 2 位二进制文件达到了 86.0 的分数;LFM2.5 1.2B 为 82.4,Qwen3.5 0.8B 为 76.0,苹果的设备端模型为 57.6,所有模型均为 f16 精度。更多结果请参见链接,当然我们并非在所有方面都获胜。
5. **多语言支持**:Needle 3 现在支持英语、法语、西班牙语、德语、荷兰语、意大利语和波兰语,更多语言即将推出。
6. **微调**:您可以使用仅 4 层模型在狭窄的任务上达到 DeepSeek v4 Flash 级别的性能,请注意“狭窄任务”这一点,我们发现生产用户通常倾向于在上线前进行微调。
7. **触发器**:对于工具调用,尤其是在 Needle 2 中, grounding 是一个普遍的挑战,因此我们增加了对不区分大小写的正则表达式的支持,以匹配每个请求,从而避免误报。
8. **置信度**:每个响应都附带一个校准过的置信度分数,该分数是基于对完成调用和解码概率的判断取最小值。当置信度高于阈值时执行操作,低于阈值时显示调用并请求,或升级到更大的模型。
9. **支持的平台**:macOS、Linux (x86-64, ARM64, ARMv7, RISC-V 和 MIPS32)、Windows (x64 和 ARM)、Android、iOS、watchOS、tvOS、浏览器(作为 WebAssembly)以及 WASI 组件。
感谢您的阅读,一如既往,欢迎提出您的想法!