3作者: HenryNdubuaku6 天前
各位 HN 的朋友,我是 Cactus 的 Henry。 几周前我们在这里发布了 Needle 2,非常感谢大家在讨论串中提供的宝贵反馈!正是基于这些反馈,我们得以快速推出 Needle 3,并希望再次听取大家的意见。 主要特性: 1. **自动化(工具调用和结构化 JSON 输出)**:Needle 的设计初衷并非闲聊,在小型模型中实现通用能力极具挑战,因此我们专注于工具调用和结构化 JSON。如果找不到匹配您请求的工具,将返回一个空列表(在试用演示时请注意)。 2. **智能分层**:每一层(2 到 20 层)都是一个可部署的子网络,使用一套权重,2500 万到 1.21 亿参数(2 位精度),打包为 8-29MB 的二进制文件。在树莓派 5 上,它的解码速度可达 4k token/秒,预填充速度可达 10k token/秒。 3. **Monarch Hadamard MLP**:用三个可学习的、经过 Walsh-Hadamard 初始化和 Kronecker(Monarch)因子分解的 MLP 替换了密集的前馈网络(FFN),并交织了每个通道的对角线缩放、固定的排列、SiLU 非线性激活以及一个基于输入条件控制的秩为 8 的门控。这样,每个 token 都能获得其 d_model 通道的全混合非线性变换,参数量和计算量为 O(d√d),而非密集 4 倍扩展 MLP 的 O(d²)。 4. **性能**:在 Mobile Actions(手机指令,精确匹配调用评分)任务上,20 层模型通过发布的 2 位二进制文件达到了 86.0 的分数;LFM2.5 1.2B 为 82.4,Qwen3.5 0.8B 为 76.0,苹果的设备端模型为 57.6,所有模型均为 f16 精度。更多结果请参见链接,当然我们并非在所有方面都获胜。 5. **多语言支持**:Needle 3 现在支持英语、法语、西班牙语、德语、荷兰语、意大利语和波兰语,更多语言即将推出。 6. **微调**:您可以使用仅 4 层模型在狭窄的任务上达到 DeepSeek v4 Flash 级别的性能,请注意“狭窄任务”这一点,我们发现生产用户通常倾向于在上线前进行微调。 7. **触发器**:对于工具调用,尤其是在 Needle 2 中, grounding 是一个普遍的挑战,因此我们增加了对不区分大小写的正则表达式的支持,以匹配每个请求,从而避免误报。 8. **置信度**:每个响应都附带一个校准过的置信度分数,该分数是基于对完成调用和解码概率的判断取最小值。当置信度高于阈值时执行操作,低于阈值时显示调用并请求,或升级到更大的模型。 9. **支持的平台**:macOS、Linux (x86-64, ARM64, ARMv7, RISC-V 和 MIPS32)、Windows (x64 和 ARM)、Android、iOS、watchOS、tvOS、浏览器(作为 WebAssembly)以及 WASI 组件。 感谢您的阅读,一如既往,欢迎提出您的想法!
1作者: oliviajameslaw6 天前
3作者: Xyra6 天前
认识一下 Scry,我在这里拥有一个 500 TB 的 NVMe 互联网索引(我正尽力索引和规范化所有智能爆炸的 alpha),你可以对其进行几乎任意的只读 SQL 和部分 Datalog 查询,我通过基于拥塞的微拍卖定价来解决资源争用的问题。当有容量时,非商业用途的服务是免费的。 ---<p>你好。现在是 2026 年,我们正在训练模拟的果蝇大脑来玩 Beat Saber,但我们是否仍然必须被困在互联网(重新)搜索中,将其视为我们无法控制的自然语言 -> 黑箱 -> 排名列表/摘要?<p>长期以来,人们一直试图做一些非常复杂的事情,但最终都通过关系数据库和一点 SQL 来实现。它们有一种吸引力,一个惨痛的教训,就像通用机器学习训练方法的扩展一样。我的意思是,许多信息产品可以建立在本质上是巨大的实时 OLAP 数据库和前沿 LLM 编写的精彩 SQL+Datalog+vector+Jev 等查询之上。<p>Google 搜索、Tavily、Exa 基本上都面临着将你愿意提供的代理上下文映射到其索引的一小部分的问题。你为解决一个极其困难且难度分布的问题支付固定费用,这意味着当他们没有足够的预算计算来帮助你时,你将承担所有不利后果。<p>它们的算法对调用者来说是不透明的,用户几乎没有控制权,也没有机会共同改进搜索配方,就像你信任的用于选择顶尖人工智能构建者的词汇+Jev 配方一样。<p>此外,搜索公司甚至不再追求文本到 SQL 了(几家公司与我谈过)……他们在痛苦的 2024 年文本到 SQL 时代就已经下定了决心。他们只是太早了。<p>希望你喜欢。我打算在差异化硬件上将这种范式扩展到更多数据,因此任何引人注目的用例或查询,我都很乐意展示!
1作者: brachkow6 天前
Things To Have 是一款愿望清单应用。我于 2022 年开始将其作为一项副业项目为朋友们开发,然后在 2024 年将其打造成一款严肃的应用。 我开发它的原因是我不喜欢其他同类应用——它们要么过于短暂,要么仅限于特定用例,要么感觉像电视购物频道。 我想开发一款能够让用户平静下来,并能满足有想法的买家、收藏家和爱好者的应用。我也没忘记生日,所以应用中加入了预订和其他生日相关的便利功能。 由于它一直是一个业余/热情项目,我并不在意“上市时间”,并过度设计了许多东西。例如,它为每张图片都提供了支持透明度的 BlurHash,拥有许多未宣传的拖放交互(类似于 macOS),以及 1001 种将文件上传到表单的方式等等。 它还由一个独特的栈驱动:它运行在 Cloudflare Workers 和 D1 上,代码使用 Hono (https://hono.dev/) 和 Vue 编写,并通过一个自定义的 Inertia (https://github.com/brachkow/hono-inertia) 适配器连接。我还使用 better-result (https://better-result.dev/) 为 JavaScript 带来合理的错误处理。所有这些都使得编写全栈应用变得可扩展、廉价且极其简单,感觉就像传统的 MVC。 我相信我的应用在已成熟的应用和那些平淡无奇的竞争对手中脱颖而出,值得您尝试。即使不尝试,我也希望您至少觉得其中列出的技术很有趣……