3 分•作者: zamir_akimbekov•3 天前
返回首页
一周热榜
3 分•作者: HenryNdubuaku•3 天前
各位 HN 的朋友,我是 Cactus 的 Henry。
几周前我们在这里发布了 Needle 2,非常感谢大家在讨论串中提供的宝贵反馈!正是基于这些反馈,我们得以快速推出 Needle 3,并希望再次听取大家的意见。
主要特性:
1. **自动化(工具调用和结构化 JSON 输出)**:Needle 的设计初衷并非闲聊,在小型模型中实现通用能力极具挑战,因此我们专注于工具调用和结构化 JSON。如果找不到匹配您请求的工具,将返回一个空列表(在试用演示时请注意)。
2. **智能分层**:每一层(2 到 20 层)都是一个可部署的子网络,使用一套权重,2500 万到 1.21 亿参数(2 位精度),打包为 8-29MB 的二进制文件。在树莓派 5 上,它的解码速度可达 4k token/秒,预填充速度可达 10k token/秒。
3. **Monarch Hadamard MLP**:用三个可学习的、经过 Walsh-Hadamard 初始化和 Kronecker(Monarch)因子分解的 MLP 替换了密集的前馈网络(FFN),并交织了每个通道的对角线缩放、固定的排列、SiLU 非线性激活以及一个基于输入条件控制的秩为 8 的门控。这样,每个 token 都能获得其 d_model 通道的全混合非线性变换,参数量和计算量为 O(d√d),而非密集 4 倍扩展 MLP 的 O(d²)。
4. **性能**:在 Mobile Actions(手机指令,精确匹配调用评分)任务上,20 层模型通过发布的 2 位二进制文件达到了 86.0 的分数;LFM2.5 1.2B 为 82.4,Qwen3.5 0.8B 为 76.0,苹果的设备端模型为 57.6,所有模型均为 f16 精度。更多结果请参见链接,当然我们并非在所有方面都获胜。
5. **多语言支持**:Needle 3 现在支持英语、法语、西班牙语、德语、荷兰语、意大利语和波兰语,更多语言即将推出。
6. **微调**:您可以使用仅 4 层模型在狭窄的任务上达到 DeepSeek v4 Flash 级别的性能,请注意“狭窄任务”这一点,我们发现生产用户通常倾向于在上线前进行微调。
7. **触发器**:对于工具调用,尤其是在 Needle 2 中, grounding 是一个普遍的挑战,因此我们增加了对不区分大小写的正则表达式的支持,以匹配每个请求,从而避免误报。
8. **置信度**:每个响应都附带一个校准过的置信度分数,该分数是基于对完成调用和解码概率的判断取最小值。当置信度高于阈值时执行操作,低于阈值时显示调用并请求,或升级到更大的模型。
9. **支持的平台**:macOS、Linux (x86-64, ARM64, ARMv7, RISC-V 和 MIPS32)、Windows (x64 和 ARM)、Android、iOS、watchOS、tvOS、浏览器(作为 WebAssembly)以及 WASI 组件。
感谢您的阅读,一如既往,欢迎提出您的想法!
3 分•作者: lallero317•3 天前
我需要一个公开演示来展示 pappice 的用法,并且我只想绕过公共共享内容的问题(周期性重置、功能禁用、内容限制等)。
解决方案是将包括 SQLite 在内的整个服务器编译成 WASM,并在浏览器中完全运行,这样每个用户现在都有自己的实例,可以随意折腾。
这只是一个 8/9 MB 的压缩下载。
我为这一成就感到非常自豪;这充分展示了 pappice 的轻量级。
3 分•作者: nsoonhui•1 天前
3 分•作者: stagas•5 天前
3 分•作者: skeptrune•3 天前
嘿,我是 Nick(X 上的 @skeptrptrune)。我一直在利用 AI 完成许多我并不擅长的事情,所以我想尝试购买付费技能,以帮助 AI 更高效地完成这些任务。
例如,合同的红线标注、创建 AI 生成的视频、不同的网站设计等等。
我很想知道这是否能引起这里各位的共鸣。我猜想,一个更偏向工程领域、并且积极拥抱 AI 编码代理的受众,可能会遇到与我当初产生这个想法时相似的问题。
3 分•作者: ohans•3 天前
3 分•作者: hackernj•4 天前
3 分•作者: rylando•6 天前
正在寻找大家如何或通过哪些服务来管理年迈亲属的密码?1Password 仍然是首选吗?
3 分•作者: prakharjohari•5 天前
3 分•作者: danielbilekq•5 天前
3 分•作者: robotrobot•5 天前
我一直在尝试 Fable 5.1,以及它从合理的 PRD(产品需求文档)出发一击即成的能力,然后进行后续跟进/评估其工作成果,再通过工单堆栈和循环进行创建/改进。这是一个周五下午的原型,玩起来很有趣。请享用!
3 分•作者: throwworhtthrow•7 天前
3 分•作者: muzan•5 天前
你好朋友,我刚开始学习渗透测试。希望你能根据你的经验指导我,并给我一些建议。谢谢。
3 分•作者: ljedrz•6 天前
3 分•作者: Lio•3 天前
3 分•作者: gfysfm•3 天前
3 分•作者: jakemanger•3 天前
我在查看 Neovim 网站底部的捐赠信息时,看到了一个比特币捐赠地址。
我想查一下他们收到了多少捐赠。我发现了一个来自 2023 年的巨额捐赠,高达 10 个比特币(现在价值 80 万美元……)。
根据活动历史记录,Neovim 上一次从该地址转出比特币是在 2019 年,所以他们至少有 7 年没有动用这笔资金了。
Neovim 项目的任何人知道这件事吗?
这笔资金似乎是一笔相当可观的数额,就这么放在那里。我每天都使用 Neovim,希望这笔钱能得到善用。
https://www.blockchain.com/explorer/addresses/btc/1Evu6wPrzjsjrNPdCYbHy3HT6ry2EzXFyQ
3 分•作者: newshackee•6 天前
一个 GitHub 仓库在一周内获得了 3,278 颗星,其中一天达到了 573 颗星的峰值。其相关的论文也在 Hugging Face 热门论文榜上名列第一。
在此期间,该仓库页面显著地将 @karpathy(Andrej Karpathy)列为贡献者,包括他的 GitHub 账号/头像。
相关的提交是由 @karpathy 署名并提交的。GitHub API 显示该提交未签名。
随后,一个 GitHub issue 质疑了这一点,称 Karpathy 从未做出贡献。该项目随后删除了该提交。
伪造 Git 提交作者元数据是一个已知的问题。这里有趣的是 GitHub 如何将该元数据作为可见的贡献者身份呈现出来,以及这在特定情况下可能扮演的角色。
参考:
https://github.com/EvoMap/AutoResearch/issues/8
https://github.com/EvoMap/AutoResearch/commit/4606e68
https://huggingface.co/papers/2608.17906
3 分•作者: oliculipolicula•3 天前