3 分•作者: phyrex•3 天前
返回首页
一周热榜
3 分•作者: HenryNdubuaku•3 天前
各位 HN 的朋友,我是 Cactus 的 Henry。
几周前我们在这里发布了 Needle 2,非常感谢大家在讨论串中提供的宝贵反馈!正是基于这些反馈,我们得以快速推出 Needle 3,并希望再次听取大家的意见。
主要特性:
1. **自动化(工具调用和结构化 JSON 输出)**:Needle 的设计初衷并非闲聊,在小型模型中实现通用能力极具挑战,因此我们专注于工具调用和结构化 JSON。如果找不到匹配您请求的工具,将返回一个空列表(在试用演示时请注意)。
2. **智能分层**:每一层(2 到 20 层)都是一个可部署的子网络,使用一套权重,2500 万到 1.21 亿参数(2 位精度),打包为 8-29MB 的二进制文件。在树莓派 5 上,它的解码速度可达 4k token/秒,预填充速度可达 10k token/秒。
3. **Monarch Hadamard MLP**:用三个可学习的、经过 Walsh-Hadamard 初始化和 Kronecker(Monarch)因子分解的 MLP 替换了密集的前馈网络(FFN),并交织了每个通道的对角线缩放、固定的排列、SiLU 非线性激活以及一个基于输入条件控制的秩为 8 的门控。这样,每个 token 都能获得其 d_model 通道的全混合非线性变换,参数量和计算量为 O(d√d),而非密集 4 倍扩展 MLP 的 O(d²)。
4. **性能**:在 Mobile Actions(手机指令,精确匹配调用评分)任务上,20 层模型通过发布的 2 位二进制文件达到了 86.0 的分数;LFM2.5 1.2B 为 82.4,Qwen3.5 0.8B 为 76.0,苹果的设备端模型为 57.6,所有模型均为 f16 精度。更多结果请参见链接,当然我们并非在所有方面都获胜。
5. **多语言支持**:Needle 3 现在支持英语、法语、西班牙语、德语、荷兰语、意大利语和波兰语,更多语言即将推出。
6. **微调**:您可以使用仅 4 层模型在狭窄的任务上达到 DeepSeek v4 Flash 级别的性能,请注意“狭窄任务”这一点,我们发现生产用户通常倾向于在上线前进行微调。
7. **触发器**:对于工具调用,尤其是在 Needle 2 中, grounding 是一个普遍的挑战,因此我们增加了对不区分大小写的正则表达式的支持,以匹配每个请求,从而避免误报。
8. **置信度**:每个响应都附带一个校准过的置信度分数,该分数是基于对完成调用和解码概率的判断取最小值。当置信度高于阈值时执行操作,低于阈值时显示调用并请求,或升级到更大的模型。
9. **支持的平台**:macOS、Linux (x86-64, ARM64, ARMv7, RISC-V 和 MIPS32)、Windows (x64 和 ARM)、Android、iOS、watchOS、tvOS、浏览器(作为 WebAssembly)以及 WASI 组件。
感谢您的阅读,一如既往,欢迎提出您的想法!
3 分•作者: dr_scully•3 天前
3 分•作者: Xyra•3 天前
认识一下 Scry,我在这里拥有一个 500 TB 的 NVMe 互联网索引(我正尽力索引和规范化所有智能爆炸的 alpha),你可以对其进行几乎任意的只读 SQL 和部分 Datalog 查询,我通过基于拥塞的微拍卖定价来解决资源争用的问题。当有容量时,非商业用途的服务是免费的。
---<p>你好。现在是 2026 年,我们正在训练模拟的果蝇大脑来玩 Beat Saber,但我们是否仍然必须被困在互联网(重新)搜索中,将其视为我们无法控制的自然语言 -> 黑箱 -> 排名列表/摘要?<p>长期以来,人们一直试图做一些非常复杂的事情,但最终都通过关系数据库和一点 SQL 来实现。它们有一种吸引力,一个惨痛的教训,就像通用机器学习训练方法的扩展一样。我的意思是,许多信息产品可以建立在本质上是巨大的实时 OLAP 数据库和前沿 LLM 编写的精彩 SQL+Datalog+vector+Jev 等查询之上。<p>Google 搜索、Tavily、Exa 基本上都面临着将你愿意提供的代理上下文映射到其索引的一小部分的问题。你为解决一个极其困难且难度分布的问题支付固定费用,这意味着当他们没有足够的预算计算来帮助你时,你将承担所有不利后果。<p>它们的算法对调用者来说是不透明的,用户几乎没有控制权,也没有机会共同改进搜索配方,就像你信任的用于选择顶尖人工智能构建者的词汇+Jev 配方一样。<p>此外,搜索公司甚至不再追求文本到 SQL 了(几家公司与我谈过)……他们在痛苦的 2024 年文本到 SQL 时代就已经下定了决心。他们只是太早了。<p>希望你喜欢。我打算在差异化硬件上将这种范式扩展到更多数据,因此任何引人注目的用例或查询,我都很乐意展示!
3 分•作者: irusik•5 天前
有时我需要快速创建一个填字游戏来学习或练习语言。最近,我发现了一个在线生成器,你可以在其中添加自己的单词和提示,几分钟内就会自动生成一个即用型填字游戏。
你使用什么填字游戏生成器?你知道任何有用的或有趣的、值得推荐的吗?
这是我目前正在使用的:https://www.supercoloring.com/tool/crossword-maker
3 分•作者: wNjdbfm•5 天前
和许多人一样,我正在努力理解人工智能的现实与炒作周期之间的区别。我既有使用它的亲身经历,也曾在一家大型科技公司亲眼目睹了在“多做人工智能”的指令下,它被推行开来。即使在这里的讨论中,我们也看到了一个完整的频谱:一些工程师说他们不再写代码,而是管理代理;另一些工程师则认为它因为太愚蠢而基本无用。我一直在寻找市场中我们都能看到的线索(我本想用“信号”这个词,但我不能,因为我不想让你们都认为这是 Claude 写的),这样我们就无需接受“相信我,人工智能已经解决了编程问题”的说法。
我的问题是:
所有的人工智能编写的软件在哪里?
如果编程几乎是一个已解决的问题,如果人工智能让一切都变得如此容易,为什么我们没有看到市场上充斥着我们日常使用并厌恶的软件的廉价替代品?
微软 Office、Adobe 的任何产品、Jira
你可以自己列举。我遇到的每一个设计师都讨厌 Adobe 及其订阅模式。我的公司每年在 Office 365 上花费巨额资金,但每个人都讨厌它。为什么没有替代品出现?
我们是否应该期待这是人工智能“民主化”承诺的一部分?
作为补充:我选择 Office 和 Adobe 只是因为它们是我们经常在科技界抱怨的两个东西,我知道它们现在是平台/生态系统,也许最好说 Word 和 Photoshop 等等,但你可以替换成任何你想要的商业软件。如果人工智能编程可以接管互联网应用领域,难道它不能接管软件应用领域吗?
3 分•作者: danso•3 天前
3 分•作者: zamir_akimbekov•3 天前
3 分•作者: fouc•5 天前
过去几个月我遇到的模型中,有些非常喜欢使用“gates”这个词,所以现在我也看到人们更频繁地使用这个词。真令人作呕。
我有点惊讶于人们似乎能如此迅速地学会并无意识地使用大型语言模型(LLM)的特有说法。
3 分•作者: eswhang•3 天前
一个我们一直在使用的内部工具,用于协调跨不同机器并行运行的编码代理。只需将频道链接分享给您现有的代理聊天,您的代理就可以实时回复您以及彼此。非常欢迎提供反馈。
3 分•作者: thm•6 天前
3 分•作者: ohans•3 天前
3 分•作者: pwmglenn•5 天前
3 分•作者: alt_tab•5 天前
我们的三个 AWS 生产应用已宕机 13 天。我们原计划在此期间进行市场推广和用户入驻。
我们当时正在处理一个积分问题,AWS 承认是他们的错误并同意修复。但随后他们表示,我们收到的、并据此规划了运营支出的条款实际上无效,因此他们根本不会发放这些积分。
这很重要,因为这是总积分的第二部分,并且双方同意在第一部分到期前发放。因此,当积分未按时发放时,就造成了本应通过第一部分积分避免的问题:第一部分积分到期后,我们的账户逾期,尽管我们已发送多条警报以避免这种情况。
于是我们创建了一个支持工单,以确保我们的正常运行时间,并要求对我们的积分条款进行正式审查。我们被告知我们的账户“信誉良好”。但第二天,我们就失去了访问权限。直到 6 天后,我们在 AWS 的 Reddit 子版块寻求帮助时,才得知账户已被暂停。
现在,我们从支持部门那里得到的信息相互矛盾,他们要求我们在对我们最初创建案例的积分进行任何审查之前,先选择退出积分条款。
我们本不希望在此发帖,但我们一直在原地打转,现在已经 13 天了。
有人知道如何联系到 AWS 的相关人员吗?例如合同部门?谢谢。
3 分•作者: skeptrune•3 天前
嘿,我是 Nick(X 上的 @skeptrptrune)。我一直在利用 AI 完成许多我并不擅长的事情,所以我想尝试购买付费技能,以帮助 AI 更高效地完成这些任务。
例如,合同的红线标注、创建 AI 生成的视频、不同的网站设计等等。
我很想知道这是否能引起这里各位的共鸣。我猜想,一个更偏向工程领域、并且积极拥抱 AI 编码代理的受众,可能会遇到与我当初产生这个想法时相似的问题。
3 分•作者: nnww•6 天前
我一直在构建 Rebuno,一个用于在生产环境中运行 AI 代理的开源执行运行时。它跨越不同框架构建的代理管理执行状态和安全护栏。
代理以 HTTP 服务形式运行。Rebuno 通过签名 Webhook 分派工作,并将执行状态保存在 Postgres 中。代理在执行工具和模型调用之前,将它们作为步骤提交给 Rebuno。
对于每个新步骤,Rebuno 会独立于模型的提示来评估每个代理的 YAML 策略。它可以允许调用、拒绝调用或将其保留以供人工批准。代理执行允许的调用并报告其结果。策略决策和步骤结果都记录在一个仅追加的事件日志中。
中断后,代理会从头开始执行其处理程序。具有已记录结果的步骤将返回这些结果,而不是再次执行。崩溃也可能导致某个工具没有已记录的结果。标记为 safe_to_retry 的工具会再次运行,而标记为 at_most_once 的工具将以不确定状态失败。代理如何处理不确定步骤取决于其实现。
提供了 Python 和 TypeScript SDK,并且该仓库包含使用 LangChain、CrewAI、Pydantic AI、Vercel AI SDK 和 Mastra 的示例。
Rebuno 可免费自托管,并根据 MIT 许可证发布。
我很想听听其他人如何在生产环境中运行或操作代理。
包含图示的博客文章:https://rebuno.io/blog/introducing-rebuno
入门:https://docs.rebuno.io/getting-started
3 分•作者: prakharjohari•5 天前
3 分•作者: lallero317•3 天前
我需要一个公开演示来展示 pappice 的用法,并且我只想绕过公共共享内容的问题(周期性重置、功能禁用、内容限制等)。
解决方案是将包括 SQLite 在内的整个服务器编译成 WASM,并在浏览器中完全运行,这样每个用户现在都有自己的实例,可以随意折腾。
这只是一个 8/9 MB 的压缩下载。
我为这一成就感到非常自豪;这充分展示了 pappice 的轻量级。
3 分•作者: stagas•5 天前
3 分•作者: throwworhtthrow•7 天前