返回首页

一周热榜

3作者: psanchez5 天前
你好!我几乎每天都在阅读 HN,已经有 16 年了。我很高兴这个社区的存在。这是我的第一个 Show HN,希望大家觉得这个工具很有用/有趣。 在我的暑假期间,我开始在个人项目中使用最新的 AI 模型。有一次,我开始并行处理同一个项目,并尝试了不同的方法。对我来说效果最好的是克隆仓库,并将工作分配给不同的 AI 代理,并行工作,但使用不同的分支和文件夹。这样我就可以在之后进行审查和合并工作。 问题是,并行启动多个代理具有挑战性。我可以同时处理多个功能和错误修复,但很难跟踪我正在做什么。我从一个任务跳到另一个任务,又回到原来的任务;从一个窗口切换到另一个窗口。这样切换任务会耗费大量的精力。 假期结束了,回到日常工作后,我继续使用类似的方法处理多个项目,但仍然找不到一种不耗费精力的方式来更有效地工作。 这个领域发展非常快,我一直找不到适合自己的工具,于是我决定自己动手做一个。 我想要一个工具,可以帮助我同时管理多个项目,使用多个代理,甚至来自不同提供商的代理,我可以根据项目选择个人或工作订阅,我可以轻松地在工具内审查更改,或者完全委托给代理;一个有快速的快捷方式来导航,我可以安排工作或将工作排队以便代理可以一个接一个地处理任务。 agenttik 是我解决这个问题的方式,可以在并行处理多个项目,同时让我掌控全局。我可以根据需要给予代理足够的自主权,同时保持思路清晰。 我犹豫了几个小时是否要提交,但嘿,“如果你不为你的项目感到羞耻,那就是你提交得太晚了”。 老实说,这个项目只有一周的开发时间,是从零开始的,虽然还处于早期阶段,但对我来说非常有用。我用一周的时间完成了原本需要几个月才能完成的事情,不仅是工具本身,还有其他项目(大部分功劳还在于使用的模型,但如果没有这个工具,我就无法分配所有工作)。 欢迎尝试。以下是我的建议: * 打开你已有的项目 * 添加一个通用的提示(在项目区域)或添加到你的 AGENTS.md/CLAUDE.md(指示它进行常规提交和/或使用分支工作,并提供如何构建有效测试的说明,以便它可以自我纠正)。 * 选择你喜欢的订阅:Claude Code / OpenAI 订阅 / ... * 选择大型模型(Opus High to Max / Fable Medium to Max / Astra Medium to Max)以获得更大的自主性,并尽量不要过度干预。 最后,开始发送/排队你希望产品拥有的所有功能、错误修复等任务,为每个任务使用一个新的提示(Ctrl+T / Cmd+T),我建议使用大型模型以避免投入自己的时间进行审查,然后一旦 LLM 完成,审查并归档该任务或继续迭代。当你想到新的任务时,就继续添加。 当你感到舒适时,可以添加更多项目。 我发现像这样工作时,开发速度非常惊人,我完全沉迷其中。迭代速度简直难以置信。 我很乐意讨论你提出的任何反馈,即使是关于其他工具或目前与 AI 合作的方式!希望你喜欢它!
3作者: Sentralis6 天前
Sentralis.io 是一个专注于加密货币投资组合 HODLer 的风险与情景分析平台。 它将硬核的风险分析能力与智能代理相结合,提供深度洞察,适合初学者和专业人士。 免费账户可完全访问所有情景和风险量化功能。 同时提供 API 和 MCP 访问。
3作者: ilreb2 天前
3作者: HenryNdubuaku3 天前
各位 HN 的朋友,我是 Cactus 的 Henry。 几周前我们在这里发布了 Needle 2,非常感谢大家在讨论串中提供的宝贵反馈!正是基于这些反馈,我们得以快速推出 Needle 3,并希望再次听取大家的意见。 主要特性: 1. **自动化(工具调用和结构化 JSON 输出)**:Needle 的设计初衷并非闲聊,在小型模型中实现通用能力极具挑战,因此我们专注于工具调用和结构化 JSON。如果找不到匹配您请求的工具,将返回一个空列表(在试用演示时请注意)。 2. **智能分层**:每一层(2 到 20 层)都是一个可部署的子网络,使用一套权重,2500 万到 1.21 亿参数(2 位精度),打包为 8-29MB 的二进制文件。在树莓派 5 上,它的解码速度可达 4k token/秒,预填充速度可达 10k token/秒。 3. **Monarch Hadamard MLP**:用三个可学习的、经过 Walsh-Hadamard 初始化和 Kronecker(Monarch)因子分解的 MLP 替换了密集的前馈网络(FFN),并交织了每个通道的对角线缩放、固定的排列、SiLU 非线性激活以及一个基于输入条件控制的秩为 8 的门控。这样,每个 token 都能获得其 d_model 通道的全混合非线性变换,参数量和计算量为 O(d√d),而非密集 4 倍扩展 MLP 的 O(d²)。 4. **性能**:在 Mobile Actions(手机指令,精确匹配调用评分)任务上,20 层模型通过发布的 2 位二进制文件达到了 86.0 的分数;LFM2.5 1.2B 为 82.4,Qwen3.5 0.8B 为 76.0,苹果的设备端模型为 57.6,所有模型均为 f16 精度。更多结果请参见链接,当然我们并非在所有方面都获胜。 5. **多语言支持**:Needle 3 现在支持英语、法语、西班牙语、德语、荷兰语、意大利语和波兰语,更多语言即将推出。 6. **微调**:您可以使用仅 4 层模型在狭窄的任务上达到 DeepSeek v4 Flash 级别的性能,请注意“狭窄任务”这一点,我们发现生产用户通常倾向于在上线前进行微调。 7. **触发器**:对于工具调用,尤其是在 Needle 2 中, grounding 是一个普遍的挑战,因此我们增加了对不区分大小写的正则表达式的支持,以匹配每个请求,从而避免误报。 8. **置信度**:每个响应都附带一个校准过的置信度分数,该分数是基于对完成调用和解码概率的判断取最小值。当置信度高于阈值时执行操作,低于阈值时显示调用并请求,或升级到更大的模型。 9. **支持的平台**:macOS、Linux (x86-64, ARM64, ARMv7, RISC-V 和 MIPS32)、Windows (x64 和 ARM)、Android、iOS、watchOS、tvOS、浏览器(作为 WebAssembly)以及 WASI 组件。 感谢您的阅读,一如既往,欢迎提出您的想法!
3作者: alt_tab5 天前
我们的三个 AWS 生产应用已宕机 13 天。我们原计划在此期间进行市场推广和用户入驻。 我们当时正在处理一个积分问题,AWS 承认是他们的错误并同意修复。但随后他们表示,我们收到的、并据此规划了运营支出的条款实际上无效,因此他们根本不会发放这些积分。 这很重要,因为这是总积分的第二部分,并且双方同意在第一部分到期前发放。因此,当积分未按时发放时,就造成了本应通过第一部分积分避免的问题:第一部分积分到期后,我们的账户逾期,尽管我们已发送多条警报以避免这种情况。 于是我们创建了一个支持工单,以确保我们的正常运行时间,并要求对我们的积分条款进行正式审查。我们被告知我们的账户“信誉良好”。但第二天,我们就失去了访问权限。直到 6 天后,我们在 AWS 的 Reddit 子版块寻求帮助时,才得知账户已被暂停。 现在,我们从支持部门那里得到的信息相互矛盾,他们要求我们在对我们最初创建案例的积分进行任何审查之前,先选择退出积分条款。 我们本不希望在此发帖,但我们一直在原地打转,现在已经 13 天了。 有人知道如何联系到 AWS 的相关人员吗?例如合同部门?谢谢。
3作者: Xyra3 天前
认识一下 Scry,我在这里拥有一个 500 TB 的 NVMe 互联网索引(我正尽力索引和规范化所有智能爆炸的 alpha),你可以对其进行几乎任意的只读 SQL 和部分 Datalog 查询,我通过基于拥塞的微拍卖定价来解决资源争用的问题。当有容量时,非商业用途的服务是免费的。 ---<p>你好。现在是 2026 年,我们正在训练模拟的果蝇大脑来玩 Beat Saber,但我们是否仍然必须被困在互联网(重新)搜索中,将其视为我们无法控制的自然语言 -> 黑箱 -> 排名列表/摘要?<p>长期以来,人们一直试图做一些非常复杂的事情,但最终都通过关系数据库和一点 SQL 来实现。它们有一种吸引力,一个惨痛的教训,就像通用机器学习训练方法的扩展一样。我的意思是,许多信息产品可以建立在本质上是巨大的实时 OLAP 数据库和前沿 LLM 编写的精彩 SQL+Datalog+vector+Jev 等查询之上。<p>Google 搜索、Tavily、Exa 基本上都面临着将你愿意提供的代理上下文映射到其索引的一小部分的问题。你为解决一个极其困难且难度分布的问题支付固定费用,这意味着当他们没有足够的预算计算来帮助你时,你将承担所有不利后果。<p>它们的算法对调用者来说是不透明的,用户几乎没有控制权,也没有机会共同改进搜索配方,就像你信任的用于选择顶尖人工智能构建者的词汇+Jev 配方一样。<p>此外,搜索公司甚至不再追求文本到 SQL 了(几家公司与我谈过)……他们在痛苦的 2024 年文本到 SQL 时代就已经下定了决心。他们只是太早了。<p>希望你喜欢。我打算在差异化硬件上将这种范式扩展到更多数据,因此任何引人注目的用例或查询,我都很乐意展示!
3作者: soundworlds6 天前
我一边使用它一边迭代并添加功能,以创建我自己的音轨。这很可能是一个持续进行中的项目,但目标是让我的整个音乐制作栈开源,并且易于那些试图解构我作品的人解析!
3作者: irusik5 天前
有时我需要快速创建一个填字游戏来学习或练习语言。最近,我发现了一个在线生成器,你可以在其中添加自己的单词和提示,几分钟内就会自动生成一个即用型填字游戏。 你使用什么填字游戏生成器?你知道任何有用的或有趣的、值得推荐的吗? 这是我目前正在使用的:https://www.supercoloring.com/tool/crossword-maker
3作者: wNjdbfm5 天前
和许多人一样,我正在努力理解人工智能的现实与炒作周期之间的区别。我既有使用它的亲身经历,也曾在一家大型科技公司亲眼目睹了在“多做人工智能”的指令下,它被推行开来。即使在这里的讨论中,我们也看到了一个完整的频谱:一些工程师说他们不再写代码,而是管理代理;另一些工程师则认为它因为太愚蠢而基本无用。我一直在寻找市场中我们都能看到的线索(我本想用“信号”这个词,但我不能,因为我不想让你们都认为这是 Claude 写的),这样我们就无需接受“相信我,人工智能已经解决了编程问题”的说法。 我的问题是: 所有的人工智能编写的软件在哪里? 如果编程几乎是一个已解决的问题,如果人工智能让一切都变得如此容易,为什么我们没有看到市场上充斥着我们日常使用并厌恶的软件的廉价替代品? 微软 Office、Adobe 的任何产品、Jira 你可以自己列举。我遇到的每一个设计师都讨厌 Adobe 及其订阅模式。我的公司每年在 Office 365 上花费巨额资金,但每个人都讨厌它。为什么没有替代品出现? 我们是否应该期待这是人工智能“民主化”承诺的一部分? 作为补充:我选择 Office 和 Adobe 只是因为它们是我们经常在科技界抱怨的两个东西,我知道它们现在是平台/生态系统,也许最好说 Word 和 Photoshop 等等,但你可以替换成任何你想要的商业软件。如果人工智能编程可以接管互联网应用领域,难道它不能接管软件应用领域吗?