Ask HN:Claude Code 刚把 Opus 的默认上下文窗口提升到 100 万了吗? 1 分•作者: 9wzYQbTYsAIc•5 个月前``` Claude Code v2.1.75 Opus 4.6 · Claude Max ~/Projects/心理学助手 ↑ Opus 现已默认支持 100 万上下文 · 容量提升 5 倍,价格不变 ```
Show HN: Context Gateway – 上下文网关:在发送给大语言模型前压缩 Agent 上下文 16 分•作者: ivzak•5 个月前我们构建了一个开源代理,它位于编码代理(如 Claude Code、OpenClaw 等)和大型语言模型(LLM)之间,在工具输出进入上下文窗口之前对其进行压缩。<p>演示:<a href="https://www.youtube.com/watch?v=-vFZ6MPrwjw#t=9s" rel="nofollow">https://www.youtube.com/watch?v=-vFZ6MPrwjw#t=9s</a>。<p>动机:代理在管理上下文方面表现很差。一次文件读取或 grep 操作可能会将数千个 token 倾倒到窗口中,其中大部分是噪声。这不仅昂贵,而且会主动降低质量。长上下文基准测试一致显示,随着上下文的增长,准确性会急剧下降(OpenAI 的 GPT-5.4 评估在 32k 时从 97.2% 下降到 1M 时的 36.6% <a href="https://openai.com/index/introducing-gpt-5-4/" rel="nofollow">https://openai.com/index/introducing-gpt-5-4/</a>)。<p>我们的解决方案使用小型语言模型(SLM):我们查看模型内部结构并训练分类器,以检测上下文的哪些部分携带最多的信号。当工具返回输出时,我们根据工具调用的意图对其进行压缩——因此,如果代理调用 grep 查找错误处理模式,SLM 会保留相关的匹配项并删除其余部分。<p>如果模型稍后需要我们删除的内容,它会调用 expand() 来获取原始输出。我们还在 85% 的窗口容量下进行后台压缩,并延迟加载工具描述,以便模型仅看到与当前步骤相关的工具。<p>该代理还为您提供支出上限、用于跟踪正在运行和过去会话的仪表板,以及当代理等待您时发送的 Slack 提示。<p>代码库在这里:<a href="https://github.com/Compresr-ai/Context-Gateway" rel="nofollow">https://github.com/Compresr-ai/Context-Gateway</a>。您可以使用以下命令进行尝试:<p><pre><code> curl -fsSL https://compresr.ai/api/install | sh </code></pre> 很乐意深入探讨其中的任何内容:压缩模型、延迟工具加载的工作原理,或关于网关的任何其他内容。试用一下,让我们知道您喜欢它!
Show HN: Stint – 一种即发即弃的 AI 智能体编排工具 1 分•作者: niceguy1827•5 个月前我开发了 Stint,让我可以给 Claude 设定目标后就放手不管。它会自动将任务分解为并行工作,在隔离的 Git 分支中启动多个 Claude 工作者,并在完成后合并结果。你可以把它想象成一种“即发即弃”的开发方式,并配有一个网络仪表盘实时显示进度。 与其它框架不同,它不需要复杂的设置。只需将目标排队,然后让代理工作即可。每个工作者都有自己的上下文窗口,并直接提交到 Git。 请访问 <a href="https://github.com/ilocn/stint" rel="nofollow">https://github.com/ilocn/stint</a>。欢迎提出评论/反馈。谢谢!
约翰·卡马克谈开源与反人工智能活动人士 33 分•作者: tzury•5 个月前<a href="https://xcancel.com/id_aa_carmack/status/2032460578669691171" rel="nofollow">https://xcancel.com/id_aa_carmack/status/2032460578669691171</a>
Show HN: 使用 AWS 验证建筑业的 AI 里程碑 2 分•作者: eugenelotsu•5 个月前Hi HN, 我开发了 Build4Me,旨在解决海外侨胞资助的建筑项目中的信任问题。 许多家庭向国内汇款用于建房,但却缺乏可靠的方式来核实工程是否真的在进行。照片可以被重复使用,进度可能被夸大,或者在资金汇出后项目被搁置。 Build4Me 引入了基于里程碑的资金发放方式,即在释放资金之前,必须对每个建筑里程碑进行验证。 该系统使用以下方式验证进度: * 地理标记照片拍摄 * GPS 位置验证 * AI 图像分析 * 重复图像检测 它运行在无服务器 AWS 架构上,使用了 Rekognition、Bedrock、Lambda、DynamoDB 和 Amazon Location Service 等服务。 欢迎大家对该架构和欺诈检测方法提出反馈意见。