16作者: ivzak5 个月前
我们构建了一个开源代理,它位于编码代理(如 Claude Code、OpenClaw 等)和大型语言模型(LLM)之间,在工具输出进入上下文窗口之前对其进行压缩。<p>演示:<a href="https:&#x2F;&#x2F;www.youtube.com&#x2F;watch?v=-vFZ6MPrwjw#t=9s" rel="nofollow">https:&#x2F;&#x2F;www.youtube.com&#x2F;watch?v=-vFZ6MPrwjw#t=9s</a>。<p>动机:代理在管理上下文方面表现很差。一次文件读取或 grep 操作可能会将数千个 token 倾倒到窗口中,其中大部分是噪声。这不仅昂贵,而且会主动降低质量。长上下文基准测试一致显示,随着上下文的增长,准确性会急剧下降(OpenAI 的 GPT-5.4 评估在 32k 时从 97.2% 下降到 1M 时的 36.6% <a href="https:&#x2F;&#x2F;openai.com&#x2F;index&#x2F;introducing-gpt-5-4&#x2F;" rel="nofollow">https:&#x2F;&#x2F;openai.com&#x2F;index&#x2F;introducing-gpt-5-4&#x2F;</a>)。<p>我们的解决方案使用小型语言模型(SLM):我们查看模型内部结构并训练分类器,以检测上下文的哪些部分携带最多的信号。当工具返回输出时,我们根据工具调用的意图对其进行压缩——因此,如果代理调用 grep 查找错误处理模式,SLM 会保留相关的匹配项并删除其余部分。<p>如果模型稍后需要我们删除的内容,它会调用 expand() 来获取原始输出。我们还在 85% 的窗口容量下进行后台压缩,并延迟加载工具描述,以便模型仅看到与当前步骤相关的工具。<p>该代理还为您提供支出上限、用于跟踪正在运行和过去会话的仪表板,以及当代理等待您时发送的 Slack 提示。<p>代码库在这里:<a href="https:&#x2F;&#x2F;github.com&#x2F;Compresr-ai&#x2F;Context-Gateway" rel="nofollow">https:&#x2F;&#x2F;github.com&#x2F;Compresr-ai&#x2F;Context-Gateway</a>。您可以使用以下命令进行尝试:<p><pre><code> curl -fsSL https:&#x2F;&#x2F;compresr.ai&#x2F;api&#x2F;install | sh </code></pre> 很乐意深入探讨其中的任何内容:压缩模型、延迟工具加载的工作原理,或关于网关的任何其他内容。试用一下,让我们知道您喜欢它!
1作者: niceguy18275 个月前
我开发了 Stint,让我可以给 Claude 设定目标后就放手不管。它会自动将任务分解为并行工作,在隔离的 Git 分支中启动多个 Claude 工作者,并在完成后合并结果。你可以把它想象成一种“即发即弃”的开发方式,并配有一个网络仪表盘实时显示进度。 与其它框架不同,它不需要复杂的设置。只需将目标排队,然后让代理工作即可。每个工作者都有自己的上下文窗口,并直接提交到 Git。 请访问 <a href="https://github.com/ilocn/stint" rel="nofollow">https://github.com/ilocn/stint</a>。欢迎提出评论/反馈。谢谢!
2作者: eugenelotsu5 个月前
Hi HN, 我开发了 Build4Me,旨在解决海外侨胞资助的建筑项目中的信任问题。 许多家庭向国内汇款用于建房,但却缺乏可靠的方式来核实工程是否真的在进行。照片可以被重复使用,进度可能被夸大,或者在资金汇出后项目被搁置。 Build4Me 引入了基于里程碑的资金发放方式,即在释放资金之前,必须对每个建筑里程碑进行验证。 该系统使用以下方式验证进度: * 地理标记照片拍摄 * GPS 位置验证 * AI 图像分析 * 重复图像检测 它运行在无服务器 AWS 架构上,使用了 Rekognition、Bedrock、Lambda、DynamoDB 和 Amazon Location Service 等服务。 欢迎大家对该架构和欺诈检测方法提出反馈意见。