2作者: greggman654 个月前
这几乎完全是由 Claude 创作的,不是我。我知道有些人不喜欢这样。我三个月前也是其中之一。从今年年初开始,我终于开始认真尝试人工智能了。我工作的公司也举办了人工智能周,有很多培训。我只能说我非常震惊。过去一个月,我的整个生活都变了,从一个主要写代码的人变成了一个主要提示人工智能写代码的人。为了稍微说明一下,我今年 60 岁,从 1980 年就开始写代码了。 我理解所有担忧,并且我在工作中审查所有人工智能代码,以及大部分个人项目的人工智能代码。但对于这个项目,我没有投入那么多。我知道这不受欢迎,但这只是一个小型、范围有限的个人项目。并不是说我没有注意,Claude 确实以一些奇怪的方式做了一些事情,我经常要求它修复它们。但反过来,我没有任何 Rust 经验,没有任何 OpenXR 经验,没有任何 wgpu 经验,几乎没有任何相关的 Windows 经验。 我估计总共花了大约 30 个小时来提示 Claude 完成每个步骤。我开始时是“制作一个打开窗口的 Windows 应用程序”。然后我让它添加 wgpu 并绘制 hello 三角形。然后我让它添加 OpenXR 并在 VR 中绘制这些三角形。这实际上花了一些时间,因为它试图弄清楚如何将 wgpu 纹理连接到在 OpenXR 中绘制的表面。但它还是弄清楚了,比我自己快得多。如果是我,我会尝试找到一个可用的例子或者放弃。 然后我搁置了一个月左右,终于在本周末重新开始,并迅速让 Claude 使其工作。我唯一做的事情是制作了一些程序员艺术图标。 如果有人感兴趣,我可以把提示发布在仓库里,假设我能找到它们。 另外,在过去的 2 周里,我复活了一个旧项目,这个项目已经腐烂了。Claude 让它保持了最新状态,修复了一堆错误,并完成了我一直想添加的一堆功能。我还让 Claude 编写了 2 个库,一个 zip 库,一个 rar 解压缩库,以及重构了一个现有的 zip 解压缩库以使用一些现代功能。这真的很有趣!对于这些,我比对这个项目阅读了更多的代码。尽管如此,“这是一个多么美好的时代”!
1作者: Kaibeezy4 个月前
1作者: _nhynes4 个月前
大家好,HN。鉴于伯克利 RDI 基准测试完整性文章最近在这里引起了广泛关注 [0],现在似乎是分享 Amber 的好时机了,这项工作旨在使代理基准测试更容易复现。<p>Amber 源于 RDI AgentX-AgentBeats 基准测试竞赛 [1],该竞赛邀请公众提交代理。为了确保结果的可信度,我们需要提交的内容具有可复现性并有清晰的来源。可复现性促使对基准测试进行声明式规范,而来源促使能够在托管硬件上安全有效地运行基准测试。一旦你增加了对多阶段多代理基准测试(如狼人杀)的支持,Amber 的设计就基本完成了。<p>Amber 的灵感来自于 Fuchsia OS 组件框架。Amber 的安全模型是,像 A2A 代理或 MCP 工具这样的组件只为明确被赋予使用它的能力的组件提供服务。在基准测试的背景下,这意味着被测试的代理无法访问评估器,并且工具可以在基准测试的后期被撤销。<p>Amber 是编译器和运行时系统的结合:编译器将描述代理、工具以及它们如何相互连接的清单转换为确定性计划。该计划可以针对不同的后端执行,如 Docker、K8s、KVM 或主机操作系统。编译器注入必要的运行时组件以强制执行能力模型:侧车路由器,提供组件之间的受保护连接,以及后端控制器,允许组件在运行时创建和销毁组件。<p>Amber 最初只使用静态的 `docker compose`,但像 TerminalBench 和 OSWorld 这样的基准测试需要添加动态组件和基于 VM 的组件。然后,竞赛参与者希望有一种更简单的方法在本地进行测试,而无需反复重建 Docker 镜像,因此 Amber 获得了原生二进制支持和一个单行命令 `amber run` 接口。从 Fuchsia 借用的概念到目前为止一直保持良好。目前,我正在努力使 Amber 的可观察性跟踪可用于基准测试评估器,以便它可以根据代理所采取的路径进行判断,而不仅仅是最终答案。<p>总的来说,我们设定的目标是在低信任环境中轻松复现代理基准测试结果。Amber 并非一个完整的解决方案,但它减轻了基准测试作者和代理构建者的部分负担。也许它甚至可以用于基准测试之外的领域。我很乐意大家来探讨这个概念框架!<p>AgentBeats tau2 基准测试清单 [2] 是一个真实的例子。树内混合站点示例 [3] 是使用 `amber run` 的 Amber 端到端的一个简单演示。<p>[0]: <a href="https:&#x2F;&#x2F;news.ycombinator.com&#x2F;item?id=47733217">https:&#x2F;&#x2F;news.ycombinator.com&#x2F;item?id=47733217</a><p>[1]: <a href="https:&#x2F;&#x2F;rdi.berkeley.edu&#x2F;agentx-agentbeats.html" rel="nofollow">https:&#x2F;&#x2F;rdi.berkeley.edu&#x2F;agentx-agentbeats.html</a><p>[2]: <a href="https:&#x2F;&#x2F;github.com&#x2F;RDI-Foundation&#x2F;tau2-agentbeats&#x2F;blob&#x2F;main&#x2F;amber&#x2F;amber-scenario.json5" rel="nofollow">https:&#x2F;&#x2F;github.com&#x2F;RDI-Foundation&#x2F;tau2-agentbeats&#x2F;blob&#x2F;main&#x2F;...</a><p>[3]: <a href="https:&#x2F;&#x2F;github.com&#x2F;RDI-Foundation&#x2F;amber&#x2F;tree&#x2F;main&#x2F;examples&#x2F;mixed-site" rel="nofollow">https:&#x2F;&#x2F;github.com&#x2F;RDI-Foundation&#x2F;amber&#x2F;tree&#x2F;main&#x2F;examples&#x2F;m...</a>
1作者: windystockholm4 个月前
Hi HN, 我意识到我每天都在追踪代码,却忽略了我的健康。 所以我开发了 GitBalance,像提交代码一样记录锻炼,并将它们可视化为贡献图。 你甚至可以通过 CLI 来操作: gitbalance commit -m "30 分钟锻炼" gitbalance commit -m "拉伸 + 手腕恢复" 这是一个非常早期的 MVP——好奇这是否能引起共鸣。