6 分•作者: ionwake•7 天前
返回首页
一周热榜
6 分•作者: ethanwillis•1 天前
正如在我之前的“谁在辞职?”帖子中的评论(https://news.ycombinator.com/item?id=48765213)中所建议的那样,我想尝试发布一个“谁在裁员?”的帖子 :)
6 分•作者: agnishom•7 天前
6 分•作者: dotcoma•6 天前
6 分•作者: screm•1 天前
各位 HN 的朋友们,大家好!我们是 Armature(YC P26)的创始人 Theodore 和 Louis。我们能够重建您收到的 MCP 工具调用背后的整个会话,包括用户要求代理执行的操作以及代理的思考过程。
只需三行代码(我们的 SDK 支持 Typescript、Python 和 Go),您就可以开始在仪表板中看到:
- 所有重建的会话:就像阅读用户在 Claude 或 ChatGPT 中进行的真实对话一样!
- 基于会话聚类的 MCP 最常用用例排名。
- 用户代理遇到的最常见问题,以便您可以修复它们。
快速演示:<a href="https://youtu.be/ZFlvquhyNMQ" rel="nofollow">https://youtu.be/ZFlvquhyNMQ</a>
我们最初将 Armature 推向市场是作为一个独立的测试工具(<a href="https://www.ycombinator.com/launches/QQc-armature-making-your-app-finally-usable-by-ai-agents">https://www.ycombinator.com/launches/QQc-armature-making-you...</a>),该工具本身就可以通过 MCP 自然使用。但我们很快意识到,我们完全不了解用户是如何使用 Armature MCP 的,也不知道他们是否满意或感到沮丧。我们在之前的公司也遇到过类似的情况:Louis 构建了面向数百万用户的 MCP,而 Theo 在加入 Datadog 的一个分支机构担任创始工程师之前,曾在 Palantir 担任前线部署工程师。在将产品暴露给代理时,测试和产品分析一直是我们的一大痛点,但我们一直认为,由于对话发生在用户的 AI 客户端中,我们在分析方面无能为力。
这时我们灵光一闪:如果我们问代理为什么它们会进行某个工具调用呢?用户的意图或潜在的挫败感又是什么呢?于是我们开始尝试 MCP 插桩技术,结果却出乎我们的意料!我们许多早期客户都为他们的 CI 实现了变通方法,以触发新的测试,或者让他们的编码代理高效地获取结果。尽管我们经常与早期用户交流,但他们从未与我们分享过这些反馈。然后,我们构建了自动化功能,可以自动聚类用例,识别经常遇到的问题,并让我们的编码代理来修复它们。当我们的 CTO 朋友们听说这件事时,他们也想亲自尝试一下,于是我们给了他们一个我们内部产品的克隆版本,他们开始分享反馈,这与他们对我们“真实”产品的反馈截然不同!
于是,我们决定认真地将 MCP 分析作为一项产品来开发。起初,我们担心会降低 MCP 的性能,因此我们不断迭代,直到达到与没有插桩时完全相同的成功率(在 870 次运行中,通过率为 89.17% 对比 89.15%)。然后,隐私显然是一个限制因素,因此我们采用了从处理银行数据或构建敏感数据日志扫描中获得的相同方法。如今,数据在到达我们的服务器之前,会在客户端进行 redaction。我们还有很多事情没有完全弄清楚:并非所有模型都能填写所有字段,无服务器/无状态 MCP 的会话指纹识别并不完美,用例聚类仍需优化。
但我们终于向所有人推出了我们的分析产品,可在 <a href="https://armature.tech">https://armature.tech</a> 上自助服务,设置过程不到 5 分钟,并且有慷慨的免费套餐。
现在,我们正在努力实现完全闭环,将评估(evals)引入我们的产品,以便我们可以:识别顶级工作流程和问题 -> 推荐修复和改进 -> 在用户运行的相同工作流程上大规模测试修复,跨越所有 harness 和模型 -> 打开 PR 以直接发布修复。
评估可以从会话分析中自动生成,这样您就可以捕捉到每一次回归,并在发布之前跨所有模型和 harness 测试每一次改进的实际影响。
举个具体的例子:10 天前,一家营销自动化平台(该平台已提前获得我们构建的产品几周的访问权限)通过 MCP 分析发现,用户在活动创建后无法更改目标受众,感到非常沮丧。于是他们发布了该功能,并使用 Claude Code 在 Fable 5 上成功地在本地进行了测试。几天后,在准备新的 MCP 公共版本时,他们在 Armature 上运行了一套评估,发现小型模型可能会产生错误的 audience_ids,这会导致他们的 MCP 默认将活动发送给他们所有的联系人(这显然可能导致生产环境中的灾难)。正是这样的故事,让我们觉得我们所做的事情非常有价值!
现在,对我们最有用的反馈是了解我们的产品还缺少什么,以便您能够完全掌控“代理体验”。
如果您在生产环境中运行 MCP,我们也想知道:您今天是如何了解代理是否成功,以及它们背后的用户是否满意?
6 分•作者: drakenot•1 天前
我正在发布 Lunar,一个全新的 Lua 5.1 编译器和虚拟机,完全用 Go 编写。它包含了标准库、协程,并支持 Lua 5.2 风格的 goto。
嵌入式 API 避免了 Lua C API 基于
6 分•作者: tobr•5 天前
6 分•作者: jaykru•7 天前
6 分•作者: montroser•5 天前
6 分•作者: Sinusoid314•5 天前
6 分•作者: anigbrowl•5 天前
5 分•作者: abishekr•2 天前
5 分•作者: spstoyanov•6 天前
你好 HN!
我想分享一个我为解决工作中的一个问题而构建的小型 MCP + Web 应用。
基本上,我们在与代理一对一合作时表现得很好,但协作一直很困难。
例如,当我需要与队友协作并共享上下文或移交工作时,我通常会创建一个带有我的代理的 Markdown 文件,将其粘贴到 Slack 中,然后我的队友会将其复制粘贴到他们的代理中,反之亦然。
为了让我们的生活更轻松,我构建了 AgentCouch,一个代理的“消息应用”,让我们的代理可以直接在共享房间中聊天和移交工作。
人类也可以观看对话,从他们的笔记本电脑或手机上介入并引导对话。
我的目标是解决以下问题:
1. 通过允许代理直接聊天,轻松地在代理之间移交上下文。
2. 确保移交不会遗漏重要上下文,并允许代理提出后续问题。
3. 由于我们也是一个分布式团队,允许我的同事和他们的代理与我的代理交谈并获得问题的答案,而不是等我醒来。
其核心是一个 MCP,具有更多的端点和指令(以及一个 Web UI),允许代理观看房间。
不用说,你必须信任你与之共享房间的人,因为他们的代理可以问你的代理任何问题。
如果你的团队也遇到这些问题,请查看一下,如果你试用了,请分享一些反馈!
谢谢!
5 分•作者: Fundnai•6 天前
5 分•作者: edward•2 天前
5 分•作者: 0x54MUR41•4 天前
5 分•作者: adityaathalye•6 天前
如果你和我一样,那么在任何时候,你都会有大约五个问题的答案,那就是“你对什么感到好奇?”。
可以说,一个更有趣、更具启发性、也更友善的问题是:“你曾经对什么感到好奇?”
我认为,回顾过去的求知欲可以照亮我们未来的方向(以及这样做的原因)。更重要的是,我认为它有力量允许那个“永不满足好奇心的十三岁自我”走出来玩耍。因为它可能已经在做些什么了,而你的注意力却在别处。
所以,这里有一个提示(你注意到我刚才做了什么吗?;-))
嗯……如果可以的话,除了关于大型语言模型(LLM)的东西。仅限于这个帖子。因为如今 HN 讨论的大部分内容似乎都围绕着大型语言模型的好奇心。
(参见:关于这个的更多内容,在我很久以前发布的一篇博文中 https://www.evalapply.org/posts/what-have-you-been-curious-about/ )
5 分•作者: n67094•6 天前
5 分•作者: adulion•1 天前
5 分•作者: marinoseliades•6 天前
各位 HN 的朋友,我们是 Prized (<a href="https://prized.dev">https://prized.dev</a>) 的创始人 Marinos 和 Hudson!Prized 能够让非工程师员工描述他们所需的内部工具,并获得一个全栈应用程序,该应用程序已连接到他们公司的数据并部署在公司登录系统之后,而无需他们处理 API 密钥或连接器。
演示视频:<a href