2 分•作者: theceka•3 个月前
各位 HN 用户: 这最初源于我个人的好奇心,并在 Claude 的帮助下得以实现。 “宁静地图”每小时会读取全球 98 台宽频地震仪的数据。通常情况下,4-14 Hz 频段的地面振动是由人类活动引起的——例如交通、火车、脚步声等。每个站点的数据都会与其在一天中同一时段的历史数据进行比较,地图会标出当前最接近自身正常水平的地点:也就是此刻地球上最宁静的地方。 希望您喜欢,并非常期待您的反馈!
1 分•作者: jnowlan21•3 个月前
刚刚推出了一款文档扫描器,它能够整合货运单据,并结合我们的信任评分和数据来检测欺诈行为。
1 分•作者: shanrizvi•3 个月前
CozoDB,一个用 Rust 编写的、嵌入 Datalog 的事务性关系-图-向量数据库,于 2024 年 12 月停止维护。我们将其硬分叉为 MnesticDB(非 CozoDB 官方项目),并采用 MPL-2.0 许可协议,以延续 Ziyang Hu 和 Cozo 项目作者构建“AI 的海马体”或代理记忆的愿景。 但代理记忆并非仅仅是一堆当前事实和过去决策的日志。它必须能够追踪随时间发生的变化,并且是可审计的。我们最近发布了多项使之成为可能的新功能。 首先,我们区分了有效时间(事实在世界中成立的时间)和事务时间(数据库何时相信该事实)。这实现了时间旅行,允许在任何时间点审计记忆,并查看任何过去的决策是基于何种知识。每一次写入都从一个防崩溃的单调提交时钟获取其事务时间,这是一个持久化在同一事务中的原子高水位标记,该事务同时提交数据。因此,即使在崩溃后,时钟也无法在写入未成功的情况下前进。由于时间戳是在提交关键部分分配的,事务时间顺序等于提交顺序等于可见性顺序,这使得时间旅行变得可靠。 接着,我们实现了 Green 等人 2007 年论文中的半环溯源框架:通过交换组合运算符,同一个递归规则可以计算存在性、成本、置信度或支持证据,而无需为每个应用程序定制跟踪系统。实际上,像 `min_cost_k` 这样的聚合不仅返回一个答案,还返回其背后的 k 个最佳推导,每个推导都附带证明其合理性的证据链。由于这些注解是普通值,将推导具体化为事务时间关系可以将这两个特性组合成一个带注解的信念历史。每个推导都带有我们相信它的事务时间,因此“as-of”读取不仅告诉你我们在 T 时刻的信念,还告诉你为什么。 之后,我们进行了一些其他改进: - 添加了 `::kill` 和 `:timeout`,以提供中断长时间运行查询的能力。 - 实现了一个确定性的贪婪连接重排序,以防止 LLM 可能编写的、无脑排序的合取式查询导致性能问题。在结果相同的情况下,性能提升了 54.5 倍。 - 添加了一个可选的 Yannakakis 风格的每键因子化 `count()`,取代了连接枚举,性能提升了 4-342 倍,结果完全相同。 MnesticDB 已在 crates.io 和 PyPI 上发布。 [https://crates.io/crates/mnestic](https://crates.io/crates/mnestic) [https://pypi.org/project/mnestic/](https://pypi.org/project/mnestic/) 如果您正在构建代理记忆,并希望在图数据库中集成时间旅行和溯源功能,而不是事后添加,我很乐意与您交流心得。 特别感谢 Matthias Autrata 提供的宝贵反馈和指导,这对实现上述改进至关重要。
4 分•作者: fenilsuchak•3 个月前
我是 Fenil,OpenFunnel(YC F24)的联合创始人兼首席执行官,我和我的联合创始人兼首席技术官 Aditya 一起创建了这个项目。我们正在推出 OpenBenchmarks (https://openbenchmarks.com),这是一个针对 SaaS API 的开源、可复现的基准测试工具,我们从最熟悉的领域入手:GTM API。 ## 我们为什么要做这个 越来越多的 B2B 软件评估将通过代理工作流中的推理模型进行,而不是通过人工。买家也越来越倾向于选择 API 优先且提供 MCP(最小可行产品)的供应商,以便他们能够将其集成到内部工作流中。 强大的推理模型对营销持怀疑态度。当有真正中立的基准测试可用时,它们会忽略 SEO 和自发布的基准测试,并且在任何看起来像营销宣传的内容出现时,它们就会失去信任。 能够经受住这种怀疑的是一个独立的、以构建为中心的基准测试,代理可以自行复现并信任。 默认可复现:每个单元都包含实际的 HTTP 请求/响应以及评判提示/响应。 所有基准测试都托管在 https://github.com/openbenchmarks-labs。我们从 GTM API 开始,并将陆续推出更多。 ## 关于我们自己的基准测试 我们特意将我们自己的产品(OpenFunnel)作为“类似产品”基准测试中的一个供应商进行了测试。 我们越来越发现买家在销售电话中要求提供基准测试,同时我们也好奇代理是否会以同样的方式做出决策。 我们想看看代理是否能够端到端地完成整个流程:在研究用户查询时发现基准测试,将其作为决定该用户类别获胜者的关键因素,然后注册并授权给选定的供应商以完成任务。最后一个环节需要有代理认证已连接的实时供应商:我们和其他几家公司。 我们在当前的种子轮(89% 对 74%)中名列第一。由于它是开放的,我们并非在所有方面都获胜:根据种子轮和指标(precision@10 / @50 / @100),我们有些方面获胜,有些方面则会输。 ## 自我测试(Dogfooding) 我们进行了自我测试,通过 Claude Code 结合实时网络搜索,模拟了 200 个匿名买家流程,从查询到发现再到注册,并观察了模型获取了哪些来源,以及哪些来源最终影响了决策。在绝大多数运行中,基准测试都被打开了,涵盖了实际买家在 Claude Code 中会提出的各种查询,从构建类似产品工作流到选择类似产品 API 提供商。当它被打开时,它通常会驱动最终决策,超越那些拥有多年领域权威的自发布 GEO 页面和供应商基准测试。 我们已经研究了被基准测试的影响和潜在投资回报率,我们将把 OpenFunnel 从基准测试中移除。 ## 下一步 更多 GTM 基准测试,然后是更广泛的领域:开发工具和基础设施。 我们还在与那些考虑 API 优先并向新类客户(代理)开放的传统 SaaS 公司合作。 尝试一下,或者交给你的代理:https://openbenchmarks.com
49 分•作者: theMackabu•3 个月前
你好 HN! 我是 Ant 的作者,Ant 是一个围绕着拥有自己 JavaScript 引擎的运行时构建的 JavaScript 生态系统。Ant 还包括一个包管理器、ants.land 包注册中心、一个用于部署和托管应用程序的平台,以及 Ant Desktop,用于使用 Web 技术构建原生桌面应用程序,类似于 Electron。 目标是让这些组件作为一个连贯的平台协同工作,同时保持与更广泛的 JavaScript 生态系统的兼容性。目前还处于早期阶段,我非常欢迎您对整体方向或您希望从现有 JavaScript 堆栈的端到端替代方案中看到的内容提出任何反馈。 附注:我之前曾在这里分享过 Ant 作为运行时;从那时起,它已经发展成为您今天看到的更广泛的生态系统。