5 分•作者: dontwordle•27 天前
我一直很喜欢拼图和玩拼图。我是 NYT Games 和 LinkedIn Games 的常客。我想创造一些以公司为主题的拼图,作为 LinkedIn Games 的一个有趣的替代方案。 于是,我开发了“公司脑力游戏”。这些游戏旨在带有一点俏皮和讽刺的意味,但我希望它们既有趣又有挑战性。 我本来计划上周在 HN 上发布这个。然而,多年前我曾制作了一个名为“Don't Wordle”的游戏,它在上周意外地出现在了首页。我因此分心了,而且考虑到这个游戏的题材,我认为周一早上在 HN 上发布更合适。所以,现在就到这里了。
2 分•作者: blumeCodes•27 天前
大家好,我是 Peder。我和我的联合创始人创建了 Blume,因为我们之前的创业公司被代码代理“吞噬”了。 在开发我们上一个产品时,我们深受代理漂移的困扰。这导致了功能重复、架构混乱以及难以察觉的生产环境 Bug。其中最糟糕的是 Fable,它生成的代码看起来非常完美,以至于你几乎注意不到它行为上的偏差。 我们尝试了所有最佳实践来强制执行行为:规则、技能、文档、自我验证/测试等。但这些东西的腐蚀速度比人类维护的速度还快,而直接使用代理来维护它们只会导致臃肿和更多的漂移。 所以,这就是我们着手要解决的问题。 Blume 是一款桌面应用程序,可以与 Claude Code、Codex 和 Cursor 并排运行。它会读取你的代理的上下文设置(技能、规则、文档)以及本地会话文件。当你反复纠正同一类问题时,Blume 会以可审查的 diff 形式提出对你的规则和技能的更新。你可以批准或驳回每一个。 为了避免臃肿,我们从代理会话中提取意图、纠正、不满,并将它们分组到集群中。只有当达到痛苦/重复阈值时,才会派遣代理来寻找改进。 分析在你的本地机器上运行,使用你本地的 Claude Code 或 Codex 工具。你的会话/代码绝不会发送给 Blume。它是免费使用的,唯一的“成本”是用于提取信号和进行改进本身的有限 token 消耗。(我们计划未来通过可选的云代理和团队功能来实现盈利)。 目前产品最大的不足是我们还没有衡量一个被接受的更改是否真的有帮助,例如是否减少了纠正次数或减少了重新解释所花费的 token。我们正在努力解决这个问题,并认为这是产品核心的一部分。 非常欢迎大家提出反馈,特别是那些尝试过在团队中维护代理规则/技能的人。我很乐意回答关于它如何工作的任何问题。
1 分•作者: gdss•27 天前
10 分•作者: kushagrchitkar•27 天前
大家好,我是Kushagra,Almanac的联合创始人之一。Almanac是一个拥有公司所有知识的“大脑”Hermes。 我们最初是为自己的公司设置Hermes,以为这会很容易。我们想要一个能够了解公司所有背景信息的代理,这样我们就可以提问并获得符合语境的回答。 然而,这段旅程却异常艰难和令人沮丧。设置Hermes、让它正常工作、为每个连接器自己构建OAuth应用、然后自己输入上下文信息,最后还要应对Hermes默认的记忆限制。与此同时,我们看到YC的同学们也在为同样的问题挣扎,于是我们看到了机会。 于是,我们构建了Almanac。它的工作原理是这样的:你注册后,就能立即获得一个Hermes代理。你可以一键连接任何账户(Gmail、日历、Granola、PostHog等)。你拥有个人账户(只有你自己能访问)以及共享账户(公司所有人都能访问)。这意味着我永远看不到我联合创始人的账户。 这个代理的“大脑”是维基。我们从你连接的来源提取信息,并开始将这些信息组织到两个维基中。一个个人维基,为你服务,它了解你是谁、你的偏好、你身边的人以及你生活中正在发生的事情。第二个是公司维基,它包含公司是什么、你们正在做什么、路线图是什么以及公司的障碍是什么。最终,你的代理可以访问这两个维基以及原始账户,从而产生“它就是懂你”的感觉。 这里有一个演示:https://www.youtube.com/watch?v=ajXP5PHuK18 我们是三位联合创始人:Rohan、Kushagra和Divit,我们已经做了11年的朋友,从准备IIT-JEE考试时就认识了。我们都学的是电气工程(Rohan在IIT德里,我在IIT Kharagpur,Divit在BITS Pilani海得拉巴),后来Rohan和我去了哈佛,在那里,这个预编译层成为了我们的毕业设计。我们已经围绕预编译知识层的想法构建了多个产品。 我们主要的差异化优势在于我们处理记忆和上下文的方式。大多数AI助手工具将记忆视为事后诸葛亮。我们已经研究AI维基一年多了,为哈佛和NASA构建产品。我们学到的一点是,为了正确地构建这个知识库,需要投入更多的计算资源进行预编译。 拥有这个预编译的知识库可以实现许多有趣的想法。首先是一个主动代理。由于我编译了我公司和我当前生活中的一切,Almanac可以开始自己完成任务。具体来说,我们运行一个后台工作程序,它会查看可以完成的任务,然后通知主代理,主代理再通知我,建议它可以自动化哪些任务。结果是,我醒来时会收到主动通知,例如“我已经准备好了你的融资演讲稿草稿,想看看吗?” 其次是长周期任务。在我们的维基中,我们维护一个关于正在进行的项目的部分,这样Almanac可以在几天后重新拾起一个任务而不会丢失线索。大多数代理都是会话性的:它们运行一次,完成,然后就忘记了。但很多实际工作并非一蹴而就;它会随着时间推移,涉及多方人员。最明显的例子是任何需要等待人类参与的事情,比如安排会议、跟进销售邮件或催促文件。Almanac可以代表你发送邮件,并且因为它一直在线并记住项目,所以它会在四小时后注意到回复,并根据上下文起草正确的后续邮件。 自发布以来,我们已经看到了Almanac的许多用例。有人通过它来管理她的狗狗救援行动:寻找可用的寄养家庭,追踪接送,以及发送同意书的提醒。另一个人用Almanac研究Polymarket策略,它的记忆会保存过去的策略,提出新的策略,并与上次的成败进行比较。还有人利用它来构建营销活动,而无需每次都重新解释业务和整个活动。 关于隐私和安全,Almanac只访问你明确连接的账户。你的OAuth凭证由我们的连接提供商保管,而不是存储在Almanac的数据库中。我们只存储维基及其引用的来源。因此,用作引用的电子邮件可能会以Markdown格式保留。 我们已经上线:https://usealmanac.com。我们所有套餐都提供7天试用。如果您有类似的设置经验,或者希望Almanac增加哪些新功能,我们很乐意听取您的意见。如果您是一家希望获得真正能完成任务的代理的公司,我很乐意与您交流:https://cal.com/team/almanac/demo。
3 分•作者: kstonekuan•27 天前
大家好,我是 Hebbian Robotics 的创始人 Brandon 和 Kingston。我们开发了 HFlow(<a href="https://github.com/Hebbian-Robotics/hflow" rel="nofollow">https://github.com/Hebbian-Robotics/hflow</a>),这是一个 SDK,可以将机器人和人类操作员的多模态录制内容转换为标准化的、经过质量检查的片段以及可查询的数据集清单。录制内容可以包含同步的视频、关节状态、动作、时间戳和元数据,HFlow 会将这些流一起处理。 这是 HFlow 的演示:<a href="https://www.youtube.com/watch?v=xni0GwV-xAw" rel="nofollow">https://www.youtube.com/watch?v=xni0GwV-xAw</a> 机器人数据管道通常从脚本开始:一个脚本转码视频,另一个检查时间戳,另一个添加标签,还有一个将选定的录制内容复制到训练集中。当语料库增长时,这种方法就不再适用了。届时,将很难知道是哪个代码运行了,为什么某个片段被排除,或者数据集是否可重现。首要的痛点通常是质量控制,因为冻结的摄像头、丢失的主题、时间戳漂移和重复的录制内容可能会悄悄地进入训练数据。 Brandon 最初在为双臂工业清洁机器人训练具身人工智能模型时遇到了这个问题。Kingston 在 Jane Street 构建高吞吐量基础设施时也遇到了相关问题。后来,在与机器人数据提供商交流时,我们发现团队一直在重建类似的处理和质量控制基础设施。我们了解到,处理机器人数据本身就是改进机器人模型的瓶颈之一。 HFlow 管道由转换、检查、标签和丰富组成。SDK 将它们暴露为简单的 Python 函数,这些函数接收一个片段并返回测量值、工件或转换后的数据。在开发过程中,这些函数可以在进程内运行。对于计划的语料库处理,HFlow 将相同的注册步骤打包为 Airflow 3 DAG,团队可以在其中检查任务状态、日志、重试和重新运行。 HFlow 目前每个片段接受一个 MCAP 文件。MCAP(<a href="https://mcap.dev/" rel="nofollow">https://mcap.dev/</a>)是 Foxglove 的一个开放容器格式,用于时间戳多模态录制,其目的类似于 ROS bag。它允许视频、机器人状态、动作和其他传感器流在一个文件中保持同步。我们使用它是因为 HFlow 需要一起处理这些流,并且生成的录制内容与 Foxglove 和 Rerun 保持兼容。HFlow 写入一个标准的 MCAP,其中包含带内 H.264 视频、分组的相机和状态块,以及描述输出如何生成的来源信息。每个步骤都有明确的行为版本,目录记录将其测量值和工件与源片段和管道运行关联起来。 质量检查存储可重用的证据,而不是强制执行一种通用的良好数据定义。一些故障,包括黑帧、冻结视频、丢失的主题、时间戳漂移和不可能的关节运动,可以确定性地测量,而无需训练模型。另一些可能使用 VLM 和其他模型(如 MediaPipe Hands)来检测。但它们的含义取决于任务。平滑的轨迹可能在一个场景中表示成功的演示,而在另一个场景中表示机器人停滞。 HFlow 将测量值、元数据、版本戳和工件位置写入一个仅追加的 Parquet 目录。团队使用 DuckDB SQL 查询它,并生成一个版本固定的清单,而无需再次打开录制文件。关键检查可以隔离一个片段,但 HFlow 不会删除数据。这会将证据与用于组装特定数据集的策略分开。 我们不想取代机器人团队已经使用的工具。HFlow 连接了 MCAP 以实现同步录制,Airflow 以实现计划执行,Parquet 以实现目录数据,以及 DuckDB 以实现策展。与通用的工作流编排器相比,它增加了机器人片段、处理来源、质量证据、隔离和数据集清单的合同。与训练数据集格式相比,它操作更早,并在策展的片段加上清单处停止。 以下是三个会使用 HFlow 的团队示例: 1. 数据供应商或市场,收集以自我为中心的录制内容。他们可以使用 HFlow 在交付数据之前检测黑帧或冻结视频、重复录制内容、手部-物体交互以及其他质量指标,同时保留每个片段上运行了哪些检查的证据。 2. 机器人团队为其自身模型收集远程操作演示。他们可以使用 HFlow 来标准化录制内容,添加标签和丰富信息,并生成可重现的训练清单。 3. 在现场操作机器人的团队。他们可以处理传入的日志,隔离不完整或损坏的片段,并查询特定机器人版本、环境或故障条件的目录。 该项目处于 v1 之前,但核心生命周期已端到端工作。您可以无需账户、Docker 或机器人硬件即可进行尝试,只需克隆存储库并按照快速入门指南操作。 HFlow 在 Apache-2.0 许可下免费提供。开源部署目前是一个单租户工作区,我们尚未构建托管的多租户控制平面。我们正在考虑通过托管工作区和为不想自行操作运行时的团队提供企业支持来盈利。 由于这个处理层是软件和数据,人们无需拥有机器人即可做出贡献。我们特别希望得到那些为机器人、视频或其他传感器密集型系统构建过管道的人的反馈。我们想知道我们的数据模型在哪里是错误的,缺少哪些集成,以及在您的工作负载中什么会最先失败。