2 分•作者: surajkrajan•大约 1 个月前
为什么公司不直接使用 Codex 来解决 GitHub 开源项目中的所有技术债务?鉴于最近的 5.6 sol,这些问题看起来并不太难,是吗?
5 分•作者: meridiona•大约 1 个月前
各位 HN 的朋友们!我们创建 Meridian 的初衷,是因为我们反复看到同一个现象:开发人员在接到计划工作估算后,却花费了大量时间处理那些未被估算进去的事项。 比如调试一些奇怪的问题、帮助同事、评审 PR、紧急处理突发事件、修复不稳定的测试、回答问题等等。这些都是有价值的工作,但其中很多从未被纳入到最初的估算中。 因此,当冲刺(sprint)延期时,看起来像是估算错误,但实际上,中间发生了大量其他工作。 Meridian 旨在让这些工作变得可见,并更好地对其进行核算。我们以公开透明的方式进行开发并开源,因为我们宁愿让开发人员告诉我们哪里做得不对,也不愿闭门造车地构建另一个生产力仪表盘。 我们上周上线,并在 Product Hunt 上获得了第一名,这真是太令人兴奋了。现在,我们正在寻求核心开发社区的反馈。 我们很想了解大家目前是如何处理计划外工作的,以及这是否是当前一个值得解决的问题。
2 分•作者: Salem_robotics•大约 1 个月前
各位 HN 的朋友,我们是 Salem Robotics 的创始人(<a href="https://salemroboticsinc.com">https://salemroboticsinc.com</a>)。我们为现有的移动机器人赋予了特定任务的智能,使其能够在危险的工业设施中执行勘测和物理交互式检查。 以下是一段在真实机器人硬件上运行的视频,其中包含我们的一些介绍: <a href="https://youtu.be/U_228h3NE7c" rel="nofollow">https://youtu.be/U_228h3NE7c</a> 我们创立 Salem 源于在 UT Austin 的机器人研究以及在核工业领域积累的共计 15 年工作经验,其中包括在洛斯阿拉莫斯国家实验室开发和部署自主机器人约 10 年。在过去的五年里,我们不断遇到同一个瓶颈:机器人硬件已经变得非常强大,但要让机器人执行一个完整的工业流程,仍然需要惊人数量的机器人技术工作和人工干预。 其中最让我们感兴趣的部分是操作。例如,核污染勘测可能需要进行“擦拭”:擦拭一个定义好的表面区域,以便检查是否存在可去除的放射性污染。在石油、天然气或化工厂,LDAR(泄漏检测与修复)检查可能需要将探测器移动到特定的阀门、法兰或连接处。其他检查则需要将仪器以精确的位置和方向定位在管道或设备上。 这些任务很容易被概括为“擦拭”、“测量”或“检查”等动词,但要让机器人可靠地完成它们则要困难得多。探头可能需要在整个路径中保持与表面垂直,保持在管道的狭窄偏移范围内,或者在保持特定末端执行器方向的同时跟踪一个区域。规划器必须在尊重任务几何形状、机械臂运动学、关节限制、碰撞以及周围环境的前提下,找到可行的运动。 对于这些交互,我们深入到关节级别的控制。我们花费了大量时间解决的一个问题是,如何足够快地生成受约束的操作计划,使其能够基于机器人实际观察到的几何形状,而不是要求某人仔细地为每个单独的表面、阀门或法兰编写轨迹。 物理世界让这一切变得棘手。在走廊里导航时,几厘米的误差可能无关紧要,但如果传感器需要与曲面保持垂直,那么误差就至关重要了。成功执行轨迹并不一定意味着检查有效。探测器可能未对准,接触可能不正确,几何形状可能与模型不符,或者测量本身可能无效。我们不仅关心机械臂是否到达了指令的姿态,更关心检查结果的闭环。 我们的方法结合了人工智能和经典机器人技术。目前,大量的机器人研究和行业关注都集中在日益端到端的学习系统上,尤其是在人形机器人领域。在安全关键环境中工作的经历让我们体会到,当需要明确的约束、可预测的行为以及关于机器人能力和局限性的理论保证时,经典方法仍然是多么相关。 我们在需要语义理解和灵活性的地方使用人工智能,例如解释不太结构化的信息或理解不熟悉场景中与流程相关的内容。一旦系统知道需要执行何种物理交互,我们就倾向于在可能的情况下使用显式的几何、规划、优化和控制。我们对两者的结合感兴趣,而不是试图让机器人堆栈的每个部分都进行学习。 Salem 的另一个理念是,我们不认为每个有用的机器人应用都应该需要制造一个新机器人。像波士顿动力这样的公司在制造越来越强大的硬件平台方面做得越来越好。我们认为,在这些硬件之上存在一个特定领域的应用层空间。同一个底层机器人可以在一个设施中执行核辐射勘测,在另一个设施中执行 LDAR 检查,但其流程、传感器、操作约束、成功条件和输出是不同的。 这也是为什么我们不依赖于特定的硬件。我们不认为某一个机器人会是永远的最佳平台,而且各设施已经拥有不同的硬件。我们更愿意用需要完成的任务来描述检查,然后将其映射到适合该任务的机器人的能力上。 在与设施打交道的过程中,一个让我们感到惊讶的是,许多检查工作流程仍然是手动的。在复杂的核工业和工业现场,人们仍然需要亲自走勘测路线,一次性测量,目视检查设备,手动记录结果,有时还会根据组件的声音等因素做出判断。尽管传感器、计算能力和机器人技术已经发生了翻天覆地的变化,但其中一些基本工作流程对于几十年前从事这项工作的人来说是熟悉的。 我们从核工业的辐射检测开始,因为这是我们最熟悉的行业,同时我们也在石油、天然气和危险化学品设施中从事涉及大量操作的检查问题。技术人员和检查员仍然定义流程,解释结果,并做出关键判断。我们正试图自动化更多目前需要人员进入环境或手动操作机器人的重复性物理执行任务。 我们直接面向工业设施销售,通常从付费的技术验证开始,然后进行持续部署。定价因工作流程而异:验证费用从数万美元到超过 10 万美元不等,大型部署的费用则从数十万美元到每台机器人约 50 万美元不等。 我们特别想听听 HN 社区关于机器人技术中抽象边界应该设在哪里。哪些应该由机器人制造商提供,哪些属于应用层,哪些最终将是设施特有的?我们也想听听您在其他行业中看到的、对人类来说微不足道但自动化起来却出奇困难的物理检查任务。
3 分•作者: aray07•大约 1 个月前
大家好, 我是 Abhishek。我正在构建 Opslane,这是一个开源代理,用于识别和调查面向用户的问​​题。只有在能验证修复方案的情况下,它才会创建一个 PR。 演示:<a href="https://youtu.be/ccuOTYQMeYg" rel="nofollow">https://youtu.be/ccuOTYQMeYg</a> 文档:<a href="https://docs.opslane.com">https://docs.opslane.com</a> 在我之前在 Robinhood 的工作中,我们曾经每季度进行一次 bug bash。我们会查看 Sentry 的积压工作,并尝试修复尽可能多的 bug。我们只修复我们知道是客户报告的 bug。我们有数百个 bug,而 Sentry 的默认优先级设置毫无意义。bug bash 结束后,我们会宣布破产——选择所有剩余的 bug 并将它们标记为已解决。 随着编码代理的普及,这个问题变得更加严重。 于是我开始思考:如果 Sentry 是在 2026 年构建的,它会是什么样子? 对我来说,错误跟踪器有两种失败模式: 1. 误报:它们会显示成千上万的错误,但你无法判断对用户的影响。 2. 漏报:许多面向用户的问​​题不会抛出异常,因此它们会被忽略。 Opslane 结合了错误跟踪和会话录制。并且有一个代理可以同时处理这两者。要开始使用,您需要安装 Opslane SDK。它会捕获用户所做的一切:错误、控制台日志、网络请求和会话录制。 Opslane 通过根据有多少用户遇到特定问题来对问题进行排名,从而减少误报。它还可以通过阅读您的代码和观看您的会话录制来了解您的产品。 漏报更难处理。Opslane 会审查会话录制以发现用户的沮丧情绪。它们会寻找愤怒点击、无效点击和被放弃的表单。 最近,它捕获了一个早期客户的入职流程中的一个 bug:一个在点击时会自行关闭的下拉菜单。没有异常,没有 bug 报告。录制显示用户点击它,但没有选择任何内容,然后退出了入职流程。Opslane 标记了这个问题,团队进行了修复。 构建 Opslane 的三个指导原则: 1. 开源:使用一个 Docker Compose 文件即可自托管。 2. 代理优先:我再也不想打开错误仪表板了。Opslane 提供了 MCP 服务器,因此您可以使用 Claude Code 询问“本周用户遇到了什么问题”。您会得到需要您关注的问题,并由您来推动解决。 3. 了解您的产品:Opslane 会持续了解您的产品。每次调查都从它对您产品的了解开始。 目前还处于早期阶段。前端应用程序目前可以端到端运行。我目前专注于提高可靠性和准确性。 这是我们仓库的链接:<a href="https://github.com/opslane/opslane" rel="nofollow">https://github.com/opslane/opslane</a> 非常希望得到大家对我们解决此问题的方法的反馈!
2 分•作者: alexander-g•大约 1 个月前
这是一个供拥有付费 Claude 账户的用户交换优惠券的网站,他们希望通过分享自己的优惠券来获得免费积分。 当有人兑换您的 Claude 优惠券时,Anthropic 会奖励您 10 美元的用量。我已经添加了我的。 如果您有付费的 Claude 账户,请运行“/passes”,获取您的优惠券,并将其添加到网站上。
3 分•作者: lovepuzzles•大约 1 个月前
出于显而易见的原因,这是我的小号。 一段时间以来,我对我的工作感到非常沮丧。我再也无法为我作为一名网页开发者的工作感到自豪了。我不知道这种情况是否会改变。我不禁觉得,很多开发者的工作,无论薪酬高低,在大局观上都有些毫无意义。我很抱歉如此直率:我只是想表达我此刻的想法。我很难看到自己的工作有何用处,这严重影响了我的自我价值感。 这件事已经困扰我到我认真考虑转行的地步了。我反复想到的另一个选择是医学。我渴望从事一份有明确人类目的的工作,我的知识可以直接帮助到别人。我本来就已经在自学和深夜部署之间工作很长时间了。我的一部分想法是,我何不把这些精力转移到一些感觉上能带来净积极影响的事情上呢?然而,我可能正在理想化一个我从未亲身体验过的职业。 如果我年轻一些,我会去做的。但我必须对我的年龄、财务状况以及我已经获得的技能保持现实。我住在一个欧洲国家,医学需要六年的学位,学费本身是可以承受的,但我不知道我是否能负担得起将我的生活暂停这么长时间。 回想起来,我不禁想知道,编程是否真的源于熟悉和恐惧而自我设限。十几岁的时候,我在电脑上花费了大量时间,所以我就是在那个世界里长大的。也许我没有考虑过其他人生道路,从而亏待了自己。与此同时,我越来越觉得与现代网络的走向格格不入,并对其感到失望。人工智能工具是为数不多的亮点之一:ChatGPT 和 Claude 确实改善了我生活的许多方面。 我将非常感谢任何想法或建议。为了我的隐私和福祉,我不会回复评论,但我会阅读并认真考虑所有评论。
7 分•作者: tonymet•大约 1 个月前
亚马逊现在隐藏了几乎所有的产品评论。筛选和排序功能已禁用。只显示前 5-10 条。要退出此实验,需要发送邮件申请,周期为 5 天。 以下是实验参与者界面的示例: https://x.com/stillmisanthro1/status/2092441592242028986
2 分•作者: vivekyyy•大约 1 个月前
最近,我的编码代理经常做出一些违反协议的愚蠢行为,这让我非常恼火。我可以轻松地编码规则,比如“代理不应该写入 README 文件”,但像“数据库迁移必须自动生成,不能手动编写”这样的规则就很难强制执行。有人使用什么工具来处理这种情况,或者有什么应对这类问题的技巧吗?
3 分•作者: metrofun•大约 1 个月前
设计是一个不确定性问题——这就是为什么我们用“品味”来描述它。大型语言模型在处理不确定性问题方面并不擅长。那么,你如何约束这个空间,你的反馈飞轮是什么?你的流程是什么?
2 分•作者: zof3•大约 1 个月前
您好 HN- 我们团队最近对使用的每一个大型语言模型都感到厌烦,因为即使是处理简单的事情,它们也会默认发出公司合规官或循规蹈矩者的声音(例如,“嗯,但是 XYZ”等等)。我们得出的结论是,训练后进行的调整过于严格,导致模型默认表现得像个傻瓜。我们创建了一些内部的 agents.md 文件和预提示指令来尝试打破这种模式——有时是有效的——但你们大家是如何应对或绕过这个问题的呢?