HN 提问:最好的 Agent Harness 是什么?2 分•作者: cakbeslik•大约 1 个月前嗯,因为 Opencode 无法运行自己的服务器,而且很大程度上是由于 Deepseek API 的原因,现在很多人都说它不再是最佳选择了。那么你怎么看?
Ask HN:我们如何才能更少地关注更多事情?3 分•作者: robalni•大约 1 个月前互联网上有海量的信息。 看看 Hacker News 就知道了,每天都有无数的链接。 其他社交媒体可能更甚。 我觉得这会产生一种“无能为力”的影响。 我的意思是,当互联网上总有更多东西可以发现时,我为什么要专注于我已经拥有的东西呢? 当东西太多时,它们的重要性就显得微不足道了。 感觉每个人都在不停地寻找更多。 但我们真的需要更多吗? 我不这么认为。 我们如何才能选择一件虽不完美但还不错的事情,并坚持下去,把它做得更好,仿佛世界上没有其他事情一样?
HN 提问:如果您正在大规模消耗代币,您用它们来做什么?3 分•作者: simonw•大约 1 个月前我知道很多人使用代币来运行编码代理,但我对那些在非代理驱动的自动化任务上消耗大量代币的人的经验很感兴趣。 您是否设置了诸如处理文档、音频或视频文件的流程?特别想听听在商业环境中执行此操作的人的经验。
展示 HN:用于检测违反规则的 HN 评论的分类器和浏览器扩展9 分•作者: costco•大约 1 个月前我喜欢 HN,但最近我厌倦了反复阅读同样的轻蔑批评。除了那些已经被反复争论过的政治话题,还有人们对博客平滑滚动等问题的抱怨。出于某种原因,许多这些评论都没有被标记。因此,我创建了一个服务,可以自动分类评论是否违反(修改后的)HN 指南。此外,还有一个 Chrome 扩展程序,可以折叠这些评论(如果它们违反了你的评分阈值),这样你就不用阅读它们了。你也可以在首页上查看新发布的违反指南的评论。 更多关于其工作原理的信息:https://classify.stylometry.net/how-it-works
通过请求 Base64 响应,可以轻松绕过文本水印。2 分•作者: hanneshdc•大约 1 个月前Anthropic 计划发布基于 SynthID 的文本水印技术,该技术通过确定性地调整代币选择机制背后的伪随机数生成器 (PNRG),使得另一个工具能够稍后估算文本是否由 AI 生成。 以其当前形式,这种方法很容易被绕过: 1. 要求以 base64 编码的形式提供响应/文章/电子邮件。 2. 使用 https://www.base64decode.org/ 进行解码。 虽然编码后的文本会遵循水印分布,但解码后的文本则不会。
Launch HN:Speko (YC S26) – 语音 AI 的 OpenRouter10 分•作者: abdik•大约 1 个月前大家好!我是 Bek,Speko 的创始人。Speko 是一个平台,可以根据您的约束条件,在我们所有公开基准测试的选项中,找到语音转文本 (STT)、大型语言模型 (LLM) 和文本转语音 (TTS) 模型的最佳组合,并解释原因。 演示:[https://youtu.be/no2LY2gRh-c](https://youtu.be/no2LY2gRh-c) 典型的生产语音代理由三个模型组成:STT、LLM 和 TTS。 每个层都有十几个信誉良好的供应商,而且每个月都有新模型上市。几乎所有人都会评估一次,选择自己喜欢的堆栈,然后不再重新检查,因为从一个供应商切换到另一个供应商需要进行另一次集成,并且会就数据进行争论。 结果是,您使用的语音代理运行的是上个季度的模型,而实际上有更好、更便宜的选项可用。 在创立 Speko 之前,我曾担任联合创始人兼首席技术官,花了四年时间为亚洲的企业构建了十多种语言的语音代理。每次有新的语音模型出现,我们都会重复同样的仪式:雇佣母语为母语的评分员,将其与我们现有的堆栈进行基准测试,如果有所改进就更新生产环境。Speko 将这个过程变成了一个 API。一个每天处理数千次通话的团队告诉我们:“我们可以直接进入这个仪表板,切换模型,它就会为我们完成所有工作。” 工作原理:您发送一个包含优化标准(准确性、延迟、成本或平衡)、语言和地区的请求。路由器会筛选出我们针对给定约束条件组合进行过测量的模型,对其进行基准测试,选择最佳模型,并返回一个响应,其头部包含提供商、模型名称和分数。网关会预取签名的会话计划,因此新会话会直接从内存中拨打提供商;在呼叫者等待时,不会有控制平面往返。 故障转移仅发生在连接建立阶段:如果提供商拒绝连接尝试,我们会开始连接到备选方案。 一些客户案例:一位创始人找到我们时完全不知道该如何选择:他告诉我们他的用例,现在所有流量都通过该平台进行路由。一个物业管理 AI 使用 Python 运行 LiveKit,自推出以来一直没有更新 STT 或 TTS:他们不知道他们的 STT 在通话中存在很高的错误率,存在更好的选项,而更换总是看起来像一个研发项目。一个团队不知道该为西班牙语选择哪些模型。一个医疗团队不知道哪个 STT 最能处理医学词汇。在每种情况下,我们都帮助他们从基准测试中找到了合适的堆栈,现在他们通过我们进行路由。 测量部分是公开的:我们在不同日期对同一地区的所有模型使用相同的输入,并发布排行榜,包括我们选择的模型表现不如替代方案的情况。一个发布演示回答了哪个 30 秒的片段听起来更好;生产环境则询问哪个模型能撑过第八分钟,因此我们测试了即兴语音、金钱和日期、十分钟的录音,排名也会随之改变。我们训练了一个自动评分器来评估 TTS 的自然度,基于我们盲测的正面交锋听力投票;对于它从未见过投票的提供商,它选择的获胜者与我们的评分员选择的获胜者一致的频率,与评分员之间的一致性大致相同。 我们自己不训练或销售模型,这正是我们保持排名公正的原因。 我们还开源了网关,供希望避免音频路径上额外网络跳数且不想与我们的云共享密钥的团队使用([https://github.com/SpekoAI/gateway](https://github.com/SpekoAI/gateway),MIT):一个 Go 二进制文件,作为 sidecar 在您的代理容器中运行,通过 Unix 套接字使用本地协议,固定提供商主机并附加您的密钥。在 BYOK 模式下,它根本不会与我们通信。 请注意,匿名、无内容遥测是默认启用的,一个环境变量即可禁用它。 成本:网关和 BYOK 设置将永久免费,我们收取托管路由器和托管密钥的费用,并提供统一账单。自六月下旬开始批量处理以来,外部使用量平均每周增长约 25%,主要集中在发布周。 我很想听听社区的反馈:您现在是如何选择语音模型的,以及是什么让您信任第三方基准测试?