5作者: victorbarres5 个月前
τ-Bench 是一个开放基准,用于评估 AI 智能体在有可验证结果的、基于现实世界的、多轮客户服务任务上的表现。自发布以来,看到社区采用它,我们感到非常高兴——这是第三次迭代。通过 τ³-Bench,我们将其扩展到两个新的场景:知识密集型检索和全双工语音。 τ-Knowledge:智能体必须浏览约 700 份相互关联的政策文件,以完成多步骤任务。最佳前沿模型(GPT-5.2,高推理能力)的完成率约为 25%。令人惊讶的是:即使你向模型提供了它所需的精确文件,性能也仅达到约 40%。我们发现瓶颈不在于检索——而在于对复杂、相互关联的政策进行推理,并按正确的顺序执行正确的操作。 τ-Voice:相同的基于现实世界的任务,但通过具有真实音频的实时全双工语音进行——包括口音、背景噪音、中断、压缩电话线路。在清晰音频条件下,语音智能体的得分是 31–51%,在真实条件下是 26–38%。一个在不同提供商(OpenAI、Gemini、xAI)中都存在的失败模式是:智能体在身份验证过程中误听了姓名或电子邮件,导致后续所有操作失败。 我们还在原始的航空公司、零售和电信领域中加入了 75+ 项任务修复——其中许多是基于社区审计和 PR(包括来自亚马逊和 Anthropic 的贡献)。我们认为基准测试的质量取决于其维护,我们感谢社区对改进它的帮助。 代码和排行榜是开放的——我们欢迎社区提交和反馈。 博客文章(论文、代码、排行榜):[https://sierra.ai/blog/bench-advancing-agent-benchmarking-to-knowledge-and-voice](https://sierra.ai/blog/bench-advancing-agent-benchmarking-to-knowledge-and-voice)
8作者: jawiggins5 个月前
我想,和你们许多人一样,我一直在同时切换多个 Claude Code/Codex 会话,管理多个代码库中的多条工作线和工作树。我希望有一种方法可以轻松管理多条工作线,并减少我需要提供的输入量,从而让这些智能体尽可能地将我从流程的瓶颈中解放出来。因此,我构建了一个用于 AI 编码智能体的编排工具: Optio 是一个开源编排系统,它使用 AI 编码智能体将工单转化为已合并的拉取请求。你只需将其指向你的代码库,它就会处理整个生命周期: - 接收 — 从 GitHub Issues、Linear 中提取任务,或手动创建任务 - 执行 — 为每个代码库启动隔离的 K8s Pod,在 Git 工作树中运行 Claude Code 或 Codex - PR 监控 — 每 30 秒监视 CI 检查、审查状态和合并准备情况 - 自我修复 — 在 CI 失败、合并冲突或审阅者更改请求时自动恢复智能体 - 完成 — 压缩合并 PR 并关闭链接的 issue 关键在于反馈循环。Optio 不仅仅是运行一个智能体就置之不理——当 CI 失败时,它会将失败反馈给智能体。当审阅者请求更改时,评论将成为智能体的下一个提示。它会一直运行,直到 PR 合并或你告诉它停止。 使用 Fastify、Next.js、BullMQ 和 Drizzle on Postgres 构建。随附用于生产部署的 Helm Chart。