1作者: alcray3 个月前
大家好, 我开发了 TrainForgeTester,这是一个开源的 AI 智能体场景测试运行器,用于测试执行动作(调用工具)的 AI 智能体。 其理念是:测试智能体在特定公司场景中的表现,而不仅仅是通用基准测试。更具体地说,测试智能体是否会采取错误的操作、跳过必要的步骤、调用错误的工具或传递错误的参数。 TrainForgeTester 允许您运行多轮场景(您可以根据您的个人用例和数据,按照提供的场景模式创建这些场景),并检查: * 工具调用和参数 * 严格或无序的工具执行 * 预期响应 * 模型、提示或工具更改后的回归 这个场景测试器是该项目的第一部分(类似于 v 0.1.0)。 我现在正在开发下一部分:一个“场景生成器”,它将处理混乱的公司历史数据(客户支持日志、智能体追踪、工具调用、转录等),并将它们转化为可测试的场景,用于这个框架。同样,我试图使其尽可能具有确定性。 代码库:[https://github.com/TrainForge/TrainForgeTester](https://github.com/TrainForge/TrainForgeTester) 我非常欢迎大家对以下方面提出反馈: * 此工具尚未涵盖的实际智能体测试用例(浏览器使用、音频、视频、鼠标使用) * 这个方向是否有意义 * 它未来可以发展成什么样的产品/开发工具 * 代码库中的问题、边缘情况或缺失功能 非常感谢任何 GitHub 问题/fork/PR。