1 分•作者: aidangarske•3 个月前
返回首页
最新
1 分•作者: weitzj•3 个月前
1 分•作者: smartmic•3 个月前
1 分•作者: sminchev•3 个月前
1 分•作者: iancutzul•3 个月前
1 分•作者: lumenwrites•3 个月前
1 分•作者: geox•3 个月前
2 分•作者: tie-in•3 个月前
1 分•作者: cl3misch•3 个月前
2 分•作者: itsarnavsh•3 个月前
27 分•作者: bookofjoe•3 个月前
26 分•作者: chasil•3 个月前
1 分•作者: mellinoe•3 个月前
1 分•作者: legothief•3 个月前
1 分•作者: dryadin•3 个月前
1 分•作者: defenestration•3 个月前
1 分•作者: alcray•3 个月前
大家好,
我开发了 TrainForgeTester,这是一个开源的 AI 智能体场景测试运行器,用于测试执行动作(调用工具)的 AI 智能体。
其理念是:测试智能体在特定公司场景中的表现,而不仅仅是通用基准测试。更具体地说,测试智能体是否会采取错误的操作、跳过必要的步骤、调用错误的工具或传递错误的参数。
TrainForgeTester 允许您运行多轮场景(您可以根据您的个人用例和数据,按照提供的场景模式创建这些场景),并检查:
* 工具调用和参数
* 严格或无序的工具执行
* 预期响应
* 模型、提示或工具更改后的回归
这个场景测试器是该项目的第一部分(类似于 v 0.1.0)。
我现在正在开发下一部分:一个“场景生成器”,它将处理混乱的公司历史数据(客户支持日志、智能体追踪、工具调用、转录等),并将它们转化为可测试的场景,用于这个框架。同样,我试图使其尽可能具有确定性。
代码库:[https://github.com/TrainForge/TrainForgeTester](https://github.com/TrainForge/TrainForgeTester)
我非常欢迎大家对以下方面提出反馈:
* 此工具尚未涵盖的实际智能体测试用例(浏览器使用、音频、视频、鼠标使用)
* 这个方向是否有意义
* 它未来可以发展成什么样的产品/开发工具
* 代码库中的问题、边缘情况或缺失功能
非常感谢任何 GitHub 问题/fork/PR。
2 分•作者: georgestrakhov•3 个月前
2 分•作者: Thanks92•3 个月前
3 分•作者: ZeidJ•3 个月前