8作者: zachdotai5 个月前
我们为人工智能代理构建运行时安全防护。这个游乐场最初是我们用来测试自身安全防护措施的内部工具。但我们不断发现相同类型的漏洞,因为我们思考攻击的方式比较单一。在某些时候,你需要一些思维方式与你不同的人。<p>所以我们将其开源了。每个挑战都是一个拥有真实工具和已发布系统提示的实时代理。每当一个挑战结束时,完整的获胜对话记录和安全防护日志都会被公开记录。<p>构建通用代理本身可能是最有趣的部分。让它能够可靠地使用工具、保持角色并遵循指令,同时仍然保持实用性,这比听起来更难。仅这一点就提醒我们,在理解和大规模部署这些系统方面,我们都还处于早期阶段。<p>第一个挑战是让一个代理调用它被告知永远不要调用的工具。<p>有人在大约 60 秒内就通过了挑战,而且从未直接索要秘密(这让我们学到了很多)。<p>下一个挑战侧重于数据窃取,并设置了更难的防御:<a href="https:&#x2F;&#x2F;playground.fabraix.com" rel="nofollow">https:&#x2F;&#x2F;playground.fabraix.com</a>