1 分•作者: divakarungatla•20 天前
测试对于软件应用至关重要——首先是为了确保它们能够可靠地实现其设计目的,然后是为了确保它们在不断增长、演进和变化的过程中能够保持这种可靠性。这一点同样适用于人工智能(AI)应用。然而,AI 应用的测试与传统软件应用的测试截然不同,尤其因为 AI 应用固有的非确定性。AI 工程师深入理解 AI 评估至关重要,这样才能构建可靠的 AI 应用,并在不破坏现有行为的情况下更快地发布变更。 AI 评估通常被呈现为一系列独立的技术:基于规则的评估、人工评估、LLM 作为裁判、离线评估、在线评估、组件评估和端到端评估。但实际上,它们是相互补充、相互促进的。 我构建了 Wayfinder,这是一个参考实现,我通过同一个 AI 应用逐步探索了这些概念。我的目标是建立一种直觉,了解不同的评估技术如何协同工作,以及如何将它们转化为 AI 应用的评估策略。 我很想听听其他人是如何在生产环境的 AI 应用中进行评估的,以及您认为这个实现中还有哪些不足之处。