1 分•作者: ike_usawa•20 天前
返回首页
最新
2 分•作者: JumpCrisscross•20 天前
1 分•作者: ike_usawa•20 天前
20 分•作者: mikiyas•20 天前
2 分•作者: thunderbong•20 天前
1 分•作者: pigeonlabshq•20 天前
1 分•作者: fiberfault•20 天前
1 分•作者: divakarungatla•20 天前
测试对于软件应用至关重要——首先是为了确保它们能够可靠地实现其设计目的,然后是为了确保它们在不断增长、演进和变化的过程中能够保持这种可靠性。这一点同样适用于人工智能(AI)应用。然而,AI 应用的测试与传统软件应用的测试截然不同,尤其因为 AI 应用固有的非确定性。AI 工程师深入理解 AI 评估至关重要,这样才能构建可靠的 AI 应用,并在不破坏现有行为的情况下更快地发布变更。
AI 评估通常被呈现为一系列独立的技术:基于规则的评估、人工评估、LLM 作为裁判、离线评估、在线评估、组件评估和端到端评估。但实际上,它们是相互补充、相互促进的。
我构建了 Wayfinder,这是一个参考实现,我通过同一个 AI 应用逐步探索了这些概念。我的目标是建立一种直觉,了解不同的评估技术如何协同工作,以及如何将它们转化为 AI 应用的评估策略。
我很想听听其他人是如何在生产环境的 AI 应用中进行评估的,以及您认为这个实现中还有哪些不足之处。
1 分•作者: dylan_builds•20 天前
2 分•作者: Bahaa_BLINK•20 天前
12 分•作者: jllyhill•20 天前
1 分•作者: routeroff•20 天前
1 分•作者: kisnorbert•20 天前
1 分•作者: GenericPointer•20 天前
1 分•作者: Bluestein•20 天前
1 分•作者: altilunium•20 天前
1 分•作者: rustoo•20 天前
2 分•作者: pirminmanz•20 天前
1 分•作者: vrilex•20 天前
1 分•作者: vintagedave•20 天前