返回首页
最新
测试对于软件应用至关重要——首先要确保它们可靠地实现了构建的目的,其次要确保在软件不断增长、演变和变化的过程中,它们依然保持这种可靠性。人工智能应用同样适用这一原则。然而,测试人工智能应用与测试传统软件应用有很大不同,特别是由于其非确定性特征。人工智能工程师必须深入理解人工智能评估,以便能够构建可靠的人工智能应用,并在不破坏现有行为的情况下更快地发布更改。
人工智能评估通常被呈现为一长串独立的技术:基于规则的评估、人类评估、LLM作为评判者、离线评估、在线评估、组件评估和端到端评估。但在实际应用中,这些技术彼此补充并相互构建。
我构建了Wayfinder,这是一个参考实现,通过同一个人工智能应用逐步探索这些概念。我的目标是建立对不同评估技术如何结合在一起的直觉,以及如何将它们转化为人工智能应用的评估策略。
我很想听听其他人在生产环境中的人工智能应用评估方面的做法,以及你认为这个实现中缺少了什么。