三种评估类型
了解确定性评估、人工反馈和 LLM-as-a-judge。
Matt Pocock
本页目录
确定性评测
- 确定性评估会返回通过或失败的结果,目标是从概率系统中提取确定性。
- 按照 Ian Webster的说法,这是“最有用的评估类型”。这类评估应该快速,并以开发者为中心。
- 一个很好的例子来自 Discord 的 Ian Webster:他们检查 AI 机器人 Clyde 的每条回复是否都以小写字母开头,从而确保机器人模仿 Z 世代用户的表达习惯。
想继续深入: 加入“面向真正工程师的 AI 编码”候补名单
LLM-as-a-Judge
- 有些评估可以通过 LLM 完成。
- autoevals 模板很好地展示了这类评估的多种形式。 幽默度 判断内容是否有趣。 对战比较 比较两个响应,判断哪一个更好。
- 甚至可以让 LLM 检查事实性:提供一条真实基准陈述,再据此核对响应。
- LLM-as-a-judge 评估失败,往往意味着应该由人工查看。因此在我看来,它更像冒烟测试,而不是真正的测试。
人工反馈
- 有些评估只有人工执行才真正有价值,例如长文本生成和某些事实性判断。
- 任何类型的 LLM 应用都需要人工监督。