AIHero

    三种评估类型

    了解确定性评估、人工反馈和 LLM-as-a-judge。

    Matt Pocock
    Matt Pocock
    本页目录

    确定性评测

    • 确定性评估会返回通过或失败的结果,目标是从概率系统中提取确定性。
    • 按照 Ian Webster的说法,这是“最有用的评估类型”。这类评估应该快速,并以开发者为中心。
    • 一个很好的例子来自 Discord 的 Ian Webster:他们检查 AI 机器人 Clyde 的每条回复是否都以小写字母开头,从而确保机器人模仿 Z 世代用户的表达习惯。

    LLM-as-a-Judge

    • 有些评估可以通过 LLM 完成。
    • autoevals 模板很好地展示了这类评估的多种形式。 幽默度 判断内容是否有趣。 对战比较 比较两个响应,判断哪一个更好。
    • 甚至可以让 LLM 检查事实性:提供一条真实基准陈述,再据此核对响应。
    • LLM-as-a-judge 评估失败,往往意味着应该由人工查看。因此在我看来,它更像冒烟测试,而不是真正的测试。

    人工反馈

    • 有些评估只有人工执行才真正有价值,例如长文本生成和某些事实性判断。
    • 任何类型的 LLM 应用都需要人工监督。