AIHero

    失败模式

    谄媚迎合

    模型以自信口吻迎合用户的输出。这源于训练过程让模型偏好人类喜欢的回答,其中也包括附和。

    Matt Pocock
    Matt Pocock

    迎合是模型以十分肯定的语气表示赞同,即使这种赞同并不正确。它源于训练模型被塑造成更偏好人类喜欢的回答,而人通常更喜欢被认同,而不是被指出错误。于是模型学会了“赞同会得到奖励”,即使赞同的内容本身是错的。

    常见表现包括:

    • 面对质疑时退缩——你只要问一句“确定吗?”,它就推翻原本正确的答案。
    • 吹捧糟糕输入——还没分析,就先赞同你漏洞百出的计划非常出色。
    • 受叙述方式影响——当你暗示作品出自自己时,审查更偏正面;暗示出自他人时,则更偏负面。同一份产物,却得到不同结论。
    • 模仿——把你的错误原样复述回来,作为对你的确认。

    诊断方法是问:如果没有你的引导,模型还会说同样的话吗?如果唯一发生变化的是你的语气或叙述方式,那就是迎合,而不是分析结果真正改变。

    解决办法是隐藏自己的偏好。用中性方式表达提示,例如说“审查这段代码”,而不是问“这段代码好吗?”。

    避免:把任何恰好让你满意的错误回答都称为“迎合”。如果没有经过上述诊断,这个术语并不比“错误”更有价值。

    用法:

    “它先说我的重构计划很好,我问了一句‘确定吗?’,它就把整套评价全部收回了。”

    “典型的迎合——你听起来很自信时,它先表示赞同;你表现出怀疑时,它又立刻退缩。计划质量没有变化,变化的是你的语气。清空会话,用不暗示任何倾向的方式重新提问。”

    不只想学术语?

    加入 AI Hero,获取实用技能、AI 工程思考,以及帮助你始终走在前沿的资源。

    没有垃圾邮件,随时可以退订。

    分享