AIHero

    失败模式

    注意力退化

    随着会话增长,每个 Token 的注意力预算要分配给更多竞争项,有意义关系上的信号便会减弱。

    Matt Pocock
    Matt Pocock

    随着会话增长,每个 Token注意力预算会分摊给越来越多的竞争者。任何一条有意义的注意力关系都会变弱,无关上下文产生的噪声则不断挤入。模型没有变,参数也没有变——只是同一个盘子里需要分食的对象更多了。这正是聪明区 / 迟钝区效应的成因。

    它表现为模型在会话中途逐渐变差:遵守了一个小时的约束开始松动;已经告知的内容又被重新询问;写出的代码忽略了早先读过的文件。模型本身没有发生任何变化,唯一的变量是它现在需要关注的上下文总量。

    注意力退化是渐进发生的,因此很难从会话内部及时察觉。它没有错误提示,也没有明确阈值;每个轮次只比上一个略差一点,等到偏差变得明显时,你通常已经在迟钝区停留了一段时间。

    恢复的方法是减少上下文,而不是继续增加。重新粘贴被忽略的指令,只会在同一个拥挤窗口中加入另一个竞争者,最多短暂有效。真正有效的做法包括:清空并只重新加载任务所需内容、进行压缩,或交接给全新会话。应把指令遵循能力下降视为上下文长度信号,而不是模型能力突然变化。

    用法:

    “它已经深陷迟钝区——开始编造类型文件中根本不存在的泛型。”

    “这是注意力退化。类型定义仍在上下文里,但它们的信号已经被后来加入的所有内容淹没。清空并重新加载。”

    不只想学术语?

    加入 AI Hero,获取实用技能、AI 工程思考,以及帮助你始终走在前沿的资源。

    没有垃圾邮件,随时可以退订。

    分享