在会话早期,智能体处于“聪明区”:思路敏锐、注意力集中、回忆准确。随着会话增长,它会逐渐滑入“迟钝区”:变得潦草、健忘、错误更多,忠实性幻觉也更多。模型没有变,运行框架也没有变,只是上下文变多了。这就是注意力退化带来的直观感受。对于前沿模型,迟钝区通常被认为从约 125K–150K Token 开始,不过这一数值仍有争议。会话膨胀时应清空或压缩,不要硬撑。
性能下降是渐进发生的,因此很容易被忽略。没有错误消息,也没有可见边界;智能体只是先变差一点,随后变得明显更差。常见迹象包括:忘记你在 20 个轮次前给出的指令,重复已经纠正过的错误,或自信地断言与上下文明显矛盾的内容。因为退化过程很平滑,人通常会选择继续推进并重新解释——这又增加了更多上下文,让问题进一步恶化。
聪明区和迟钝区并不等同于上下文窗口上限。即使窗口大部分仍为空闲,会话也可能已经深陷迟钝区:窗口上限只决定运行框架何时拒绝继续,而质量早在那之前就会下降。规划工作时应围绕聪明区,而不是围绕理论窗口容量——任务的实际预算,是智能体能够保持良好工作的 Token 数量,而不是技术上最多能容纳多少。
聪明区是一份预算,无关工作同样会消耗它。会话中完成的每项任务都会占用 Token,因此在同一会话开始第二项任务,就意味着它从更靠近迟钝区的位置起步。每个会话只做一项任务,可以让每项任务都获得会话最敏锐的阶段。如果单项任务大到超过一个聪明区,就应拆分:在自然边界进行交接或压缩,让全新会话完成下一部分。
用法:
“前三个组件都做得很好,第四个却完全搞砸了。”
“已经离开聪明区了——模型还是同一个,只是现在深入迟钝区。压缩会话并重新加载计划,下一个组件就能正常完成。”