输入 Token 是运行框架在每次模型提供商请求中发送的 Token——包括系统提示词、对话历史、工具结果,也就是模型在写出内容前读取的一切。输入 Token 的费率低于输出 Token,因为处理输入的计算成本更低。
进行 AI 编程时,账单的大部分通常来自输入 Token。模型是无状态的,因此每个轮次都会把整个会话重新作为输入发送:你的第一条消息、此后的每个回复和每个工具结果。第 50 个轮次的输入包含之前 49 个轮次。一次模型提供商请求可能只生成几百个输出 Token,却会重新发送十万个由历史累积而来的输入 Token。
前缀缓存会降低这部分成本:与先前请求完全匹配的历史,会按更便宜的缓存 Token计费,而不是按原价输入计费。如果输入成本仍然过高,解决办法是缩小每次重发的内容——在任务之间进行清空或压缩。
用法:
“账单很高,但智能体几乎没写什么内容。”
“成本来自输入 Token——每个轮次都会重新发送整个会话。没有前缀缓存时,每个请求都要再次为这段历史付费。”