AIHero

    模型

    输入 Token

    运行框架在每次模型提供商请求中发送的 Token,计费单价通常低于输出 Token。

    Matt Pocock
    Matt Pocock

    输入 Token 是运行框架在每次模型提供商请求中发送的 Token——包括系统提示词、对话历史、工具结果,也就是模型在写出内容前读取的一切。输入 Token 的费率低于输出 Token,因为处理输入的计算成本更低。

    进行 AI 编程时,账单的大部分通常来自输入 Token。模型是无状态的,因此每个轮次都会把整个会话重新作为输入发送:你的第一条消息、此后的每个回复和每个工具结果。第 50 个轮次的输入包含之前 49 个轮次。一次模型提供商请求可能只生成几百个输出 Token,却会重新发送十万个由历史累积而来的输入 Token。

    前缀缓存会降低这部分成本:与先前请求完全匹配的历史,会按更便宜的缓存 Token计费,而不是按原价输入计费。如果输入成本仍然过高,解决办法是缩小每次重发的内容——在任务之间进行清空压缩

    用法:

    “账单很高,但智能体几乎没写什么内容。”

    “成本来自输入 Token——每个轮次都会重新发送整个会话。没有前缀缓存时,每个请求都要再次为这段历史付费。”

    不只想学术语?

    加入 AI Hero,获取实用技能、AI 工程思考,以及帮助你始终走在前沿的资源。

    没有垃圾邮件,随时可以退订。

    分享