推理是运行一个已经训练好的模型来生成输出,也就是每次模型提供商请求中发生的事情。参数保持不变;模型只会基于它获得的上下文进行下一 Token 预测。与训练相比,推理成本较低,但会按 Token 计费,也是使用模型时最主要的成本。
模型的一生分为两个阶段:
| 阶段 | 发生时间 | 作用 | 参数 |
|---|---|---|---|
| 训练 | 发布前,仅一次 | 从训练语料库中生成参数 | 正在写入 |
| 推理 | 每次有人使用模型时 | 用冻结的参数处理你的上下文并生成 Token | 只读 |
你在推理阶段做的任何事情都不会回写到参数中——这就是为什么你今天纠正的问题,明天不会自动保留下来。模型在下一次会话中犯下同样的错误时,即便你之前已经认真解释过修复方法,也不是它无视了你;而是它根本无法从那次交流中学习。模型是无状态的——连续性必须由模型外部提供,例如上下文窗口或记忆系统。
这一机制也解释了计费方式。每个请求都会让模型处理完整上下文,因此成本会随着输入 Token和输出 Token的数量增长;一个会进行数十次工具调用的智能体,需要为每一轮往返支付推理成本。因此,上下文大小既关乎质量,也关乎成本。
用法:
“为什么账单会随使用量增长,而不是收取固定许可费?”
“你付的是推理费用——每次模型提供商请求都会在提供商的硬件上运行模型。训练早已完成,但推理成本会按请求累积;调用工具时,单个轮次就可能扩展成许多个请求。”