AIHero

    模型

    推理

    运行训练好的模型来生成输出;每次向模型提供商发起请求时都会进行推理,期间模型参数保持不变。

    Matt Pocock
    Matt Pocock

    推理是运行一个已经训练好的模型来生成输出,也就是每次模型提供商请求中发生的事情。参数保持不变;模型只会基于它获得的上下文进行下一 Token 预测。与训练相比,推理成本较低,但会按 Token 计费,也是使用模型时最主要的成本。

    模型的一生分为两个阶段:

    阶段发生时间作用参数
    训练发布前,仅一次从训练语料库中生成参数正在写入
    推理每次有人使用模型时用冻结的参数处理你的上下文并生成 Token只读

    你在推理阶段做的任何事情都不会回写到参数中——这就是为什么你今天纠正的问题,明天不会自动保留下来。模型在下一次会话中犯下同样的错误时,即便你之前已经认真解释过修复方法,也不是它无视了你;而是它根本无法从那次交流中学习。模型是无状态的——连续性必须由模型外部提供,例如上下文窗口记忆系统

    这一机制也解释了计费方式。每个请求都会让模型处理完整上下文,因此成本会随着输入 Token输出 Token的数量增长;一个会进行数十次工具调用的智能体,需要为每一轮往返支付推理成本。因此,上下文大小既关乎质量,也关乎成本。

    用法:

    “为什么账单会随使用量增长,而不是收取固定许可费?”

    “你付的是推理费用——每次模型提供商请求都会在提供商的硬件上运行模型。训练早已完成,但推理成本会按请求累积;调用工具时,单个轮次就可能扩展成许多个请求。”

    不只想学术语?

    加入 AI Hero,获取实用技能、AI 工程思考,以及帮助你始终走在前沿的资源。

    没有垃圾邮件,随时可以退订。

    分享