AIHero
    04 / 07AI 工程师路线图 · 阅读约 7 分钟

    选择 LLM 前要问的 5 个问题

    了解如何为 AI 应用选择合适的 LLM,包括开放与闭源模型、成本、延迟和托管方式等关键因素。

    Matt Pocock
    Matt Pocock
    下一课
    本页目录

    选择合适的模型对 AI 应用能否成功至关重要,但这并不是一个容易作出的决定。

    这是一个艰难而且涉及多层因素的决定,也绝不是只做一次;你必须 反复作出选择 ,因为新模型会不断出现,你的应用也会持续演进。

    我把这个决定拆成了几个关键问题。每次选择模型时,你都应该先问问自己这些问题。

    1. 应该使用开放模型还是闭源模型?

    可供选择的模型主要分为两类: open and closed.

    开放模型

    开放模型可以免费下载和使用。但如果要用它们构建应用,你需要自行托管和运行模型。

    开放模型既可以运行在自己的硬件上,也可以部署到 AWS、Azure 等云服务商。

    可以查看 Open LLM 排行榜 ,从中寻找合适的开放模型。

    闭源模型

    闭源模型由公司控制。使用它们需要付费,但模型由公司负责托管,因此你不必自行处理运行和维护。

    目前全球能力最强的模型仍然是闭源模型,不过开放模型也在持续进步。

    Chatbot Arena 适合用来比较闭源模型与开放模型。

    模型提供商、API 提供商与自行托管模型

    替你托管模型并提供调用服务的公司主要有两类:

    模型提供商 使用闭源模型。你付费调用模型,而模型由相应公司托管,包括 OpenAI、Google、Anthropic、DeepSeek 等。

    API 提供商 托管开放模型,并按使用量收费,例如 Hugging Face、Groq 等。

    你也可以自行托管模型。这是最灵活、但通常也是最昂贵的选择。你需要承担运行模型的硬件成本,并负责保证服务持续可用。

    2. 成本是多少?

    LLM 的付费方式取决于模型是否由你自行托管。

    按 Token 计费

    大多数模型提供商按 Token 收费。使用的 Token 越多,费用越高;最常见的标价方式是“每 100 万 Token 的费用”。

    费用不仅包括 输入 Token (你发送给模型的内容),还包括输出 Token(模型回复的内容)。

    这是一种传统的按量付费模式,类似无服务器平台按计算时间收费。Token 可以较合理地衡量你对模型的使用量。

    为了争夺市场份额,全球模型公司的 Token 价格正在不断下探。可以使用价格比较网站,例如 Helicone 的价格页面 来比较不同模型的价格。

    托管开放模型

    托管开放模型有时更具成本效益。你不再按 Token 付费,而是支付固定的模型托管费用。

    这样还有一个好处:数据完全由你掌控。对于数据驻留和隐私要求,这一点可能非常重要。

    不过,模型需要运行在强大的硬件上,成本可能很高。你需要在自托管费用与使用 模型提供商.

    我的一般建议是先从第三方 API 开始。它们灵活性最高,成本也相对合理。以后确有需要时,再迁移到自行托管模型。

    3. 延迟有多重要?

    另一个需要考虑的重要特性是 latency。延迟大致表示模型响应一次查询所需的时间。快速响应对许多场景至关重要,也会让应用对用户更有价值。

    延迟会受到 模型大小 影响——小模型运行得更快,但准确度通常也更低。

    延迟还会受到 hardware 影响。硬件性能越强,模型运行得越快。

    最后,延迟也会受到模型所采用的 推理优化 影响。这些优化可以加快模型推理,包括量化、蒸馏和并行处理等,不过它们已经超出本文讨论范围。

    衡量延迟

    衡量延迟时主要关注两个指标:

    • TTFT:首个 Token 时间:模型开始生成响应所需的时间
    • TPOT:每个输出 Token 的生成时间:模型生成每个 Token 所需的时间

    4. 如何评估模型表现?

    成本和延迟很重要,但如果模型无法完成所需任务,它就毫无用处。

    一般来说,小模型的表现会更差。小模型参数更少,因此用于存储信息的空间也更小。

    公开基准测试

    模型表现是一个很难准确把握的指标。面对两个模型,通常很难直接断言哪一个更好。

    模型提供商和开源项目常用的方法是运行基准测试。基准测试是一组标准化测试,用于衡量模型在特定任务上的表现,例如翻译、摘要、问答或编码。

    基准测试可以作为判断模型表现的早期参考,但模型提供商始终存在针对基准过拟合的风险。这可能是模型在预训练时意外读到了基准数据,也可能来自组织内部提高基准分数的压力。

    有些基准会让模型相互对比,再由人类判断哪个模型生成的结果更好。 Chatbot Arena 就是一个很好的例子,适合用来初步了解模型表现。

    专用模型

    某些模型在特定任务上表现更好,这通常取决于它们的训练数据。如果模型使用大量代码示例训练,它往往更擅长编码;翻译、分类、摘要等领域也是如此。

    如果任务高度专业,值得寻找专门针对该任务训练的模型。这类模型通常会超过通用模型,而且往往体积更小,因此速度更快、效率更高。

    推理模型

    有些模型经过专门设计,会在回答前先停下来思考。它们属于 reasoning 模型类别,这一趋势由 OpenAI 的 o1 开启。

    这类模型通常更擅长需要前瞻规划和批判性思考的任务,例如编码和数学问题。它们还会通过推理 Token 输出规划过程,适合实时流式展示给用户。

    不过,它们通常比普通模型更昂贵,响应时间也更长。这是在表现与延迟之间作出的权衡。

    评测

    真正评估模型的唯一方法,是把它放进你的应用环境中测试。这正是为系统建立评测如此重要的原因。

    评测 是一组在你自己的系统上运行的基准测试。它们能显示系统表现是在逐步改善还是恶化。后面我们会更深入地讨论评测。

    5. 需要多大的上下文窗口?

    可以查看 上下文窗口 表示模型一次能够看到的 Token 数量。上下文窗口越大,模型生成下一个词时可利用的信息就越多。

    这个限制以 Token 计算,同时包含输入 Token 和输出 Token。输入过长,或要求模型生成过长响应,都可能导致 API 错误,甚至让模型无法给出响应。

    上下文窗口大小与模型生成文本的机制有关,因此取决于模型本身的设计。上下文窗口一直在扩大;目前 Gemini 模型拥有最大的上下文窗口。

    所有模型的上下文窗口都有限,因此管理上下文始终是 AI 工程师面临的挑战。RAG 中的分块等模式,就是为了把更多信息放进有限的上下文窗口。

    总结

    选择模型时,需要重点考虑以下五个因素:

    • 开放或闭源
    • 成本
    • 延迟
    • 表现
    • 上下文窗口

    排行榜和基准测试适合作为起点,但真正判断模型是否合适的唯一方法,仍是在自己的应用中使用自有评测进行实验。

    登录以保存进度。