选择 LLM 前要问的 5 个问题
了解如何为 AI 应用选择合适的 LLM,包括开放与闭源模型、成本、延迟和托管方式等关键因素。
本页目录
选择合适的模型对 AI 应用能否成功至关重要,但这并不是一个容易作出的决定。
这是一个艰难而且涉及多层因素的决定,也绝不是只做一次;你必须 反复作出选择 ,因为新模型会不断出现,你的应用也会持续演进。
我把这个决定拆成了几个关键问题。每次选择模型时,你都应该先问问自己这些问题。
1. 应该使用开放模型还是闭源模型?
可供选择的模型主要分为两类: open and closed.
开放模型
开放模型可以免费下载和使用。但如果要用它们构建应用,你需要自行托管和运行模型。
开放模型既可以运行在自己的硬件上,也可以部署到 AWS、Azure 等云服务商。
可以查看 Open LLM 排行榜 ,从中寻找合适的开放模型。
闭源模型
闭源模型由公司控制。使用它们需要付费,但模型由公司负责托管,因此你不必自行处理运行和维护。
目前全球能力最强的模型仍然是闭源模型,不过开放模型也在持续进步。
Chatbot Arena 适合用来比较闭源模型与开放模型。
模型提供商、API 提供商与自行托管模型
替你托管模型并提供调用服务的公司主要有两类:
模型提供商 使用闭源模型。你付费调用模型,而模型由相应公司托管,包括 OpenAI、Google、Anthropic、DeepSeek 等。
API 提供商 托管开放模型,并按使用量收费,例如 Hugging Face、Groq 等。
你也可以自行托管模型。这是最灵活、但通常也是最昂贵的选择。你需要承担运行模型的硬件成本,并负责保证服务持续可用。
想继续深入: 加入“面向真正工程师的 AI 编码”候补名单
2. 成本是多少?
LLM 的付费方式取决于模型是否由你自行托管。
按 Token 计费
大多数模型提供商按 Token 收费。使用的 Token 越多,费用越高;最常见的标价方式是“每 100 万 Token 的费用”。
费用不仅包括 输入 Token (你发送给模型的内容),还包括输出 Token(模型回复的内容)。
这是一种传统的按量付费模式,类似无服务器平台按计算时间收费。Token 可以较合理地衡量你对模型的使用量。
为了争夺市场份额,全球模型公司的 Token 价格正在不断下探。可以使用价格比较网站,例如 Helicone 的价格页面 来比较不同模型的价格。
托管开放模型
托管开放模型有时更具成本效益。你不再按 Token 付费,而是支付固定的模型托管费用。
这样还有一个好处:数据完全由你掌控。对于数据驻留和隐私要求,这一点可能非常重要。
不过,模型需要运行在强大的硬件上,成本可能很高。你需要在自托管费用与使用 模型提供商.
我的一般建议是先从第三方 API 开始。它们灵活性最高,成本也相对合理。以后确有需要时,再迁移到自行托管模型。
3. 延迟有多重要?
另一个需要考虑的重要特性是 latency。延迟大致表示模型响应一次查询所需的时间。快速响应对许多场景至关重要,也会让应用对用户更有价值。
延迟会受到 模型大小 影响——小模型运行得更快,但准确度通常也更低。
延迟还会受到 hardware 影响。硬件性能越强,模型运行得越快。
最后,延迟也会受到模型所采用的 推理优化 影响。这些优化可以加快模型推理,包括量化、蒸馏和并行处理等,不过它们已经超出本文讨论范围。
衡量延迟
衡量延迟时主要关注两个指标:
- TTFT:首个 Token 时间:模型开始生成响应所需的时间
- TPOT:每个输出 Token 的生成时间:模型生成每个 Token 所需的时间
4. 如何评估模型表现?
成本和延迟很重要,但如果模型无法完成所需任务,它就毫无用处。
一般来说,小模型的表现会更差。小模型参数更少,因此用于存储信息的空间也更小。
公开基准测试
模型表现是一个很难准确把握的指标。面对两个模型,通常很难直接断言哪一个更好。
模型提供商和开源项目常用的方法是运行基准测试。基准测试是一组标准化测试,用于衡量模型在特定任务上的表现,例如翻译、摘要、问答或编码。
基准测试可以作为判断模型表现的早期参考,但模型提供商始终存在针对基准过拟合的风险。这可能是模型在预训练时意外读到了基准数据,也可能来自组织内部提高基准分数的压力。
有些基准会让模型相互对比,再由人类判断哪个模型生成的结果更好。 Chatbot Arena 就是一个很好的例子,适合用来初步了解模型表现。
专用模型
某些模型在特定任务上表现更好,这通常取决于它们的训练数据。如果模型使用大量代码示例训练,它往往更擅长编码;翻译、分类、摘要等领域也是如此。
如果任务高度专业,值得寻找专门针对该任务训练的模型。这类模型通常会超过通用模型,而且往往体积更小,因此速度更快、效率更高。
推理模型
有些模型经过专门设计,会在回答前先停下来思考。它们属于 reasoning 模型类别,这一趋势由 OpenAI 的 o1 开启。
这类模型通常更擅长需要前瞻规划和批判性思考的任务,例如编码和数学问题。它们还会通过推理 Token 输出规划过程,适合实时流式展示给用户。
不过,它们通常比普通模型更昂贵,响应时间也更长。这是在表现与延迟之间作出的权衡。
评测
真正评估模型的唯一方法,是把它放进你的应用环境中测试。这正是为系统建立评测如此重要的原因。
评测 是一组在你自己的系统上运行的基准测试。它们能显示系统表现是在逐步改善还是恶化。后面我们会更深入地讨论评测。
5. 需要多大的上下文窗口?
可以查看 上下文窗口 表示模型一次能够看到的 Token 数量。上下文窗口越大,模型生成下一个词时可利用的信息就越多。
这个限制以 Token 计算,同时包含输入 Token 和输出 Token。输入过长,或要求模型生成过长响应,都可能导致 API 错误,甚至让模型无法给出响应。
上下文窗口大小与模型生成文本的机制有关,因此取决于模型本身的设计。上下文窗口一直在扩大;目前 Gemini 模型拥有最大的上下文窗口。
所有模型的上下文窗口都有限,因此管理上下文始终是 AI 工程师面临的挑战。RAG 中的分块等模式,就是为了把更多信息放进有限的上下文窗口。
总结
选择模型时,需要重点考虑以下五个因素:
- 开放或闭源
- 成本
- 延迟
- 表现
- 上下文窗口
排行榜和基准测试适合作为起点,但真正判断模型是否合适的唯一方法,仍是在自己的应用中使用自有评测进行实验。