模型提供商是任何能够为推理提供模型的系统。它通常是远程服务(Anthropic、OpenAI、Google),也可以运行在本地——例如你自己机器上的 Ollama、LM Studio 或 llama.cpp。运行框架并不亲自运行模型,而是请求提供商来运行。
提供商掌管运行模型的机器:参数位于它的硬件上,而每次模型提供商请求,都是运行框架通过网络发送 Token,再接收预测结果。因此,有一整类常被误归因于模型或运行框架的问题,其实来自提供商——速率限制、容量下降和服务中断都属于这一层。当智能体在会话中途卡住,或每个轮次都报错时,最先值得检查的是提供商的状态页。
提供商还决定商业条款:输入与输出 Token 的单价、前缀缓存折扣,以及究竟提供哪些模型。注意,提供商与模型制造方可能是不同公司——Bedrock、Vertex 和 OpenRouter 都会提供其他公司制造的模型。
本地提供商以能力换取控制权:能装进自有硬件的模型远小于前沿模型,但数据不会离开机器,也没有按 Token 计算的账单。
用法:
“能为这位物理隔离环境中的客户离线运行吗?”
“把模型提供商换成本地的——在他们的机器上运行 Ollama 或 llama.cpp。运行框架并不在意,它只是改为请求另一个端点。”