Skip to content

LiteLLM

开源多厂商统一层:Python SDK + 可自托管的 OpenAI 兼容 LLM 网关(Proxy)。

它是做什么的

LiteLLM 用 OpenAI 格式调用 100+ LLM 提供商(OpenAI、Anthropic、Vertex AI、Bedrock、Azure、Ollama、vLLM 等)。两条主路径:① Python SDK(completion() / embedding() 等),嵌进应用;② Proxy Server(自建网关),对上游客户端表现为 OpenAI 兼容服务。Proxy 侧可提供虚拟 Key、预算、限流、日志、护栏、Admin UI 等平台能力(以官方文档为准)。异常类型也会尽量映射到 OpenAI 风格,便于统一错误处理。

简单说:业务只认 OpenAI 形态;真正打到哪家云、哪台本地引擎,由 LiteLLM 配置决定。适合平台组把「模型接入」从每个业务仓库里抽出来,集中做密钥轮换、降级与观测。

要点

  • 统一接口:各厂商输入输出尽量映射到 OpenAI Chat Completions 形态;SDK 与 Proxy 都围绕这一约定。
  • SDK:可直接嵌进 Python;Router 支持重试、fallback、多部署负载均衡。
  • Proxy / Gateway:CLI(如 litellm --model ...)或 Docker 启动;客户端只改 base_url(文档示例常见 http://0.0.0.0:4000)。
  • 平台能力:虚拟 Key、按团队/用户花费追踪、可观测回调(Langfuse、MLflow 等)、Guardrails。
  • 和 OpenRouter 比:OpenRouter 是托管聚合 API;LiteLLM 是你自己部署或嵌入的统一层,密钥与路由策略可控。企业内网、本地模型与云 API 混部时,Proxy 往往更合适。

适合谁

  • 后端要接很多模型厂家,想少改业务代码
  • 平台团队要自建 LLM 网关(鉴权、配额、日志、护栏)
  • 已有 OpenAI 兼容客户端,需要透明切换上游(含本地 Ollama / vLLM)
  • 需要把云厂商 API 与本地推理统一到一个对内 base_url 的中台/基建团队

官方入口

建议怎么用

先用 SDK 对单一 provider 跑通 completion(),确认流式与异常行为。再上 Proxy:用 config.yaml 挂多家模型与本地引擎(含 Ollama / vLLM),用 OpenAI 客户端打本地网关做冒烟。生产再开虚拟 Key、预算、限流与日志,并按团队拆分权限。若只想托管聚合、不想运维网关,可看 OpenRouter

本站为个人非经营性学习导航。免责声明:信息仅供学习参考,不构成建议或背书;外链与第三方产品归其权利人。详情见 关于本站 · 隐私政策