外观
vLLM
高吞吐 LLM 推理与 Serving 引擎,常用来对外提供 OpenAI 兼容接口。
它是做什么的
vLLM 面向「多请求、低延迟、高吞吐」的模型推理与在线服务。官方卖点包括 PagedAttention 显存管理、continuous batching、chunked prefill、前缀缓存、多种并行(张量/流水线/专家等)与量化路径。对接 Hugging Face 模型生态,提供 OpenAI 兼容 API Server(另有 Anthropic Messages、gRPC 等)。适合 GPU 服务器上把开源模型做成稳定服务,而不是桌面一键聊天。
和「本机试用」工具的分工很清楚:你负责机器、驱动、模型权重与并发容量;vLLM 负责把这些资源吃满并对外提供稳定 HTTP 服务。文档 Quickstart 建议先离线批推理确认环境,再上线 serving。
要点
- Serving 取向:核心是服务吞吐与显存效率;Quickstart 同时覆盖离线 batched inference 与 online serving。
- OpenAI 兼容:文档专页 OpenAI Compatible Server;现有 OpenAI 客户端改
base_url与模型名即可验证。 - 硬件面宽:NVIDIA / AMD GPU 为主路径;文档也列出 CPU 与多种硬件插件(以当前安装指南为准)。
- 模型面宽:支持大量 HF 架构(稠密/MoE、多模态、嵌入、reward/分类等),具体名单看官方 Supported Models。
- 和同类比:比 Ollama / LM Studio 更偏生产 Serving;比 llama.cpp 更偏 GPU 高并发与 HF 权重生态。
适合谁
- 有 GPU(或对应加速硬件),要给多人/多服务共用同一模型
- 想用 OpenAI SDK 打自建推理服务,少改业务代码
- 需要离线批推理、在线流式输出、结构化输出或工具调用解析等 Serving 能力
- 已经过了「本机能聊」阶段,开始关心吞吐、显存碎片与并发排队
官方入口
建议怎么用
按 Quickstart 装环境(官方推荐 Linux + 较新 Python,常用 uv/pip),先跑通离线推理,再起 OpenAI Compatible Server。用现有 OpenAI 客户端只改 base_url 做联调,确认流式、工具调用等路径是否满足业务。再按并发与显存调并行度、量化与缓存;上线前用真实 QPS 压一轮。本机轻量试用优先 Ollama;要嵌进无 Python 栈的程序看 llama.cpp。