服务启动

vLLM 可以直接以 OpenAI API 兼容模式启动服务:

vllm serve Qwen/Qwen2.5-7B-Instruct \
  --host 0.0.0.0 \
  --port 8000 \
  --tensor-parallel-size 1

常见关注点

显存

显存占用主要来自模型权重、KV Cache 和运行时 buffer。并发越高,KV Cache 压力越明显。

吞吐

吞吐通常和 batch、上下文长度、模型大小、GPU 类型有关。线上服务需要同时观察 TTFT 和 TPOT。

服务边界

实际部署时不要只看单请求速度,还要看:

  • 最大并发。
  • 长上下文请求比例。
  • 流式输出稳定性。
  • 超时和取消请求处理。
  • Prometheus 指标。

小结

vLLM 的优势在于把大模型推理中的调度和 KV Cache 管理做得足够工程化,但最终效果仍然依赖模型、硬件和请求分布。