服务启动
vLLM 可以直接以 OpenAI API 兼容模式启动服务:
vllm serve Qwen/Qwen2.5-7B-Instruct \
--host 0.0.0.0 \
--port 8000 \
--tensor-parallel-size 1
常见关注点
显存
显存占用主要来自模型权重、KV Cache 和运行时 buffer。并发越高,KV Cache 压力越明显。
吞吐
吞吐通常和 batch、上下文长度、模型大小、GPU 类型有关。线上服务需要同时观察 TTFT 和 TPOT。
服务边界
实际部署时不要只看单请求速度,还要看:
- 最大并发。
- 长上下文请求比例。
- 流式输出稳定性。
- 超时和取消请求处理。
- Prometheus 指标。
小结
vLLM 的优势在于把大模型推理中的调度和 KV Cache 管理做得足够工程化,但最终效果仍然依赖模型、硬件和请求分布。