llm_engine
llm\engine 这段代码实现了一个轻量级且高效的大语言模型推理引擎的核心控制器。它的主要作用是充当整个文本生成任务的“总指挥”,对外提供了一个简单易用的批量文本生成接口,对内则完美封装并统筹了所有复杂的底层运行机制——包括文本数据的分
共 13 篇文章。
llm\engine 这段代码实现了一个轻量级且高效的大语言模型推理引擎的核心控制器。它的主要作用是充当整个文本生成任务的“总指挥”,对外提供了一个简单易用的批量文本生成接口,对内则完美封装并统筹了所有复杂的底层运行机制——包括文本数据的分
ModelRunner 定义了一个名为 ModelRunner 的核心类,用于在 nanovllm 框架下高效地加载和运行 Qwen3 大语言模型,其主要作用是构建一个支持多 GPU 张量并行(Tensor Parallelism)的高性能
utils/context.py 这段代码定义了一个全局上下文管理器(Global Context Manager)。 它的核心作用是“传纸条”。在深度学习框架(如 PyTorch)与底层高性能计算核心(CUDA Kernels,比如 Fl
block\manager.py Block 表示的是一段固定大小的 KV cache 存储单元,但它并不是“某个序列的 block”,而是一个可以在多个序列之间流转、被共享、被回收的缓存对象。 一开始,init 给这个 block 一个永
loader.py 这是加载模型参数的函数,看似很简单,其实大有玄机 在理想世界里,我们可以直接model.loadstatedicttorch.load...,但我们这里做不了,原因有两大点 模型结构和 checkpoint 的“参数组织
sampling\params.py SampllingParams类 temperature 定义:温度系数,控制生存随机性的核心参数 作用:在 softmax 归一化之前,将模型输出的 Logits 除以 T T \\to 0:模型变得
vLLM 各核心模块原理深度解析 请求调度与批处理核心机制:Continuous Batching Continue Batching连续批处理,也被称为IterationLevel Scheduling,是vLLM实现高吞吐量的核心调度机
prepare\prefill和prepare\block\tables prepareprefill 函数的作用,本质上是为大模型推理中的 prefill 阶段做一次完整的数据整理与运行时环境构建,它并不是简单地把多个序列拼接起来,而是在
记录 vLLM 服务化部署、吞吐优化和常见参数。
Scheduler Scheduler是一个推理调度器,,其核心功能是协调序列在等待队列(waiting)和运行队列(running)之间的流转,并根据显存可用性决定是执行新序列的预填充(Prefill)还是现有序列的解码(Decoding
linear.py LinearBase 这是所有并行Linear的抽象基类,不是“算线性层”,而是统一管理 Tensor Parallel Linear 的公共状态、参数结构和权重加载协议。 tpdim 是沿着哪个维度做切分,Column
engine/sequence.py 单个请求进来以后被封存成Sequence对象,这个函数是定义相关Sequence对象的 SequenceStatus是三种序列的三种生命周期状态, WAITING等待 RUNNING运行中 FINISH
config.py dataclass是 Python 装饰器,适合于存储数据对象(data object)的Python类,自动生成 init、repr 等方法,大大增加了可读性,以及方便性 AutoConfiga 是 Hugging F