☆Suryxin☆

Suryxin

We can't predict the value of a moment until it becomes a memory.

Latest Posts

最新文章

model_runner下半篇之核心数据编排与执行引擎调度

vllm ▧ 2,501 字 ◴ 9 分钟

prepare\prefill和prepare\block\tables prepareprefill 函数的作用,本质上是为大模型推理中的 prefill 阶段做一次完整的数据整理与运行时环境构建,它并不是简单地把多个序列拼接起来,而是在

scheduler

vllm ▧ 1,781 字 ◴ 6 分钟

Scheduler Scheduler是一个推理调度器,,其核心功能是协调序列在等待队列(waiting)和运行队列(running)之间的流转,并根据显存可用性决定是执行新序列的预填充(Prefill)还是现有序列的解码(Decoding

linear

vllm ▧ 3,254 字 ◴ 11 分钟

linear.py LinearBase 这是所有并行Linear的抽象基类,不是“算线性层”,而是统一管理 Tensor Parallel Linear 的公共状态、参数结构和权重加载协议。 tpdim 是沿着哪个维度做切分,Column

engine/sequence

vllm ▧ 1,394 字 ◴ 5 分钟

engine/sequence.py 单个请求进来以后被封存成Sequence对象,这个函数是定义相关Sequence对象的 SequenceStatus是三种序列的三种生命周期状态, WAITING等待 RUNNING运行中 FINISH

config

vllm ▧ 745 字 ◴ 3 分钟

config.py dataclass是 Python 装饰器,适合于存储数据对象(data object)的Python类,自动生成 init、repr 等方法,大大增加了可读性,以及方便性 AutoConfiga 是 Hugging F

2024年终总结

杂记 ▧ 3,727 字 ◴ 13 分钟

继2023年年终总结以后,便想着以后尽可能都写一下年终总结,但是我这拖延症的毛病又犯了,没有ddl的压力就会让我失去奋斗的力量,所以拖到昨天论文写完,今天才抽出时间回顾一下,写点东西… 一月份的时候还在乾象实习,和刚入职两个月的手忙脚乱相比

llm_engine

vllm ▧ 3,601 字 ◴ 13 分钟

llm\engine 这段代码实现了一个轻量级且高效的大语言模型推理引擎的核心控制器。它的主要作用是充当整个文本生成任务的“总指挥”,对外提供了一个简单易用的批量文本生成接口,对内则完美封装并统筹了所有复杂的底层运行机制——包括文本数据的分

model_runner上半篇之初始化分布式推理环境

vllm ▧ 8,047 字 ◴ 27 分钟

ModelRunner 定义了一个名为 ModelRunner 的核心类,用于在 nanovllm 框架下高效地加载和运行 Qwen3 大语言模型,其主要作用是构建一个支持多 GPU 张量并行(Tensor Parallelism)的高性能

utils/contex

vllm ▧ 1,378 字 ◴ 5 分钟

utils/context.py 这段代码定义了一个全局上下文管理器(Global Context Manager)。 它的核心作用是“传纸条”。在深度学习框架(如 PyTorch)与底层高性能计算核心(CUDA Kernels,比如 Fl

block_manager

vllm ▧ 4,051 字 ◴ 14 分钟

block\manager.py Block 表示的是一段固定大小的 KV cache 存储单元,但它并不是“某个序列的 block”,而是一个可以在多个序列之间流转、被共享、被回收的缓存对象。 一开始,init 给这个 block 一个永

utils/loader

vllm ▧ 4,059 字 ◴ 14 分钟

loader.py 这是加载模型参数的函数,看似很简单,其实大有玄机 在理想世界里,我们可以直接model.loadstatedicttorch.load...,但我们这里做不了,原因有两大点 模型结构和 checkpoint 的“参数组织

sampling_params

vllm ▧ 344 字 ◴ 2 分钟

sampling\params.py SampllingParams类 temperature 定义:温度系数,控制生存随机性的核心参数 作用:在 softmax 归一化之前,将模型输出的 Logits 除以 T T \\to 0:模型变得

vLLM 各核心模块原理深度解析

未分类 ▧ 5,354 字 ◴ 18 分钟

vLLM 各核心模块原理深度解析 请求调度与批处理核心机制:Continuous Batching Continue Batching连续批处理,也被称为IterationLevel Scheduling,是vLLM实现高吞吐量的核心调度机

云原生

杂项 ▧ 4,254 字 ◴ 15 分钟

云原生 为什么需要云原生? 从技术发展趋势看,更多的企业将会广泛应用云原生技术。在国家政策和企业需求的双重驱动下,更多企业上云,以及中国云计算的强势增长都是必然趋势,这也注定了更多企业将会关注、应用、采纳能够充分利用云计算能力的云原生技术和

「力扣面试经典150题」189. 轮转数组

leetcode ▧ 524 字 ◴ 2 分钟

「力扣面试经典150题」189. 轮转数组 题目描述 给定长度为$n$的数组ar,将数组中的元素向右轮转k个位置,其中k是非负数 要求使用空间复杂度为O1的原地算法解决 思路1: 比较粗糙一点的想法是,选定某个位置,从当前位置开始往后找到右

overleaf写学术论文常用语法+注意事项+审阅修订

杂项 ▧ 870 字 ◴ 3 分钟

常用语法 导入常用的宏包 文档开始 题目 摘要 关键词 大标题 小标题 小小标题 小圆点 插入图片 公式 行内公式 带序号的换行公式 引用 导入cite包以后,将所有参考文献以BibTeX格式写到cited.bib文件里 举个例子,第一个参