<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
	<channel>
		<title>Inference on chengzhycn&#39;s blog</title>
		<link>https://blog.jinzhi.site/tags/inference/</link>
		<description>Recent content in Inference on chengzhycn&#39;s blog</description>
		<generator>Hugo</generator>
		<language>en-us</language>
		
		
		
		
			<lastBuildDate>Tue, 27 Jan 2026 09:18:28 +0800</lastBuildDate>
		
			<atom:link href="https://blog.jinzhi.site/tags/inference/index.xml" rel="self" type="application/rss+xml" />
			<item>
				<title>nano-vllm 代码流程</title>
				<link>https://blog.jinzhi.site/posts/2026-01/nano-vllm-%E4%BB%A3%E7%A0%81%E6%B5%81%E7%A8%8B/</link>
				<pubDate>Tue, 27 Jan 2026 09:18:28 +0800</pubDate>
				<guid>https://blog.jinzhi.site/posts/2026-01/nano-vllm-%E4%BB%A3%E7%A0%81%E6%B5%81%E7%A8%8B/</guid>
				<description>&lt;h2 id=&#34;整体架构图&#34;&gt;整体架构图&lt;/h2&gt;&#xA;&lt;pre tabindex=&#34;0&#34;&gt;&lt;code&gt;┌─────────────────────────────────────────────────────────────────┐&#xA;│                         用户入口层                               │&#xA;│  example.py → LLM.generate() → add_request() + step() 循环      │&#xA;└─────────────────────────────────────────────────────────────────┘&#xA;                                │&#xA;                                ▼&#xA;┌─────────────────────────────────────────────────────────────────┐&#xA;│                         引擎层 (Engine)                          │&#xA;│  ┌─────────────┐   ┌─────────────┐   ┌──────────────────┐      │&#xA;│  │  Scheduler  │ → │ ModelRunner │ → │  BlockManager    │      │&#xA;│  │  (调度器)    │   │ (模型执行器) │   │  (KV Cache管理)  │      │&#xA;│  └─────────────┘   └─────────────┘   └──────────────────┘      │&#xA;└─────────────────────────────────────────────────────────────────┘&#xA;                                │&#xA;                                ▼&#xA;┌─────────────────────────────────────────────────────────────────┐&#xA;│                         模型层 (Models)                          │&#xA;│  Qwen3ForCausalLM → Qwen3Model → [Qwen3DecoderLayer x N]       │&#xA;└─────────────────────────────────────────────────────────────────┘&#xA;                                │&#xA;                                ▼&#xA;┌─────────────────────────────────────────────────────────────────┐&#xA;│                         算子层 (Layers)                          │&#xA;│  Attention │ Linear │ LayerNorm │ RoPE │ Activation │ Sampler  │&#xA;└─────────────────────────────────────────────────────────────────┘&#xA;&lt;/code&gt;&lt;/pre&gt;&lt;h2 id=&#34;推理服务流程详解&#34;&gt;推理服务流程详解&lt;/h2&gt;&#xA;&lt;h3 id=&#34;阶段-1-初始化阶段&#34;&gt;阶段 1: 初始化阶段&lt;/h3&gt;&#xA;&lt;div class=&#34;highlight&#34;&gt;&lt;pre tabindex=&#34;0&#34; class=&#34;chroma&#34;&gt;&lt;code class=&#34;language-python&#34; data-lang=&#34;python&#34;&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;&lt;span class=&#34;c1&#34;&gt;# example.py&lt;/span&gt;&#xA;&lt;/span&gt;&lt;/span&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;&lt;span class=&#34;n&#34;&gt;llm&lt;/span&gt; &lt;span class=&#34;o&#34;&gt;=&lt;/span&gt; &lt;span class=&#34;n&#34;&gt;LLM&lt;/span&gt;&lt;span class=&#34;p&#34;&gt;(&lt;/span&gt;&lt;span class=&#34;n&#34;&gt;path&lt;/span&gt;&lt;span class=&#34;p&#34;&gt;,&lt;/span&gt; &lt;span class=&#34;n&#34;&gt;enforce_eager&lt;/span&gt;&lt;span class=&#34;o&#34;&gt;=&lt;/span&gt;&lt;span class=&#34;kc&#34;&gt;True&lt;/span&gt;&lt;span class=&#34;p&#34;&gt;,&lt;/span&gt; &lt;span class=&#34;n&#34;&gt;tensor_parallel_size&lt;/span&gt;&lt;span class=&#34;o&#34;&gt;=&lt;/span&gt;&lt;span class=&#34;mi&#34;&gt;1&lt;/span&gt;&lt;span class=&#34;p&#34;&gt;)&lt;/span&gt;&#xA;&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;&lt;strong&gt;调用链：&lt;/strong&gt;&lt;/p&gt;</description>
			</item>
	</channel>
</rss>
