ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

Nano-VLLM全代码解析笔记(9)-qwen3.5介绍

Nano-VLLM全代码解析笔记(9)-qwen3.5介绍 前言Nano-VLLM的全代码以及MOE改造均已完成从上一篇的笔记可以看出Nano-VLLM这个项目是存在瓶颈的很多实现都比较粗糙对模型的高效支持也仅限全注意力的稠密架构文本模型。接下来的章节是对Nano-VLLM的魔改以支持Qwen3.5-0.8B混合注意力MTP视觉编码器主要参考代码为VLLM源码和Transformers源码本节简单介绍Qwen3.5-0.8B它与Qwen3-0.6B的区别以及接下来需要改造的地方本节参考资料Qwen3.5技术报告(49 封私信) Qwen3.5技术报告解读 - 知乎(49 封私信) Qwen3.5 架构最全拆解Linear Attention 源码配图解析、Gated DeltaRule 公式源码逻辑介绍、Full Attention与 MoE 模块算子流程解析 - 知乎TODO LIST已完成Qwen3.5架构介绍正在完成新的MRoPE支持的全注意力层待完成GDN线性注意力层待完成多模态支持视觉塔/多模态预处理/多模态条件生成类/权重加载待完成引擎LLMEngine/Sequence/Scheduler/ModelRunner修改待完成MTP支持待完成流式输出与多请求支持Qwen3.5架构介绍Qwen3.5相比于Qwen3的核心区别在于混合注意力架构原来的全注意力层变成了三层线性注意力加一层全注意力层和MoE架构大幅降低了计算成本约50%。同时加入了MTPMulti-Token Prediction和视觉编码器同时对RMSNorm进行了调整yx/RMS(x)​×γ变为了yx/RMS(x)​×(γ1)。以下是两代模型的架构图Qwen3.5这里只放了文本模型的架构视觉特征是经过Qwen3_VIT得到再输入模型的需要额外的模型支持Qwen3-0.6B(图来自知乎北方的郎)Nano-VLLM要改造的地方首先让我们回顾一下Nano-VLLM的文件架构仓库架构为了适配Qwen3.5-0.8B混合注意力MTP视觉编码器我们需要做的改变有按接下来的代码讲解顺序1.(layers)新的MRoPE支持的全注意力层2.(layers)GDN线性注意力层3.(layers)多模态支持4.(engine)引擎适配模型5.(models)MTP支持接下来是代码魔改与讲解完成的可能比较慢敬请期待。本系列文章(待写完修正)[1]Nano-VLLM全代码解析笔记(1)-sequence[2]Nano-VLLM全代码解析笔记(2)-block_manager[3]Nano-VLLM全代码解析笔记(3)-llm_engine和scheduler[4]Nano-VLLM全代码解析笔记(4)-model_runner[5]Nano-VLLM全代码解析笔记(5)-laynorm和attention[6]Nano-VLLM全代码解析笔记(6)-embed_head和linear[7]Nano-VLLM全代码解析笔记(7)-rotary_embedding[8]Nano-VLLM全代码解析笔记(8)-qwen3与qwen3_moe上一篇[8]Nano-VLLM全代码解析笔记(8)-qwen3与qwen3_moe
返回列表