ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

Qwen3.6-27B 量化版来了

Qwen3.6-27B 量化版来了

这次英伟达也下场了,放出了nvidia/Qwen3.6-27B-NVFP4

乍一看很香:官方 ModelOpt 量化,Apache 2.0,vLLM 直接 serve,模型卡写着磁盘和 GPU 显存需求大约降低2.5x

但我翻完模型卡和社区 discussion 后,感觉有必要详细介绍一下

先说结论

  • 显存收益是真实的:官方说把 transformer block 里的 linear operators 权重和激活量化到 NVFP4,参数位宽从 16 bit 降到 4 bit,磁盘和 GPU 显存需求大约降 2.5x
  • 精度基本稳住了:官方评测里 NVFP4 和 FP8 很接近,MMLU Pro 甚至 86.3 vs 86.1,小赢 0.2
  • 性能有分歧:有测试 NVFP4 在 RTX PRO 6000 Blackwell 上 decode 可以跑到 200 t/s 左右,FP8 约 112 t/s;但也有更完整对测里,FP8 在 decode-bound 场景反而快 8-12%
  • 坑也很具体:B200 / DGX Spark / RTX PRO 6000 Blackwell 上都有人遇到 Marlin 警告、modelopt_mixed、以及重复!/dtoken 的问题
  • 生产建议很朴素:显存紧张、长上下文、想跑 27B 的同学可以试 NVFP4;追求稳定吞吐的同学,务必拿 FP8 在同一套 vLLM / FlashInfer / MTP 配置下 A/B

这个模型到底是什么

项目信息
基座Alibaba Qwen3.6-27B
参数量27B
架构Hybrid Attention,Gated DeltaNet + Gated Attention
上下文262K,Qwen 原版还写了可扩展到 1,010,000 tokens
量化工具nvidia-modelopt v0.45.0
量化目标transformer blocks 内 linear operators 的权重与激活
推理引擎vLLM
官方测试硬件NVIDIA GB300
硬件兼容Hopper / Blackwell
LicenseApache 2.0

Qwen3.6-27B 自身的亮点也很明确,主打 Agentic Coding、仓库级推理、Thinking Preservation,以及更长的上下文

对本地部署玩家来说,最关键的其实就两个词:27B + 262K

27B 代表它还在个人工作站和单卡专业卡的想象范围里,262K 代表它适合 Agent、RAG、长文档、代码仓库这类吃上下文的任务

英伟达这次做 NVFP4,理论上的吸引力很直接:把 27B 再压一压,让它更容易塞进显存,同时尽量保住 Qwen3.6 的能力

官方精度表:没明显变傻

官方模型卡给了 NVFP4 和 FP8 的 accuracy benchmark,我把关键数字搬出来

BenchmarkFP8NVFP4差值
MMLU Pro86.186.3+0.2
GPQA Diamond86.085.5-0.5
HLE21.721.8+0.1
τ²-Bench Telecom95.295.4+0.2
MMMU Pro74.674.3-0.3
SciCode44.844.5-0.3
AIME 202593.192.7-0.4
AA-LCR68.868.3-0.5
IFBench65.165.5+0.4

一句话,精度层面基本可以放心,差值大多在 0.5 以内,考虑到 benchmark 本身的波动,这个结果挺漂亮

社区的质量测试也支持这个判断,7 个 prompt 的质量检查,包括诗歌、投诉邮件、HTML todo、HTML Snake、逻辑题转 JSON、merge_intervals、59KB 文档转 JSON

结果很接近:

  • 逻辑题两边都是5/5 correct
  • merge_intervals两边都过6/6 edge cases,都能处理 ValueError,也都没有 mutation
  • 59KB 文档转 JSON 两边都能产出 valid JSON,严重程度都判成high
  • HTML todo 和 Snake 都是 valid single-file,关键 API 存在
  • Thinking mode 下,NVFP4 在一个 trivial Python 任务里 16K token budget 都没把函数收完,FP8 能正确完成

所以我的判断是:正常非思考模式下,NVFP4 没有明显质量塌陷;但做确定性代码任务时,Thinking mode 要谨慎

官方部署方式

NVIDIA 模型卡给的 vLLM 命令很简短

vllm serve nvidia/Qwen3.6-27B-NVFP4 \ --port 8000 \ --quantization modelopt \ --max-model-len 262144 \ --reasoning-parser qwen3

如果你要上工具调用、MTP、前缀缓存、chunked prefill,有 DGX Spark 用户贴过一组更详细的命令

vllm serve ~/models/hf/Qwen3.6-27B-NVFP4 \ --trust-remote-code \ --served-model-name qwen36-27b \ --gpu-memory-utilization 0.45 \ --dtype bfloat16 \ --max-num-seqs 4 \ --max-model-len 131072 \ --reasoning-parser qwen3 \ --enable-auto-tool-choice \ --tool-call-parser qwen3_coder \ --speculative-config '{"method":"mtp","num_speculative_tokens":3}' \ --max-num-batched-tokens 16384 \ --enable-chunked-prefill \ --async-scheduling \ --enable-prefix-caching \ --quantization modelopt

社区实测一:NVFP4 看起来真能打

测试条件:RTX PRO 6000 Blackwell 96GB,开启MTP speculative decoding

先看 NVFP4

Qwen3.6-27B-NVFP4 在 RTX PRO 6000 Blackwell 上的社区实测

再看 FP8

Qwen3.6-27B-FP8 在 RTX PRO 6000 Blackwell 上的社区实测

把图里的关键数字拎出来:

场景NVFP4 decode t/sFP8 decode t/s观察
pp256 / tg32 / d0204112NVFP4 明显高
pp256 / tg256 / d0201111NVFP4 明显高
pp4096 / tg32 / d0117112接近
pp4096 / tg256 / d0159112NVFP4 高
pp16384 / tg32 / d0205119NVFP4 高
pp16384 / tg256 / d0200111NVFP4 高
pp256 / tg32 / d4k161113NVFP4 高
pp4096 / tg32 / d4k203117NVFP4 高
pp16384 / tg32 / d4k204112NVFP4 高
pp256 / tg32 / d8k205113NVFP4 高
pp4096 / tg32 / d8k204117NVFP4 高
pp16384 / tg32 / d8k204113NVFP4 高

NVFP4 decode 都在200 t/s左右,FP8 大多在111-119 t/s区间

但别只看 decode

prefill 上 FP8 反而更强,比如 pp4096 / tg32 / d0,FP8 是9,785 t/s,NVFP4 是6,782 t/s

TTFT 也有类似现象,pp16384 / tg32 / d0,FP8 是1,605 ms,NVFP4 是2,595 ms

某些 decode 场景里,NVFP4 的确能跑出很漂亮的数字;但长 prompt 和 prefill 场景下,FP8 依然有反杀空间

社区实测二:另一组完整对测里,FP8 反而更快

有网友把 NVFP4 和 FP8 放到两张 RTX PRO 6000 Blackwell 96GB 上并行跑

配置大概是:

项目NVFP4FP8
模型nvidia/Qwen3.6-27B-NVFP4Qwen/Qwen3.6-27B-FP8
GPU1× RTX PRO 6000 Blackwell 96GB1× RTX PRO 6000 Blackwell 96GB
vLLM0.24.00.23.1rc1.dev
Spec decodingMTP, 3 tokensMTP, 3 tokens
KV cachefp8_e4m3fp8_e4m3
max len262K262K
gpu util0.920.92
max seqs128128

它的吞吐结论和 前面实测的截图相反:

场景NVFP4FP8结论
single small decode77.1 tok/s84.7 tok/sFP8 +10%
warm TTFT0.09 s0.09 s持平
big prompt decode98.7 tok/s111.0 tok/sFP8 +12%
big prompt prefill~5,700 tok/s / 3.9 s~7,000 tok/s / 3.2 sFP8 更强
16 并发 aggregate891.7 tok/s963.3 tok/sFP8 +8%
16 并发 per-request67.4 tok/s68.5 tok/s接近
4 并发 big aggregate358.9 tok/s342.5 tok/sNVFP4 +5%
4 并发 big per-request100.4 tok/s103.7 tok/s接近

这里我觉得最关键的是这句话:

FP8 在 decode-bound 场景里稳定快 8-12%,NVFP4 只在大 prompt 并发这种 prefill-bound 场景里小幅领先

再看 per-prompt latency,也挺扎心:

PromptNVFP4FP8
捷克语 2000 词故事49.3 s / 74.4 tok/s36.8 s / 87.3 tok/s
HTML todo16.3 s / 104 tok/s15.9 s / 116 tok/s
HTML Snake17.6 s / 124 tok/s15.8 s / 141 tok/s
逻辑题转 JSON2.75 s / 104 tok/s2.6 s / 129 tok/s
Pythonmerge_intervals1.78 s / 122 tok/s1.87 s / 129 tok/s
捷克语投诉邮件11.0 s / 60.5 tok/s6.0 s / 110 tok/s
59KB 转 JSON20.0 s / 103 tok/s25.2 s / 103 tok/s

这组测试有点局限了:两边 vLLM build 不同,attention / MoE backend 也有差异,但它依然给了一个很重要的提醒:

NVFP4 的速度优势没有形成统一规律,尤其别把显存下降自动等价成吞吐上涨

重复 token:这坑有点吓人

这个 bug 典型现象是,模型能正常加载,但极简 prompt 也会输出一串d d d d d或者满屏!

Qwen3.6-27B-NVFP4 社区反馈的重复感叹号问题

有用户反馈 vLLM release0.24.0正常,nightly 有问题

vllm/vllm-openai:nightly换到vllm/vllm-openai:v0.24.0-cu129-ubuntu2404后缓解

但也有人说vllm==0.24.0和 nightly 都遇到过

更细的反馈是:0.24.0里 flashinfer0.6.12会让 AutoTuner 出现三百多次[AutoTuner]: Tuning fp8_gemm: 100%,nightly 升到0.6.13后 AutoTuner 异常缓解,但 CoT 中输出!!!的问题还在

最后

对于正在迷茫择业、想转行提升,或是刚入门的程序员、编程小白来说,有一个问题几乎人人都在问:未来10年,什么领域的职业发展潜力最大?

答案只有一个:人工智能(尤其是大模型方向)

当下,人工智能行业正处于爆发式增长期,其中大模型相关岗位更是供不应求,薪资待遇直接拉满——字节跳动作为AI领域的头部玩家,给硕士毕业的优质AI人才(含大模型相关方向)开出的月基础工资高达5万—6万元;即便是非“人才计划”的普通应聘者,月基础工资也能稳定在4万元左右

再看阿里、腾讯两大互联网大厂,非“人才计划”的AI相关岗位应聘者,月基础工资也约有3万元,远超其他行业同资历岗位的薪资水平,对于程序员、小白来说,无疑是绝佳的转型和提升赛道。

如果你还不知道从何开始,我自己整理一套全网最全最细的大模型零基础教程,我也是一路自学走过来的,很清楚小白前期学习的痛楚,你要是没有方向还没有好的资源,根本学不到东西!

下面是我整理的大模型学习资源,希望能帮到你。

👇👇扫码免费领取全部内容👇👇

最后

1、大模型学习路线

2、从0到进阶大模型学习视频教程

从入门到进阶这里都有,跟着老师学习事半功倍。

3、 入门必看大模型学习书籍&文档.pdf(书面上的技术书籍确实太多了,这些是我精选出来的,还有很多不在图里)

4、AI大模型最新行业报告

2026最新行业报告,针对不同行业的现状、趋势、问题、机会等进行系统地调研和评估,以了解哪些行业更适合引入大模型的技术和应用,以及在哪些方面可以发挥大模型的优势。

5、面试试题/经验

【大厂 AI 岗位面经分享(107 道)】

【AI 大模型面试真题(102 道)】

【LLMs 面试真题(97 道)】

6、大模型项目实战&配套源码

适用人群

四阶段学习规划(共90天,可落地执行)
第一阶段(10天):初阶应用

该阶段让大家对大模型 AI有一个最前沿的认识,对大模型 AI 的理解超过 95% 的人,可以在相关讨论时发表高级、不跟风、又接地气的见解,别人只会和 AI 聊天,而你能调教 AI,并能用代码将大模型和业务衔接。

  • 大模型 AI 能干什么?
  • 大模型是怎样获得「智能」的?
  • 用好 AI 的核心心法
  • 大模型应用业务架构
  • 大模型应用技术架构
  • 代码示例:向 GPT-3.5 灌入新知识
  • 提示工程的意义和核心思想
  • Prompt 典型构成
  • 指令调优方法论
  • 思维链和思维树
  • Prompt 攻击和防范
第二阶段(30天):高阶应用

该阶段我们正式进入大模型 AI 进阶实战学习,学会构造私有知识库,扩展 AI 的能力。快速开发一个完整的基于 agent 对话机器人。掌握功能最强的大模型开发框架,抓住最新的技术进展,适合 Python 和 JavaScript 程序员。

  • 为什么要做 RAG
  • 搭建一个简单的 ChatPDF
  • 检索的基础概念
  • 什么是向量表示(Embeddings)
  • 向量数据库与向量检索
  • 基于向量检索的 RAG
  • 搭建 RAG 系统的扩展知识
  • 混合检索与 RAG-Fusion 简介
  • 向量模型本地部署
第三阶段(30天):模型训练

恭喜你,如果学到这里,你基本可以找到一份大模型 AI相关的工作,自己也能训练 GPT 了!通过微调,训练自己的垂直大模型,能独立训练开源多模态大模型,掌握更多技术方案。

到此为止,大概2个月的时间。你已经成为了一名“AI小子”。那么你还想往下探索吗?

  • 为什么要做 RAG
  • 什么是模型
  • 什么是模型训练
  • 求解器 & 损失函数简介
  • 小实验2:手写一个简单的神经网络并训练它
  • 什么是训练/预训练/微调/轻量化微调
  • Transformer结构简介
  • 轻量化微调
  • 实验数据集的构建
第四阶段(20天):商业闭环

对全球大模型从性能、吞吐量、成本等方面有一定的认知,可以在云端和本地等多种环境下部署大模型,找到适合自己的项目/创业方向,做一名被 AI 武装的产品经理。

  • 硬件选型

  • 带你了解全球大模型

  • 使用国产大模型服务

  • 搭建 OpenAI 代理

  • 热身:基于阿里云 PAI 部署 Stable Diffusion

  • 在本地计算机运行大模型

  • 大模型的私有化部署

  • 基于 vLLM 部署大模型

  • 案例:如何优雅地在阿里云私有部署开源大模型

  • 部署一套开源 LLM 项目

  • 内容安全

  • 互联网信息服务算法备案

  • 👇👇扫码免费领取全部内容👇👇

3、这些资料真的有用吗?

这份资料由我和鲁为民博士(北京清华大学学士和美国加州理工学院博士)共同整理,现任上海殷泊信息科技CEO,其创立的MoPaaS云平台获Forrester全球’强劲表现者’认证,服务航天科工、国家电网等1000+企业,以第一作者在IEEE Transactions发表论文50+篇,获NASA JPL火星探测系统强化学习专利等35项中美专利。本套AI大模型课程由清华大学-加州理工双料博士、吴文俊人工智能奖得主鲁为民教授领衔研发。

资料内容涵盖了从入门到进阶的各类视频教程和实战项目,无论你是小白还是有些技术基础的技术人员,这份资料都绝对能帮助你提升薪资待遇,转行大模型岗位。

这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费

返回列表