这次英伟达也下场了,放出了nvidia/Qwen3.6-27B-NVFP4
乍一看很香:官方 ModelOpt 量化,Apache 2.0,vLLM 直接 serve,模型卡写着磁盘和 GPU 显存需求大约降低2.5x
但我翻完模型卡和社区 discussion 后,感觉有必要详细介绍一下
先说结论
- 显存收益是真实的:官方说把 transformer block 里的 linear operators 权重和激活量化到 NVFP4,参数位宽从 16 bit 降到 4 bit,磁盘和 GPU 显存需求大约降 2.5x
- 精度基本稳住了:官方评测里 NVFP4 和 FP8 很接近,MMLU Pro 甚至 86.3 vs 86.1,小赢 0.2
- 性能有分歧:有测试 NVFP4 在 RTX PRO 6000 Blackwell 上 decode 可以跑到 200 t/s 左右,FP8 约 112 t/s;但也有更完整对测里,FP8 在 decode-bound 场景反而快 8-12%
- 坑也很具体:B200 / DGX Spark / RTX PRO 6000 Blackwell 上都有人遇到 Marlin 警告、
modelopt_mixed、以及重复!/dtoken 的问题 - 生产建议很朴素:显存紧张、长上下文、想跑 27B 的同学可以试 NVFP4;追求稳定吞吐的同学,务必拿 FP8 在同一套 vLLM / FlashInfer / MTP 配置下 A/B
这个模型到底是什么
| 项目 | 信息 |
|---|---|
| 基座 | Alibaba Qwen3.6-27B |
| 参数量 | 27B |
| 架构 | Hybrid Attention,Gated DeltaNet + Gated Attention |
| 上下文 | 262K,Qwen 原版还写了可扩展到 1,010,000 tokens |
| 量化工具 | nvidia-modelopt v0.45.0 |
| 量化目标 | transformer blocks 内 linear operators 的权重与激活 |
| 推理引擎 | vLLM |
| 官方测试硬件 | NVIDIA GB300 |
| 硬件兼容 | Hopper / Blackwell |
| License | Apache 2.0 |
Qwen3.6-27B 自身的亮点也很明确,主打 Agentic Coding、仓库级推理、Thinking Preservation,以及更长的上下文
对本地部署玩家来说,最关键的其实就两个词:27B + 262K
27B 代表它还在个人工作站和单卡专业卡的想象范围里,262K 代表它适合 Agent、RAG、长文档、代码仓库这类吃上下文的任务
英伟达这次做 NVFP4,理论上的吸引力很直接:把 27B 再压一压,让它更容易塞进显存,同时尽量保住 Qwen3.6 的能力
官方精度表:没明显变傻
官方模型卡给了 NVFP4 和 FP8 的 accuracy benchmark,我把关键数字搬出来
| Benchmark | FP8 | NVFP4 | 差值 |
|---|---|---|---|
| MMLU Pro | 86.1 | 86.3 | +0.2 |
| GPQA Diamond | 86.0 | 85.5 | -0.5 |
| HLE | 21.7 | 21.8 | +0.1 |
| τ²-Bench Telecom | 95.2 | 95.4 | +0.2 |
| MMMU Pro | 74.6 | 74.3 | -0.3 |
| SciCode | 44.8 | 44.5 | -0.3 |
| AIME 2025 | 93.1 | 92.7 | -0.4 |
| AA-LCR | 68.8 | 68.3 | -0.5 |
| IFBench | 65.1 | 65.5 | +0.4 |
一句话,精度层面基本可以放心,差值大多在 0.5 以内,考虑到 benchmark 本身的波动,这个结果挺漂亮
社区的质量测试也支持这个判断,7 个 prompt 的质量检查,包括诗歌、投诉邮件、HTML todo、HTML Snake、逻辑题转 JSON、merge_intervals、59KB 文档转 JSON
结果很接近:
- 逻辑题两边都是5/5 correct
merge_intervals两边都过6/6 edge cases,都能处理 ValueError,也都没有 mutation- 59KB 文档转 JSON 两边都能产出 valid JSON,严重程度都判成
high - HTML todo 和 Snake 都是 valid single-file,关键 API 存在
- Thinking mode 下,NVFP4 在一个 trivial Python 任务里 16K token budget 都没把函数收完,FP8 能正确完成
所以我的判断是:正常非思考模式下,NVFP4 没有明显质量塌陷;但做确定性代码任务时,Thinking mode 要谨慎
官方部署方式
NVIDIA 模型卡给的 vLLM 命令很简短
vllm serve nvidia/Qwen3.6-27B-NVFP4 \ --port 8000 \ --quantization modelopt \ --max-model-len 262144 \ --reasoning-parser qwen3如果你要上工具调用、MTP、前缀缓存、chunked prefill,有 DGX Spark 用户贴过一组更详细的命令
vllm serve ~/models/hf/Qwen3.6-27B-NVFP4 \ --trust-remote-code \ --served-model-name qwen36-27b \ --gpu-memory-utilization 0.45 \ --dtype bfloat16 \ --max-num-seqs 4 \ --max-model-len 131072 \ --reasoning-parser qwen3 \ --enable-auto-tool-choice \ --tool-call-parser qwen3_coder \ --speculative-config '{"method":"mtp","num_speculative_tokens":3}' \ --max-num-batched-tokens 16384 \ --enable-chunked-prefill \ --async-scheduling \ --enable-prefix-caching \ --quantization modelopt社区实测一:NVFP4 看起来真能打
测试条件:RTX PRO 6000 Blackwell 96GB,开启MTP speculative decoding
先看 NVFP4
Qwen3.6-27B-NVFP4 在 RTX PRO 6000 Blackwell 上的社区实测
再看 FP8
Qwen3.6-27B-FP8 在 RTX PRO 6000 Blackwell 上的社区实测
把图里的关键数字拎出来:
| 场景 | NVFP4 decode t/s | FP8 decode t/s | 观察 |
|---|---|---|---|
| pp256 / tg32 / d0 | 204 | 112 | NVFP4 明显高 |
| pp256 / tg256 / d0 | 201 | 111 | NVFP4 明显高 |
| pp4096 / tg32 / d0 | 117 | 112 | 接近 |
| pp4096 / tg256 / d0 | 159 | 112 | NVFP4 高 |
| pp16384 / tg32 / d0 | 205 | 119 | NVFP4 高 |
| pp16384 / tg256 / d0 | 200 | 111 | NVFP4 高 |
| pp256 / tg32 / d4k | 161 | 113 | NVFP4 高 |
| pp4096 / tg32 / d4k | 203 | 117 | NVFP4 高 |
| pp16384 / tg32 / d4k | 204 | 112 | NVFP4 高 |
| pp256 / tg32 / d8k | 205 | 113 | NVFP4 高 |
| pp4096 / tg32 / d8k | 204 | 117 | NVFP4 高 |
| pp16384 / tg32 / d8k | 204 | 113 | NVFP4 高 |
NVFP4 decode 都在200 t/s左右,FP8 大多在111-119 t/s区间
但别只看 decode
prefill 上 FP8 反而更强,比如 pp4096 / tg32 / d0,FP8 是9,785 t/s,NVFP4 是6,782 t/s
TTFT 也有类似现象,pp16384 / tg32 / d0,FP8 是1,605 ms,NVFP4 是2,595 ms
某些 decode 场景里,NVFP4 的确能跑出很漂亮的数字;但长 prompt 和 prefill 场景下,FP8 依然有反杀空间
社区实测二:另一组完整对测里,FP8 反而更快
有网友把 NVFP4 和 FP8 放到两张 RTX PRO 6000 Blackwell 96GB 上并行跑
配置大概是:
| 项目 | NVFP4 | FP8 |
|---|---|---|
| 模型 | nvidia/Qwen3.6-27B-NVFP4 | Qwen/Qwen3.6-27B-FP8 |
| GPU | 1× RTX PRO 6000 Blackwell 96GB | 1× RTX PRO 6000 Blackwell 96GB |
| vLLM | 0.24.0 | 0.23.1rc1.dev |
| Spec decoding | MTP, 3 tokens | MTP, 3 tokens |
| KV cache | fp8_e4m3 | fp8_e4m3 |
| max len | 262K | 262K |
| gpu util | 0.92 | 0.92 |
| max seqs | 128 | 128 |
它的吞吐结论和 前面实测的截图相反:
| 场景 | NVFP4 | FP8 | 结论 |
|---|---|---|---|
| single small decode | 77.1 tok/s | 84.7 tok/s | FP8 +10% |
| warm TTFT | 0.09 s | 0.09 s | 持平 |
| big prompt decode | 98.7 tok/s | 111.0 tok/s | FP8 +12% |
| big prompt prefill | ~5,700 tok/s / 3.9 s | ~7,000 tok/s / 3.2 s | FP8 更强 |
| 16 并发 aggregate | 891.7 tok/s | 963.3 tok/s | FP8 +8% |
| 16 并发 per-request | 67.4 tok/s | 68.5 tok/s | 接近 |
| 4 并发 big aggregate | 358.9 tok/s | 342.5 tok/s | NVFP4 +5% |
| 4 并发 big per-request | 100.4 tok/s | 103.7 tok/s | 接近 |
这里我觉得最关键的是这句话:
FP8 在 decode-bound 场景里稳定快 8-12%,NVFP4 只在大 prompt 并发这种 prefill-bound 场景里小幅领先
再看 per-prompt latency,也挺扎心:
| Prompt | NVFP4 | FP8 |
|---|---|---|
| 捷克语 2000 词故事 | 49.3 s / 74.4 tok/s | 36.8 s / 87.3 tok/s |
| HTML todo | 16.3 s / 104 tok/s | 15.9 s / 116 tok/s |
| HTML Snake | 17.6 s / 124 tok/s | 15.8 s / 141 tok/s |
| 逻辑题转 JSON | 2.75 s / 104 tok/s | 2.6 s / 129 tok/s |
Pythonmerge_intervals | 1.78 s / 122 tok/s | 1.87 s / 129 tok/s |
| 捷克语投诉邮件 | 11.0 s / 60.5 tok/s | 6.0 s / 110 tok/s |
| 59KB 转 JSON | 20.0 s / 103 tok/s | 25.2 s / 103 tok/s |
这组测试有点局限了:两边 vLLM build 不同,attention / MoE backend 也有差异,但它依然给了一个很重要的提醒:
NVFP4 的速度优势没有形成统一规律,尤其别把显存下降自动等价成吞吐上涨
重复 token:这坑有点吓人
这个 bug 典型现象是,模型能正常加载,但极简 prompt 也会输出一串d d d d d或者满屏!
Qwen3.6-27B-NVFP4 社区反馈的重复感叹号问题
有用户反馈 vLLM release0.24.0正常,nightly 有问题
从vllm/vllm-openai:nightly换到vllm/vllm-openai:v0.24.0-cu129-ubuntu2404后缓解
但也有人说vllm==0.24.0和 nightly 都遇到过
更细的反馈是:0.24.0里 flashinfer0.6.12会让 AutoTuner 出现三百多次[AutoTuner]: Tuning fp8_gemm: 100%,nightly 升到0.6.13后 AutoTuner 异常缓解,但 CoT 中输出!!!的问题还在
最后
对于正在迷茫择业、想转行提升,或是刚入门的程序员、编程小白来说,有一个问题几乎人人都在问:未来10年,什么领域的职业发展潜力最大?
答案只有一个:人工智能(尤其是大模型方向)
当下,人工智能行业正处于爆发式增长期,其中大模型相关岗位更是供不应求,薪资待遇直接拉满——字节跳动作为AI领域的头部玩家,给硕士毕业的优质AI人才(含大模型相关方向)开出的月基础工资高达5万—6万元;即便是非“人才计划”的普通应聘者,月基础工资也能稳定在4万元左右。
再看阿里、腾讯两大互联网大厂,非“人才计划”的AI相关岗位应聘者,月基础工资也约有3万元,远超其他行业同资历岗位的薪资水平,对于程序员、小白来说,无疑是绝佳的转型和提升赛道。
如果你还不知道从何开始,我自己整理一套全网最全最细的大模型零基础教程,我也是一路自学走过来的,很清楚小白前期学习的痛楚,你要是没有方向还没有好的资源,根本学不到东西!
下面是我整理的大模型学习资源,希望能帮到你。
👇👇扫码免费领取全部内容👇👇
最后
1、大模型学习路线
2、从0到进阶大模型学习视频教程
从入门到进阶这里都有,跟着老师学习事半功倍。
3、 入门必看大模型学习书籍&文档.pdf(书面上的技术书籍确实太多了,这些是我精选出来的,还有很多不在图里)
4、AI大模型最新行业报告
2026最新行业报告,针对不同行业的现状、趋势、问题、机会等进行系统地调研和评估,以了解哪些行业更适合引入大模型的技术和应用,以及在哪些方面可以发挥大模型的优势。
5、面试试题/经验
【大厂 AI 岗位面经分享(107 道)】
【AI 大模型面试真题(102 道)】
【LLMs 面试真题(97 道)】
6、大模型项目实战&配套源码
适用人群
四阶段学习规划(共90天,可落地执行)
第一阶段(10天):初阶应用
该阶段让大家对大模型 AI有一个最前沿的认识,对大模型 AI 的理解超过 95% 的人,可以在相关讨论时发表高级、不跟风、又接地气的见解,别人只会和 AI 聊天,而你能调教 AI,并能用代码将大模型和业务衔接。
- 大模型 AI 能干什么?
- 大模型是怎样获得「智能」的?
- 用好 AI 的核心心法
- 大模型应用业务架构
- 大模型应用技术架构
- 代码示例:向 GPT-3.5 灌入新知识
- 提示工程的意义和核心思想
- Prompt 典型构成
- 指令调优方法论
- 思维链和思维树
- Prompt 攻击和防范
- …
第二阶段(30天):高阶应用
该阶段我们正式进入大模型 AI 进阶实战学习,学会构造私有知识库,扩展 AI 的能力。快速开发一个完整的基于 agent 对话机器人。掌握功能最强的大模型开发框架,抓住最新的技术进展,适合 Python 和 JavaScript 程序员。
- 为什么要做 RAG
- 搭建一个简单的 ChatPDF
- 检索的基础概念
- 什么是向量表示(Embeddings)
- 向量数据库与向量检索
- 基于向量检索的 RAG
- 搭建 RAG 系统的扩展知识
- 混合检索与 RAG-Fusion 简介
- 向量模型本地部署
- …
第三阶段(30天):模型训练
恭喜你,如果学到这里,你基本可以找到一份大模型 AI相关的工作,自己也能训练 GPT 了!通过微调,训练自己的垂直大模型,能独立训练开源多模态大模型,掌握更多技术方案。
到此为止,大概2个月的时间。你已经成为了一名“AI小子”。那么你还想往下探索吗?
- 为什么要做 RAG
- 什么是模型
- 什么是模型训练
- 求解器 & 损失函数简介
- 小实验2:手写一个简单的神经网络并训练它
- 什么是训练/预训练/微调/轻量化微调
- Transformer结构简介
- 轻量化微调
- 实验数据集的构建
- …
第四阶段(20天):商业闭环
对全球大模型从性能、吞吐量、成本等方面有一定的认知,可以在云端和本地等多种环境下部署大模型,找到适合自己的项目/创业方向,做一名被 AI 武装的产品经理。
硬件选型
带你了解全球大模型
使用国产大模型服务
搭建 OpenAI 代理
热身:基于阿里云 PAI 部署 Stable Diffusion
在本地计算机运行大模型
大模型的私有化部署
基于 vLLM 部署大模型
案例:如何优雅地在阿里云私有部署开源大模型
部署一套开源 LLM 项目
内容安全
互联网信息服务算法备案
…
👇👇扫码免费领取全部内容👇👇
3、这些资料真的有用吗?
这份资料由我和鲁为民博士(北京清华大学学士和美国加州理工学院博士)共同整理,现任上海殷泊信息科技CEO,其创立的MoPaaS云平台获Forrester全球’强劲表现者’认证,服务航天科工、国家电网等1000+企业,以第一作者在IEEE Transactions发表论文50+篇,获NASA JPL火星探测系统强化学习专利等35项中美专利。本套AI大模型课程由清华大学-加州理工双料博士、吴文俊人工智能奖得主鲁为民教授领衔研发。
资料内容涵盖了从入门到进阶的各类视频教程和实战项目,无论你是小白还是有些技术基础的技术人员,这份资料都绝对能帮助你提升薪资待遇,转行大模型岗位。
这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】