选GPU只看算力数字?大错特错。精度后缀才是关键,同样的显卡,FP8算力是FP16的两倍。脱离精度谈算力,就是在耍流氓。
一、五种浮点精度,各司其职
1. FP32(单精度,4字节)—— 精度最高,但AI已弃用
FP32是传统的单精度浮点数,精度最高、数值不会丢失,但代价是运算慢、显存占用大。如今在大模型训练中已被基本淘汰,只在科学仿真、流体计算、传统3D渲染等专业场景中保留一席之地。
2. FP16(半精度,2字节)—— 老一辈的训练主力
FP16的速度是FP32的4到8倍,显存也减半,但容易出现数值溢出。在V100那个年代,它是模型训练的主力,但训练大模型时必须配合Loss Scaling来防止梯度爆炸,用起来比较折腾。
3. BF16(脑浮点,2字节)—— 大模型训练的绝对主流
BF16的指数范围跟FP32对齐,虽然尾数少,但数值稳定性极强,几乎不会溢出,也不需要额外缩放。如今GPT、Llama这些主流大模型训练都标配BF16。A100、H100、B200全系都原生支持Tensor Core BF16加速——这是目前训练场景的第一选择。
4. FP8(8位浮点,1字节)—— 推理场景的新宠
FP8分E4M3和E5M2两种标准,速度是FP16的2到4倍,显存占用只有FP16的四分之一。H100和B200的Blackwell架构都原生支持FP8加速,主要用于大模型推理和混合精度训练(FP8计算+FP16权重更新)。
5. FP4(4位浮点,0.5字节)—— 极致压缩,仅限推理
FP4是Blackwell架构(B200)新增的原生支持,极致省显存、带宽利用率拉满,但精度损耗明显。它只能用于边缘端的量化推理,绝对不能用来训练模型。B200的FP4峰值算力能达到FP16的4倍。
二、算力单位换算,别被数字唬住
FLOPS就是每秒浮点运算次数,单位按千倍递进:
· 1 GFLOPS = 10⁹ 次/秒
· 1 TFLOPS = 10¹² 次/秒
· 1 PFLOPS = 10¹⁵ 次/秒
· 1 EFLOPS = 10¹⁸ 次/秒
记住三个要点:
· 厂商宣传算力必须标注精度,否则没法横向对比。
· B200标称的4.4 PFLOPS是FP8峰值,FP16只有2.2 PFLOPS。
· 真实业务持续算力通常只有峰值的60%到80%,显存带宽和互联延迟会拖后腿。
三、主流GPU算力参数速查(2026年最新)
· RTX 4090:FP32 82.6 TF | FP16 165.3 TF | 24GB显存 | 4nm
· A100 80GB:FP32 19.5 TF | FP16 312 TF | FP8 624 TF | 80GB | 7nm
· H100 80GB:FP32 51.3 TF | FP16 989 TF | FP8 1978 TF | 80GB | 4nm
· H200:FP32 51.3 TF | FP16 989 TF | FP8 1978 TF | 141GB | 4nm
· B200:FP16 2200 TF | FP8 4400 TF | FP4 8800 TF | 192GB | 4nm
· MI300X:FP32 163 TF | FP16 326 TF | FP8 652 TF | 192GB | 5nm
· 昇腾910B:FP16 313 TF | 64GB | 7nm
补充提醒:RTX 4090的FP16理论上限依赖Tensor Core实现;B200的FP4算力依托稀疏加速,仅推理有效;昇腾910B的数据是官方峰值,实际表现受软件调度影响。
四、怎么选?训练和推理分开看
训练场景这样选:
· 70B参数以内的模型:A100或昇腾910B就够了,单卡多卡都行。
· 100B到500B的大模型:得上H100或H200,还得配NVLink多卡互联。
· 500B以上的超大参数:只能选B200或MI300X,拼的是高显存加高带宽。
推理场景这样选:
· 高吞吐的线上推理:H100或H200开FP8,吞吐量能翻两三倍。
· 要控制成本的批量推理:RTX 4090或L40S用FP16或INT8,性价比最高。
· 边缘轻量化推理:B200开FP4量化,单卡能扛更多并发。
集群规模参考:100B模型用BF16训练,大概需要256张H100,总算力约250 PFLOPS;70B模型用FP8推理,32张H100就够了,单卡能支撑2000以上的QPS。
总结四句话
· 科学计算用FP32,大模型训练认准BF16,推理场景FP8和FP4是王道。
· 算力单位千倍递进:GFLOPS < TFLOPS < PFLOPS < EFLOPS。
· 峰值算力看看就好,真实落地能有六到八成就很不错了。
· 选型记住口诀:训练看BF16和FP8,推理优先FP8和FP4,精度后缀决定一切。
版权声明:本文为原创文章,遵循 CC 4.0 BY-SA 版权协议,转载请附上原文出处链接及本声明。
参考资料:《智算科普|算力单位 FP16/FP8/FP4/BF16/TFLOPS 通俗解读》,2026年7月。
注:产品参数信息截止至2026年7月,具体数据请以官方最新公布为准。