有人看到AI需要NPU,买了一台"AI笔记本电脑",纳闷为什么训练不了模型;或者看到Gemini发布中提到"TPU",琢磨着要不要买一个。这四种芯片——CPU、GPU、NPU、TPU——都能加速计算,但它们面向的根本问题是不同的,规模也完全不同。实际情况比营销文案要简单得多。下面逐个说明每种芯片的实际功能和使它们各自独特的架构细节。
CPU、GPU、NPU、TPU各解决AI计算栈中的不同问题——从运行操作系统,到训练前沿模型,再到以不到2瓦的功耗运行人脸识别。
CPU是运行一切的通用处理器。GPU是主导AI训练和大模型推理的并行计算强者。NPU是面向持续在线推理的低功耗设备芯片,功耗仅1-5瓦。TPU是Google专为在行星规模训练前沿模型而设计的数据中心芯片。它们不是排名关系——而是专业化分工。每一种都在它设计要解决的问题上是明确的胜者。
如何理解四种芯片
CPU:中央处理器
8-24个强大、灵活的核心(消费级)
3-5GHz主频,快速串行逻辑
处理操作系统、应用程序、AI推理(效率低)
大型缓存层次结构以掩盖内存延迟
功耗:15-300W TDP
代表:Intel Core Ultra、AMD Ryzen、Apple M系列
GPU:图形处理器
数千个更简单的并行核心
SIMD(单指令多数据):同一操作,同时对数百万个数据点执行
训练和推理——整体能力最强
专用GDDR6X/HBM2e显存(消费级8-24GB)
功耗:25-450W+
NVIDIA CUDA生态主导AI软件
NPU:神经网络处理器
集成在消费级SoC中(手机、笔记本)
针对INT8/INT4矩阵乘加运算优化
仅推理——不能训练模型
38-50+ TOPS,功耗1-5W
Apple Neural Engine、Qualcomm Hexagon、Intel AI Boost、AMD XDNA
专为持续在线、电池高效的AI而设计
TPU:张量处理器(Google)
脉动阵列(systolic array)架构——数据以波状模式流动
原生bfloat16精度(由Google Brain为TPU发明)
训练和推理(TPU v2起)
仅用于Google Cloud/Google数据中心
功耗:每芯片数百瓦
训练Gemini、Google翻译、YouTube推荐
每种芯片的独特架构
CPU:少量复杂核心,配备深层缓存、分支预测、乱序执行——针对最小化单一线程延迟优化。
GPU:数千个简单CUDA核心,针对同一操作应用于海量并行数据流的吞吐量优化。
NPU:运行INT8/INT4固定功能推理的MAC阵列(乘加阵列),功耗极低——没有通用性,对单一特定任务效率最大化。
TPU:数据流经处理单元网格的脉动阵列——最大化矩阵复用,最小化内存读取。
多维度对照
这些对比中没人提到的细节:
1. "暗硅"问题——为什么NPU与GPU同时被发明
在先进制程节点(7nm、5nm、3nm)上,芯片设计者无法同时为所有晶体管供电而不超过热设计功耗——这就是"暗硅"(dark silicon)问题(Esmaeilzadeh等,2011)。这意味着大片通用计算区域在任何时刻都处于断电状态。芯片设计者找到的解决方案是:构建专用、高效的特殊加速器(NPU),而不是简单地增加更多CPU或GPU核心。一个在1-5瓦运行的专用推理MAC阵列,能完成需要100多瓦GPU算力的工作——因为它正是为那唯一运算而设计的,不做其他任何事情。NPU不是GPU的替代品——它们是芯片行业对热力学约束的回答。Apple 2017年的A11 Bionic Neural Engine是手机芯片中第一个大规模商业部署的答案。
1. bfloat16是Google对整个行业最重要的芯片贡献
Google Brain工程师发明了bfloat16(Brain Float 16)数值格式,专门用于TPU运算。标准FP16丢失了太多指数范围,导致训练中出现数值不稳定。bfloat16保留了FP32的8位指数(保持训练稳定性),同时将尾数减少到7位。该格式现在被NVIDIA(Ampere+)、AMD MI系列、Intel AI加速器以及几乎所有现代AI硬件使用——一个为某家公司的专有芯片发明的格式,成为整个AI训练行业的标准精度格式。当你在任何AI硬件规格中看到"bfloat16"时,你看到的正是TPU留下的遗产。
2. CPU的AI推理不仅仅是"慢"——它有一个特定的结构性劣势
CPU大约将40-60%的芯片面积用于缓存层级(L1/L2/L3)和分支预测——这些硬件设计用于掩盖从DRAM取数据的延迟,以及预测串行代码中下一条指令是什么。对于AI推理,计算高度规律(矩阵乘法,模式可预测),这些缓存和预测基础设施并不能带来成比例的好处。CPU用庞大的架构复杂性去处理一个受益于高度规律性的问题——这与它最擅长的正好相反。这就是为什么即使一个中端GPU运行LLM推理通常也比高端CPU上的同模型快5-20倍的原因,尽管两者在封装级别的功耗预算相似。
3. 脉动阵列——TPU和NPU共享的架构概念
Google的TPU建立在脉动阵列之上——一个处理单元网格,数据以同步波的方式"脉动"穿过,每个单元计算一部分矩阵结果并向前传递,无需存储或重新取回。这最大化数据复用并最小化内存读取,这正是矩阵乘法性能的核心瓶颈。较少被提到的是:Apple的Neural Engine也使用脉动阵列架构,Google的Edge TPU也是如此。消费级NPU和数据中心TPU之间的这种共享架构DNA,是这两种"不同类型"芯片之间最深的联系——它们都是对同一问题(高效矩阵乘法)的优化答案,只是部署在两个非常不同的规模上。
如何选用四种芯片
常见问题
1.CPU、GPU、NPU、TPU之间有什么区别?
CPU:通用处理器,少数强大核心——处理操作系统、应用、串行逻辑,什么都能做。GPU:数千个更简单的并行核心,在大量数据上执行相同操作——凭借CUDA生态主导AI训练和大模型推理。NPU:消费设备(手机、笔记本)中能效优先的专用推理芯片——以1-5W运行AI。TPU:Google专有的数据中心芯片,采用脉动阵列架构和bfloat16精度——在规模上训练前沿模型,通过Google Cloud提供。
2.哪种芯片最适合AI模型训练?
只有GPU或TPU。NPU不能训练(仅推理),CPU速度则慢了几个数量级。NVIDIA GPU(RTX 4090、H100)凭借CUDA生态占据主导。Google TPU(v5p、v5e)在Google Cloud规模上对TensorFlow/JAX工作负载具有竞争力。对于个人/消费级训练:NVIDIA RTX 4090(24GB显存)是当前消费级天花板。对于大规模云训练:H100/H200或TPU v5p。
3.什么是AI芯片性能中的"计算密集vs内存密集"?
计算密集:瓶颈是峰值FLOPS——芯片的数学单元始终繁忙。内存密集:瓶颈是内存带宽——计算单元空闲等待数据。AI训练通常是计算密集型(大批量)。批大小为1的LLM推理通常是内存密集型——每个token都必须从显存加载模型权重,所以显存带宽(GB/s)比FLOPS更能预测推理速度。这就是Apple Silicon的统一高带宽内存能在TFLOPS低于某些独立GPU的情况下仍实现有竞争力的LLM推理的原因。
4.我能像GPU一样在本地购买和使用TPU吗?
数据中心版不行。Google Cloud TPU v5p和v5e仅限云租赁——按芯片小时计费。消费级可获取的选项是:Google Coral USB加速器(亚马逊约$125),使用Google的Edge TPU,通过USB连接到任何电脑。它运行为其架构编译的TensorFlow Lite模型,最高4 TOPS和2W——适用于Raspberry Pi和嵌入式AI项目。对于通用本地AI开发,独立NVIDIA GPU仍是标准。大规模训练的TPU编程通过Google Cloud或Google Colab的免费TPU层级完成。