NVIDIA于2026年7月21日进一步公开Vera CPU的Olympus核心、Spatial Multithreading、SCF、SOCAMM2内存、NUMA与I/O细节。Vera采用兼容Armv9.2-A的NVIDIA自研Olympus核心,定位不仅是GPU Host,也覆盖Agent沙箱、RL环境、数据处理与分析等CPU侧负载。
1.Vera CPU规格
项目 | Vera CPU |
架构 | 兼容Armv9.2-A,NVIDIA自研Olympus核心 |
核心 / 线程 | 88核 / 176线程 |
L1 / L2 / L3 | 每核64KB L1I、96KB L1D、2MB L2 / 每CPU 164MB统一L3 |
SIMD | 每核6×128-bit SVE2,支持FP8 |
SCF | 第二代,最高3.4TB/s双向截面带宽 |
内存 | 8个SOCAMM2模块,最高1.5TB LPDDR5X-9600 |
内存带宽 | 最高1.2TB/s,总计最高约14GB/s每核 |
NVLink-C2C | 最高1.8TB/s双向一致性带宽 |
I/O | PCI Express Base Specification 6.4(PCIe 6.0代际)、CXL 3.1;单路最多88条、双路176条通道 |
功耗 | 可配置TDP 250W—450 |
2.Agent负载对CPU提出了什么要求
Agent循环会在GPU模型推理之外执行Python或JavaScript、编译代码、调用数据库和浏览器、读取检索结果、压缩数据并管理沙箱。这些路径通常分支密集、指针密集、指令依赖长,同时要运行大量并发环境。
因此CPU评估不能只看核心总数。单线程进度、满载时的每线程性能、内存带宽、共享缓存、NUMA访问和尾延迟,都会影响GPU等待工具结果的时间。
3.Olympus前端:10-wide与神经分支预测
Olympus前端使用高带宽取指和10-wide解码,公开资料显示取指单元每周期最多获取16条64-bit指令,并配有48条指令的Decode Queue。神经分支预测器针对统计偏置且难预测的分支;分支预测子系统每周期最多可处理两条预测为跳转的分支。
这类设计适用于解释器、运行时、编译器和图遍历等控制流复杂的软件。10-wide是解码宽度,不代表每周期一定退休10条指令;缓存未命中、数据依赖和分支错误仍会降低实际IPC。
4.Mid Core与执行引擎
中端包含宽重命名与分配、较大的重排序缓冲区和物理寄存器资源,通过内存重命名、值预测与关键路径加速降低长依赖链停顿。执行端包含4个Load与2个Store流水线,以及6组128-bit SVE2向量资源,其中部分支持加密运算;这些能力用于CPU侧向量与数据处理,不等同于GPU Tensor Core级大模型计算能力。
缓存子系统加入多类预取器,其中包括面向图与不规则访问的Graph Prefetcher。目标是提高内存级并行,减少指针追踪与图结构访问造成的串行等待。
5.Spatial Multithreading
每个Olympus核心支持两个硬件线程。NVIDIA将其称为Spatial Multithreading,强调对宽核心资源进行更有效的空间划分。核心既可让主线程运行关键任务、兄弟线程承接管理活动,也可为两个线程提供隔离程度更高的执行上下文。
该机制面向沙箱与多租户环境中的noisy-neighbor问题。公开资料没有提供所有资源的静态分区比例,具体调度方式、软件控制接口与不同负载下的收益仍需后续文档和独立测试确认。
6.SCF与统一L3
第二代Scalable Coherency Fabric连接88个核心、164MB统一L3、内存控制器、I/O和NVLink-C2C,提供最高3.4TB/s双向截面带宽。Vera把核心与共享缓存置于单一计算裸片,减少计算裸片之间的Hop。
SCF的作用是维持片上一致性与可预测访问路径。它与外部内存带宽是两个不同指标:3.4TB/s描述片上Fabric双向截面能力,1.2TB/s描述SOCAMM2内存子系统的聚合带宽。
7.SOCAMM2 LPDDR5X
Vera最高支持1.5TB SOCAMM2 LPDDR5X,聚合带宽最高1.2TB/s。SOCAMM2把LPDDR5X做成可现场更换的模块,在保留较短电气路径的同时满足服务器维护与RAS要求。
对高并发Agent、图分析、ETL、KV Cache卸载和RL环境,带宽可减少多核同时访问大工作集时的争用。容量与带宽仍要分开:1.5TB解决数据是否放得下,1.2TB/s解决数据供应速度。
8.单NUMA与双路扩展
每颗Vera对软件呈现一个NUMA域;双路系统是两个NUMA节点。两颗CPU通过第二代NVLink-C2C建立一致性连接。较简单的拓扑有利于线程、内存和I/O放置,也减少应用跨多个片内NUMA区调优的复杂度。
这并不等于NUMA问题消失。双路系统仍有本地与远端内存区别,应用仍需关注线程绑定、内存首次触碰和设备亲和性,只是节点数量与拓扑层级更清晰。
9.PCIe、CXL与机密计算
Vera支持PCIe 6.4和CXL 3.1,双路配置提供176条PCIe通道,可连接GPU、DPU、NIC、存储与CXL内存设备。CXL 3.1可用于一致性内存扩展、内存池化与可组合基础设施。
机密计算基于Arm CCA与RME,并包含RME-DA、RME-CDA设备分配、每VM加密密钥、TDISP设备隔离和C2C链路认证加密;MPAM可用于缓存与内存资源的分区和监控。它们属于硬件与平台能力,实际可用性仍取决于Hypervisor、操作系统、固件、驱动、设备和认证链支持。
10.性能结果如何解读
NVIDIA给出的“相对x86最高1.8倍”针对其选定的Agent CPU负载和满载时持续每线程性能,不代表Vera在全部CPU工作负载上普遍领先1.8倍。其双路预生产参考系统SPEC CPU 2026 Integer估算值为925,对照同样使用GNU 15.2的双路EPYC 9755为898。
测试边界|上述SPEC结果由NVIDIA于2026年7月内部测量并归类为估算值,不是SPEC正式提交。公开数据库中采用其他编译器和平台配置的EPYC 9755存在更高成绩,因此925对898不能写成通用吞吐排名。NVIDIA也尚未提供足够完整的同等级浮点数据,不能据此判断Vera在传统HPC浮点计算中的位置。 |
Phoronix已在NVIDIA提供的单路Vera平台上完成首轮Linux测试:88核176线程、8×96GB LPDDR5-9600、450W TDP、Ubuntu 24.04和GCC 16.1,覆盖编译、Python、Java、压缩、数据库与内存带宽等负载。该测试由第三方执行,但属于早期、有限平台验证,不替代OEM量产系统的长期测试。
11.Vera在系统中的位置
Vera Rubin NVL72使用36颗Vera CPU连接72颗Rubin GPU。在目标工作流中,Vera主要承接工具调用、数据处理、调度与CPU端执行,Rubin主要承担模型计算;实际任务划分取决于框架和应用实现。NVLink-C2C提供缓存一致性和统一地址空间能力,可减少部分显式数据复制,实际收益取决于CUDA、框架、内存管理与工作集访问方式。
12.总结
Vera的设计可以概括为:用宽核心和分支预测提高串行路径速度,用176线程提高环境密度,用SCF与SOCAMM2维持满载供数,用单NUMA和NVLink-C2C简化CPU—GPU协同。