ITBear旗下自媒体矩阵:

英伟达Rubin GPU架构全解析:3360亿晶体管助力智能体AI能效跃升

   时间:2026-07-23 13:01:18 来源:互联网编辑:快讯 IP:北京 发表评论无障碍通道
 

英伟达近日正式揭晓了下一代AI数据中心核心计算芯片——Rubin AI GPU架构的完整技术细节。作为Blackwell架构的继任者,Rubin不仅承载着推动AI算力升级的使命,更被定位为支撑未来智能体AI(Agentic AI)时代的关键基础设施。据官方披露,该架构在单位能耗下的Agentic AI推理吞吐量较前代提升最高达10倍,这一突破源于三大核心架构创新:增强型Tensor Core、新一代HBM4高带宽内存子系统及第三代Transformer引擎。

Rubin GPU采用台积电3nm N3P制程工艺,通过双裸片设计集成约3360亿颗晶体管,较Blackwell GB300增加62%,成为当前业界集成度最高的AI GPU之一。每颗裸片包含4个图形处理集群(GPC),其中两种不同配置的GPC分别集成30个和26个流式多处理器(SM),全芯片共配备8个GPC、224个SM及896个Tensor Core。这种异构设计通过NV-HBI高速互连技术实现裸片间无缝协作,同时整合了大容量分布式L2缓存、Gigathread引擎及4组4096-bit位宽的HBM4内存控制器。

内存子系统的革新是Rubin架构的重大升级。该芯片首次采用8组12-Hi堆叠的HBM4内存,总容量达288GB,峰值带宽飙升至22TB/s,较Blackwell的8TB/s提升近2.8倍。这一突破不仅通过增加单颗DRAM容量实现,更得益于升级版Tensor Memory Accelerator(TMA)对数据搬运效率的优化。配合第六代NVLink IO提供的3600GB/s GPU互连带宽、NVLink-C2C的1800GB/s CPU-GPU带宽,以及PCIe Gen6 x16的256GB/s主机连接能力,Rubin构建起多维度的数据传输体系。

针对混合专家模型(MoE)的推理需求,Rubin对TMA进行针对性强化。通过优化描述符管理机制,新版TMA可高效定位和调度专家权重,减少数据搬运开销。新增的Inline Descriptor支持允许多个Tensor共享统一描述信息,仅需动态修改内存地址等参数即可完成调度。这种设计使MoE模型在专家数量增加时仍能保持高效扩展,将更多GPU资源用于实际推理计算。

Tensor Core的升级带来计算性能的质变。新版核心通过扩大K维数据处理能力,使单个时钟周期处理量翻倍。以矩阵乘法为例,Blackwell需执行4轮K循环的计算在Rubin上仅需2轮,不仅提升吞吐量,更降低内核调度延迟。在Transformer引擎优化方面,Rubin采用激活稀疏性与自适应压缩技术,将Attention Score压缩为结构化2:4稀疏格式,在保持输出标准Dense格式的同时,减少存储与传输开销。Softmax及指数运算性能也得到显著提升,FP32吞吐量达到GB300水平,BF16/FP16吞吐量较GB200提升4倍。

为降低Agentic AI推理延迟,Rubin改进了GPU内核调度机制。传统GPU需等待前一阶段内核完全执行完毕才启动后续计算,而Rubin允许后续内核在输入数据就绪后立即启动,通过提高流水线重叠度减少空闲时间。这种设计对需要逐步生成Token的智能体任务尤为重要,可显著提升单用户Token生成速度。

在数据中心能效优化方面,Rubin平台引入动态功率调度与智能功率平滑技术。以Vera Rubin NVL72系统为例,其通过集成储能模块吸收GPU瞬时功率波动,使平均功耗降低约10%,50毫秒峰值功耗降低约20%。配套推出的DSX OS操作系统集成MaxLPS功能,可统一管理GPU、机柜、液冷系统及AI工作负载,在相同供电预算下支持部署更多GPU资源,进一步提升算力密度。

从晶体管规模到内存架构,从计算核心到能效管理,Rubin架构的升级覆盖AI芯片设计的全链条。相较于Blackwell侧重大模型训练的定位,Rubin更聚焦智能体AI等新兴场景,通过提升Token生成效率、优化内存带宽利用率及降低推理延迟,为部署更大规模、更高并发、更长上下文的大模型奠定硬件基础。这场架构革新不仅延续了英伟达在AI计算领域的领先地位,更为下一代AI应用的爆发式增长提供了算力引擎。

 
 
 
更多>同类资讯
全站最新
热门内容
网站首页  |  关于我们  |  联系方式  |  版权声明  |  争议稿件处理  |  English Version