NVIDIA公开Rubin GPU架构细节:面向Agentic AI重新设计GPU

休闲 2026-10-01 15:56:05 76

NVIDIA发布最新官方技术博客,公开首次系统披露Rubin GPU架构设计。架构计相较此前公布的细节新设产品规格,此次重点介绍了Rubin面向Agentic AI的公开架构优化,包括Tensor Memory Accelerator、架构计第三代Transformer Engine、细节新设自适应压缩等核心技术,公开进一步揭示下一代AI Factory的架构计设计方向。

【PChome 2026年7月22日消息】北京时间7月22日,细节新设NVIDIA连续发布两篇官方技术博客,公开首次深入公开下一代Rubin GPU的架构计架构设计细节。相比今年CES和GTC公布的细节新设产品规格,此次官方披露的公开重点不再是FP4算力、HBM4等基础参数,架构计而是细节新设首次解释Rubin GPU为何围绕Agentic AI(智能体AI)重新设计,并详细介绍了第三代Transformer Engine、Tensor Memory Accelerator(TMA)以及Adaptive Compression(自适应压缩)等关键技术,揭示了NVIDIA下一代AI基础设施的底层思路。

与生成式AI时代主要依赖大规模训练不同,NVIDIA认为,未来AI计算将逐渐转向以推理、规划、多Agent协作和工具调用为代表的Agentic AI阶段。这类工作负载拥有更长上下文、更频繁的数据交换以及更多CPU与GPU协同需求,因此GPU架构的优化目标也从单纯提升峰值算力,转向提高整体系统吞吐率、能效以及每Token成本。 

为此,Rubin GPU在多个关键模块进行了重新设计。其中,Tensor Memory Accelerator(TMA)获得进一步增强,能够降低专家模型(MoE)等复杂AI负载中的数据搬运开销,并通过更灵活的描述符管理减少GPU等待数据的时间,使计算单元保持更高利用率。NVIDIA表示,这一优化旨在解决当前大模型推理过程中计算速度越来越快、数据供给却逐渐成为瓶颈的问题。

另一项重要升级来自第三代Transformer Engine。官方介绍,新一代引擎加入了Adaptive Compression(自适应压缩)能力,可针对KV Cache等推理数据进行动态压缩,在尽量保持模型精度的前提下显著降低HBM带宽占用,从而缓解长上下文推理带来的内存压力。这意味着Rubin不仅依靠HBM4更高的物理带宽提升性能,也通过软硬件协同进一步提高显存利用效率。

从产品规格来看,Rubin平台延续了此前公布的信息,包括单颗GPU最高可提供50 PFLOPS(NVFP4) AI算力,采用HBM4高带宽显存,并与Vera CPU组成新一代Vera Rubin平台。在整机层面,Vera Rubin NVL72由72块Rubin GPU和36颗Vera CPU组成,针对大规模AI推理和后训练(Post-training)进行了优化。

值得关注的是,NVIDIA此次还首次披露了更多来自产业合作伙伴的部署情况。官方表示,目前已有CoreWeave、Google Cloud、Microsoft Azure、Mistral AI等合作伙伴基于Vera Rubin平台开展测试与部署。NVIDIA强调,新平台的目标不仅是提升峰值性能,更重要的是降低Performance per Watt(每瓦性能成本)以及Token Cost(每Token生成成本),帮助AI工厂获得更高的整体运行效率。

从行业发展来看,此次官方博客释放出的信号十分明确。随着AI产业逐渐进入以推理为主的新阶段,GPU竞争已不再局限于算力数字,而是扩展至CPU协同、内存系统、互连网络、软件栈乃至整机架构。Rubin GPU的公开,也意味着NVIDIA正试图重新定义AI基础设施的设计标准,将GPU从单一计算芯片进一步演进为AI Factory的核心计算节点。

本文地址:http://pkgmcppm.whitepumpkinseeds.com.cn/html/53b65899288.html
版权声明

本文仅代表作者观点,不代表本站立场。
本文系作者授权发表,未经许可,不得转载。

全站热门

孩子重疾险有必要买吗?给孩子的重疾险有没有必要买

福州一市民不解:欠费自动断电 复电却要人工操作?

APEC亚太媒体团扫货影石,现场下单Luna Ultra

抗击艾滋新突破:一年两针,100%有效?

当割草机器人遇见世界杯:MOVA打造了一场庭院足球挑战赛

新春走基层丨“海岛”电工有了智慧“接班人” 头条焦点

丙烯颜料可以画在玻璃上吗 在玻璃上画画用什么颜料,行业资讯

方正科技:1月9日获融资买入3.60亿元

友情链接