当前位置: > 资讯 > 正文

英伟达入局,3D DRAM存算一体迎来产业化拐点

AI算力竞争正在进入一个新的阶段。过去几年,随着大模型规模快速增长,行业持续通过更强的GPU、更大的集群和更高的内存带宽提升AI计算能力。但当模型进入长上下文、高并发推理阶段后,新的问题开始显现:

算力之外,数据如何更高效地到达计算单元,正在成为影响AI推理效率的重要因素。

而围绕这一问题,AI芯片正在出现两条值得关注的技术演进路径:3D,是新的封装与集成方式;存算一体,是新的计算架构。前者关注的是计算与存储如何在物理层面进一步靠近,通过三维集成和高密度垂直互连缩短数据传输距离;后者关注的是计算与数据如何在架构层面进一步融合,让计算尽可能在数据侧完成。

而当3D集成与存算一体架构进一步结合,计算与存储之间的物理距离和数据搬运开销都有望进一步降低,这也成为下一代AI计算架构值得关注的方向。这一技术演进正在逐渐获得产业层面的验证。

9月10日,英伟达宣布通过NVLink Fusion,将d-Matrix下一代Raptor推理XPU接入其AI基础设施体系。值得关注的是,这款面向AI推理的芯片采用了3D DRAM堆叠架构。

从产业角度看,这一动作的意义并不只在于一款芯片进入英伟达生态。更值得关注的是,3D DRAM正在从芯片架构领域的前沿探索,逐渐进入AI基础设施的系统级视野。

而当3D DRAM进一步与存算一体架构结合,新的技术想象空间也正在打开。为什么是3D DRAM?又为什么是3D DRAM与存算一体的结合?

答案要从AI推理正在面对的“内存墙”说起。


AI推理的瓶颈,正在从“算不动”走向“搬不动”
大模型推理对计算资源的需求不断增长,但与此同时,模型权重、KV Cache等数据规模也在快速扩大。尤其在长上下文和多用户并发场景下,AI芯片需要持续从存储系统读取和交换大量数据。

这意味着,即使计算单元拥有足够强的算力,如果数据无法及时供给,计算资源也难以得到充分利用。因此,AI推理面临的瓶颈正在发生变化:从过去更多关注“计算单元有多少”,逐渐转向“数据能否以足够高的效率送到计算单元”。这也是所谓“内存墙”问题的核心。

传统架构中,SRAM速度快,但容量和成本受到限制;DRAM容量大、成本效率高,但与计算单元之间存在一定的数据传输距离。HBM则通过先进封装和高带宽互连,大幅提升了计算芯片访问内存的能力,目前仍是高性能AI计算的重要基础。

但随着模型规模、上下文长度和推理并发持续增加,单纯提高带宽并不能解决所有问题。当数据搬运本身成为系统开销,如何让数据与计算距离更短,就成为新的架构优化方向。

这也意味着,下一代AI芯片的技术演进,不仅是计算能力的提升,也包括封装、存储和计算架构的协同创新。


3D是新封装,存算一体是新架构

3D DRAM带来的,是计算与存储在物理层面的进一步靠近。通过三维集成和高密度垂直互连,计算裸片与存储裸片可以实现更加紧密的集成,从而缩短数据在计算与存储之间传输的距离。但仅仅让计算与存储“更近”,并不等于解决了数据搬运问题。

存算一体进一步从架构层面改变计算与存储之间的关系,提升计算效率,降低缓存层级带来的数据搬运对计算效率的影响。因此,3D堆叠与存算一体实际上解决的是两个不同层面的问题:3D堆叠解决“距离”问题,存算一体解决“效率”问题。

3D提供三维集成的物理基础,存算一体提供计算与存储融合的架构基础。二者结合,则是在物理层和架构层同时推动计算与数据进一步靠近。

这并不意味着3D DRAM会简单替代HBM。在未来相当长一段时间内,不同存储和封装技术仍将针对不同的计算场景共同发展。3D DRAM真正带来的变化,是为AI推理提供了一种新的架构选择;而当其与存算一体架构结合,则进一步为降低数据搬运开销、提升计算效率提供新的可能。

近期产业动态所释放出的信号是,3D DRAM正在从技术研究逐步走向产业化,而3D集成与计算架构的协同,也正在成为AI芯片探索的重要方向。

从存算一体探索,到3D DRAM产品化
对于亿铸而言,围绕存算一体架构的探索并非始于近期。早期技术研发阶段,亿铸已经完成相关AI芯片的技术验证,并持续围绕计算架构、存储体系以及软硬件协同开展研发。

随着AI推理需求不断变化,亿铸进一步将技术路线延伸至3D DRAM与通用存算一体架构的协同设计,从计算架构、存储系统、互连方式到软件体系进行全链路优化,探索面向云端AI推理的产品化路径。

软件侧,亿铸持续构建面向通用AI计算的软件体系,通过自研指令集、编译器、算子库以及CUDA、PyTorch等主流生态兼容能力,实现软硬件协同优化,降低客户迁移和部署成本。

从早期技术验证,到3D DRAM与通用存算一体架构的持续演进,再到面向云端推理的产业化落地,亿铸正在沿着这一方向持续推进。

AI算力的发展,正在从单纯追求更高的计算峰值,逐步走向计算、存储与数据传输效率的系统级优化。

从3D集成带来的物理距离缩短,到存算一体带来的计算架构变化,计算与数据之间的关系正在被重新定义。随着相关技术持续演进,3D DRAM与存算一体的结合,也有望成为下一代AI推理架构探索的重要方向。

展开全文阅读