AI 和 HPC 数据中心
容错解决方案
集成内存

AI 工作负载正以惊人的速度发展,给传统计算基础设施带来了前所未有的压力。核心挑战在于 现代 AI 对内存的巨大需求及其对数据的高度依赖。传统的互连技术造成了性能瓶颈,限制了处理器获取所需海量数据的效率。
CXL (CXL) 已成为一种变革性的解决方案。作为一种开放的行业互连标准,它旨在弥合这些性能差距,实现更高效的资源利用,并为下一代 AI 系统铺平道路。
当今的 AI 和机器学习工作负载带来了 独特的架构挑战 ,这些挑战暴露了传统孤立架构的局限性。
这些问题直接影响性能、可扩展性和成本;基础设施挑战包括:
传统的 PCIe 架构由于缺乏内存一致性且延迟较高,无法完全解决这些问题。 CXL 的开发正是为了专门解决这些缺陷。
CXL 是一种基于 PCIe 物理层构建的高速、缓存一致性互连协议。虽然它使用相同的物理连接,但它是专为异构计算的需求而设计的。它提供了一个统一的接口,允许 CPU、GPU、加速器和内存设备高效且一致地共享内存。
其核心功能通过三种不同的协议实现:
这些 协议共同构建了一个强大且灵活的框架,用于构建可组合的解耦架构和以内存为中心的架构。
通过打破计算、内存和外设之间的刚性壁垒,CXL 为构建和管理 AI 工作负载系统提供了一种更具动态性和强大能力的方法。
训练任务经常因为单个节点内存不足而失败,但 CXL 通过实现 跨设备内存池化和共享来解决这一问题。它允许创建大型内存池,并根据需要动态分配给不同的处理器或加速器。此外,它还使 CPU 和 GPU 能够共享一个统一的内存池,而无需冗余的数据副本。这种方法减少了内存浪费,并通过提高资源利用率显著降低了总拥有成本 (TCO)。
AI 系统受益于高性能 DRAM(用于性能)与更具成本效益的内存层(用于容量)的结合。CXL 通过使用快速 DRAM 作为性能关键型操作的主层,同时连接基于 CXL 的内存扩展器作为低成本、大容量的第二层,使这种架构变得无缝。这有助于在各层之间进行平滑的数据迁移,从而平衡速度、容量和成本效率。
CXL 是可组合系统的基础技术,它允许将计算、内存和存储资源进行解耦,并根据特定工作负载的需求进行按需配置。这使您能够灵活地为特定任务分配精确的加速和内存资源,并为 AI 推理集群动态扩展内存资源,而无需过度配置硬件。其结果是打造出一个更敏捷、响应更迅速的数据中心 CDI,能够适应不断变化的应用需求。
采用 CXL 为构建或部署 AI 系统的用户提供了切实的好处。
在整个技术行业中,服务器供应商、GPU 和加速器制造商以及主要云服务提供商都在将 CXL 整合到其产品路线图中。与此同时,CXL Consortium 也在不断推进该标准,CXL 2.0 和 3.0 扩展了包括结构交换 (fabric switching)、增强型内存池和全局一致性在内的功能,以支持规模更大、更复杂的计算环境。
总之,AI 要求我们从根本上改变计算机系统的架构方式。传统的资源孤岛模式已不再适用。 CXL 为这种转型提供了必要的骨干,实现了下一代人工智能所需的以内存为中心的可组合架构。通过弥合当今基础设施中的关键差距,CXL 有望成为未来计算的基石技术。
SMART Modular Technologies 通过集成内存解决方案的设计、开发和先进封装,助力全球客户实现 AI 和 High-Performance Computing (HPC)。我们的产品组合涵盖了从当今 领先的内存技术(如 CXL) 到标准及传统 DRAM 和闪存存储产品。三十多年来,我们一直致力于提供标准、RUGGED 和定制化的内存与存储解决方案,以满足高增长市场中各类应用的需求。 如需了解更多信息,请立即联系我们。

在 Penguin,我们的团队设计、构建、部署和管理高性能、高可用性的 HPC 和 AI 企业解决方案,帮助客户实现突破性创新。
立即联系我们,让我们讨论您的基础设施解决方案项目需求。