AI(인공지능) 워크로드가 경이로운 속도로 발전하면서 기존 컴퓨팅 인프라에 전례 없는 부담을 주고 있습니다. 핵심적인 과제는 현대 AI의 방대한 메모리 점유율과 데이터 집약적인 특성에 있습니다. 기존 인터커넥트는 프로세서가 필요한 방대한 데이터에 접근하는 효율성을 제한하는 성능 병목 현상을 야기합니다.

CXL(Compute Express Link) 은 혁신적인 솔루션으로 부상했습니다. 이는 이러한 성능 격차를 해소하고, 보다 효율적인 자원 활용을 가능하게 하며, 차세대 AI 시스템을 위한 길을 열어주는 개방형 산업 표준 인터커넥트입니다.

현대 AI의 발목을 잡는 병목 현상은 무엇인가?

오늘날의 AI 및 머신러닝 워크로드는 독특한 인프라 과제 를 야기하며, 이는 기존의 사일로화된 아키텍처의 한계를 드러내고 있습니다.

이러한 문제들은 성능, 확장성, 비용에 직접적인 영향을 미치며, 주요 인프라 과제는 다음과 같습니다.

  • 방대한 메모리 점유율: 대규모 모델의 학습 및 추론에는 테라바이트 단위의 메모리가 필요하며, 이는 종종 단일 서버 노드가 제공할 수 있는 용량을 초과합니다.
  • 데이터 전송 지연: CPU, GPU 및 특수 AI 가속기는 함께 작동해야 하지만, 이들 간의 데이터 전송 병목 현상은 지연 시간을 발생시키고 전체적인 성능을 저하시킵니다.
  • 자원 비효율성: 사일로화된 인프라는 종종 유휴 자원을 발생시킵니다. 특정 작업에 필요한 메모리가 부족하여 서버의 컴퓨팅 코어가 제대로 활용되지 못하거나 그 반대의 경우가 발생하여 투자 대비 효율이 떨어지게 됩니다.
  • 스토리지 통합 지연: 고속 스토리지는 확장된 메모리 계층으로 접근 가능해야 하지만, 대규모 데이터 세트와 모델 체크포인트를 스토리지와 시스템 메모리 사이에서 이동시키는 과정은 여전히 느립니다.

기존의 PCIe 기반 아키텍처는 메모리 일관성 부족과 높은 지연 시간으로 인해 이러한 문제를 완전히 해결할 수 없습니다. CXL은 이러한 단점을 해결하기 위해 특별히 개발되었습니다.

CXL(Compute Express Link)이란 무엇인가?

CXL은 PCIe 물리 계층을 기반으로 구축된 고속 캐시 일관성 인터커넥트 프로토콜입니다.동일한 물리적 연결을 사용하지만, 이기종 컴퓨팅의 요구 사항을 위해 특별히 설계되었습니다. CPU, GPU, 가속기 및 메모리 장치가 메모리를 효율적이고 일관되게 공유할 수 있도록 통합 인터페이스를 제공합니다.

핵심 기능은 세 가지 고유한 프로토콜을 통해 구현됩니다.

  • CXL.io: 이 프로토콜은 표준 I/O 통신, 장치 검색 및 구성을 처리하며, 기존의 PCIe 표준과 유사하게 작동합니다.
  • CXL.cache: 이 프로토콜을 사용하면 AI 가속기와 같은 연결된 장치가 호스트 CPU의 메모리를 일관되게 캐싱할 수 있습니다. 이를 통해 복잡한 소프트웨어 관리 없이도 시스템 전반에서 데이터 일관성을 보장합니다.
  • CXL.mem: 이 프로토콜을 사용하면 호스트 CPU가 외부 장치에 물리적으로 연결된 메모리에 액세스하여, 이를 마치 자체 메모리 공간의 일부인 것처럼 처리할 수 있습니다.

이러한 프로토콜들은 구성 가능하고 분리된 메모리 중심 아키텍처를 구축하기 위한 강력하고 유연한 프레임워크를 형성합니다.

CXL은 AI 인프라를 어떻게 변화시키는가?

컴퓨팅, 메모리, 주변 장치 간의 경직된 장벽을 허무는 CXL은 AI 워크로드를 위한 시스템 구축 및 관리 방식에 더욱 역동적이고 강력한 접근 방식을 가능하게 합니다.

1. 메모리 풀링 및 확장 AI

학습 작업은 개별 노드의 메모리 부족으로 인해 실패하는 경우가 많지만, CXL은 메모리를 풀링하고 장치 간에 공유할 수 있도록 하여이 문제를 해결합니다. 필요에 따라 다양한 프로세서나 가속기에 동적으로 할당할 수 있는 대규모 메모리 풀을 생성할 수 있습니다. 또한 CPU와 GPU가 중복된 데이터 복사본 없이 단일 통합 메모리 풀을 공유할 수 있게 합니다. 이러한 접근 방식은 유휴 메모리를 줄이고 자원 활용도를 개선하여 총 소유 비용(TCO)을 크게 낮춥니다.

2. 최적의 성능을 위한 계층형 메모리

AI 시스템은 성능을 위한 고대역폭 DRAM과 용량을 위한 비용 효율적인 메모리 계층의 조합을 통해 이점을 얻습니다. CXL은 성능이 중요한 작업에는 빠른 DRAM을 기본 계층으로 사용하고, 비용 효율적인 고용량 2차 계층으로 CXL 기반 메모리 확장기를 연결함으로써 이 아키텍처를 원활하게 구현합니다. 이를 통해 계층 간 데이터 이동이 원활해져 속도, 용량, 비용 효율성 간의 균형을 맞출 수 있습니다.

3. 구성 가능한 분리형 인프라(CDI) 구현

CXL은 컴퓨팅, 메모리, 스토리지 리소스를 분리하여 특정 워크로드에 맞춰 온디맨드로 프로비저닝할 수 있는 구성 가능한 시스템의 핵심 기술입니다. 이를 통해 특정 작업에 필요한 정확한 양의 가속 및 메모리 리소스를 유연하게 할당하고, 하드웨어를 과도하게 프로비저닝할 필요 없이 AI 추론 클러스터를 위한 메모리 리소스를 동적으로 확장할 수 있습니다. 그 결과, 변화하는 애플리케이션 요구 사항에 적응할 수 있는 더욱 민첩하고 대응력이 뛰어난 데이터 센터 CDI를 구축할 수 있습니다.

AI를 위한 CXL의 전략적 이점은 무엇인가요?

CXL을 도입하면 AI 시스템을 구축하거나 배포하는 모든 이들에게 실질적인 이점을 제공합니다.

  • 성능 확장성: CPU, GPU, 메모리 간의 핵심 병목 현상을 줄여 하드웨어 성능을 극대화합니다.
  • 효율성 향상: 메모리와 컴퓨팅 리소스의 활용도를 높여 투자 수익률(ROI)을 개선하고 운영 비용을 절감합니다.
  • 확장성 강화: 멀티 테라바이트 메모리 풋프린트를 갖춘 대규모 AI 학습을 지원할 수 있는 명확한 경로를 제공합니다.
  • 더 큰 유연성: 워크로드가 인프라에 맞추는 것이 아니라, 인프라가 워크로드에 적응하는 분리형 인프라를 구현합니다.
  • 미래 대비: 차세대 이기종 AI 최적화 데이터 센터로 나아가는 표준화된 경로를 제시합니다.

빠른 업계 도입과 향후 전망

기술 업계 전반에서 서버 공급업체, GPU 및 가속기 제조업체, 주요 클라우드 제공업체들이 모두 자사 제품 로드맵에 CXL을 통합하고 있습니다. 한편, CXL 컨소시엄은 패브릭 스위칭, 향상된 메모리 풀링, 글로벌 일관성 등을 포함하여 더 크고 복잡한 컴퓨팅 환경을 지원하도록 CXL 2.0 및 3.0의 기능을 지속적으로 확장하며 표준을 발전시키고 있습니다.

결론적으로, AI는 컴퓨터 시스템을 설계하는 방식의 근본적인 변화를 요구합니다. 기존의 사일로화된 리소스 모델은 더 이상 충분하지 않습니다. CXL은 이러한 변화를 위한 필수적인 중추 역할을 하며, 차세대 인공지능에 필요한 메모리 중심의 구성 가능한 아키텍처를 가능하게 합니다.오늘날 인프라의 결정적인 격차를 해소함으로써, CXL은 미래 컴퓨팅의 초석이 될 것입니다.

SMART Modular Technologies는 통합 메모리 솔루션의 설계, 개발 및 고급 패키징을 통해 전 세계 고객이 AI 및 High-Performance Computing (HPC)을 구현할 수 있도록 지원합니다. 당사의 포트폴리오는 오늘날의 CXL과 같은 최첨단 메모리 기술부터 표준 및 레거시 DRAM과 플래시 스토리지 제품까지 아우릅니다. 30년 넘게 당사는 고성장 시장의 다양한 애플리케이션 요구 사항을 충족하는 표준, RUGGED 및 맞춤형 메모리 및 스토리지 솔루션을 제공해 왔습니다. 더 자세한 정보가 필요하시면 지금 문의해 주십시오.

작성자 이미지

관련 기사

에서 전문가와 상담하세요
Penguin Solutions

Penguin에서 우리 팀은 고성능, 고가용성 HPC 및 AI 엔터프라이즈 솔루션을 설계, 구축, 배포 및 관리하여 고객이 획기적인 혁신을 달성할 수 있도록 지원합니다.

오늘 연락하셔서 인프라 솔루션 프로젝트 요구 사항에 대해 논의해 보겠습니다.

렛츠 토크