Vera Rubin을 위해 설계된 NVIDIA Spectrum-6, 기가스케일 AI 팩토리에 상륙

차세대 NVIDIA Spectrum-X 이더넷이 기가스케일 AI에 필요한 성능과 복원력, 효율성으로 수십만 개의 GPU를 연결합니다. AI 인프라 리더들은 이미 도입에 나섰습니다.
by

AI는 기가스케일(gigascale) 시대에 접어들었습니다.

세계에서 가장 앞선 AI 팩토리들은 수십만 개의 GPU와 CPU를 한데 모아 프론티어 모델을 학습시키고, 에이전틱 AI를 구동하며, 전례 없는 규모로 인텔리전스를 만들어내고 있습니다. 이 정도 규모에서는 네트워킹이 토큰 생성을 이끌며 컴퓨팅 성능을 배가하는 핵심 요소가 됩니다.

네트워킹 분야의 이정표를 세운 NVIDIA Spectrum-6이 전 세계 기가스케일 AI 팩토리 곳곳에 도입되고 있습니다. Spectrum-6은 초당 102.4테라비트를 처리하는 이더넷 스위치 시스템으로, 이전 세대 시스템 대비 2배의 용량을 제공하며 NVIDIA Vera Rubin 플랫폼의 일부로 설계됐습니다.

Spectrum-6은 차세대 NVIDIA Spectrum-X 이더넷 플랫폼의 중심축으로, AI 팩토리를 하나의 엔드투엔드 컴퓨팅 시스템으로 운영하는 데 필요한 대역폭과 확장성, 인텔리전스를 제공합니다.

가장 먼저 움직인 AI 빌더들

CoreWeave, Microsoft, Nebius, SpaceXAI, Tesla 등 세계 유수의 AI 인프라 빌더들이 자사 AI 팩토리를 가속하기 위해 Spectrum-6을 가장 먼저 도입하는 기업 대열에 합류합니다.

클라우드 제공업체 입장에서 Spectrum-6은 더 많은 컴퓨팅 용량을 통합된 고성능 리소스로 운영할 수 있다는 의미이며, 이를 통해 고객이 모델을 학습시키고 추론 서비스를 배포하는 속도를 높일 수 있습니다.

CoreWeave 네트워킹 부문 제품 디렉터 Min Jun은 “CoreWeave는 가장 까다로운 AI 워크로드를 위해 만들어졌으며, 그 성능을 대규모로 구현하는 데 네트워킹이 중심 역할을 합니다”며 “NVIDIA Spectrum-6과 액체 냉각 방식의 Spectrum-X 이더넷 인프라를 자사 AI 팩토리에 도입하면, 고객이 프론티어 모델을 학습시키고 추론을 더 빠르게 배포하는 데 필요한 대역폭과 복원력, 효율성을 저희가 제공할 수 있게 될 것입니다”이라고 말했습니다.

Nebius의 글로벌 파트너십 부사장 Laurelle Roseman은 “기가스케일에서 성능은 결국 조율의 문제로 귀결됩니다. 모든 GPU가 보조를 맞추게 해서 느린 링크 하나가 작업 전체를 멈춰 세우지 않도록 하는 것”이라며 “NVIDIA Spectrum-6이 겨냥하는 지점이 바로 이 부분이고, 저희가 이를 일찍 도입한 이유이기도 합니다. 고객의 가장 까다로운 워크로드가 확장되는 상황에서도 빠르고 견고하게 유지되는 패브릭”이라고 밝혔습니다.

자체 인프라를 구축하는 AI 선도 기업에 Spectrum-6은 더 많은 GPU가 보조를 맞춰 작동하고, 부하가 큰 집합 연산(collective operation) 과정에서 활용률이 높아지며, 장시간 실행되는 작업에 더 큰 복원력을 확보한다는 것을 의미합니다.

사용 사례 전반에서 얻는 결과는 더 빠른 결과 도출 시간, 그리고 엄청난 규모에서의 더 나은 경제성입니다.

CoreWeave와 Microsoft, Nebius는 Spectrum-6을 탑재한 NVIDIA Vera Rubin 기반 인프라를 가장 먼저 배포하는 제공업체에 이름을 올리며, 폭넓은 개발자와 스타트업, 기업 커뮤니티로 이 플랫폼에 대한 접근성을 확대할 예정입니다.

AI 성능은 곧 네트워크의 문제

이제는 GPU의 최대 성능만으로 AI 팩토리의 성능을 예측할 수 없습니다.

대규모 학습과 추론 워크로드는 수천 개의 가속기가 끊임없이 데이터를 주고받는 데 의존합니다. 집합 통신(collective communication)은 GPU 전반의 작업을 동기화하는 기본 연산으로, 여러 시스템이 동시에 전송하는 경우가 많아 극심한 이스트-웨스트 트래픽을 발생시킵니다.

이더넷은 본래 엔터프라이즈 애플리케이션과, 사용자·서버·스토리지 사이를 오가는 노스-사우스 트래픽을 위해 설계됐습니다. 기가스케일 AI 특유의 동기화된, 집합 통신 중심의 통신 패턴을 위해 만들어진 것이 아닙니다.

Spectrum-X 이더넷은 이를 바꿔놓습니다. AI를 위해 처음부터 설계된 Spectrum-X 이더넷은 모든 GPU에 데이터를 끊김 없이 공급하도록 엔지니어링된 고성능 스케일아웃 패브릭으로 이더넷을 탈바꿈시킵니다.

차세대 Spectrum-X 이더넷

Spectrum-6 스위치 칩은 NVIDIA ConnectX-9 SuperNIC과 결합해 차세대 Spectrum-X 이더넷을 구성하며, NVIDIA Vera Rubin의 일부로 설계됐습니다. Vera Rubin은 NVIDIA Vera CPU와 Rubin GPU, NVLink 6 스위치, ConnectX-9 SuperNIC, BlueField-4 DPU, Spectrum-6 이더넷 스위치를 한데 아우릅니다.

Spectrum-6은 플러거블 옵틱스와 코패키지드 옵틱스(CPO) 폼팩터를 모두 지원합니다. 여기에 더해 Spectrum-6 제품군은 액체 냉각을 지원해, 네트워크 전력 효율을 높이는 동시에 AI 팩토리 전체를 아우르는 포괄적인 엔드투엔드 냉각 방식을 구현할 수 있습니다.

기성 이더넷과 달리, AI 팩토리 스케일아웃을 위한 NVIDIA Spectrum-X 이더넷 네트워킹 플랫폼은 지능형 스위치와 NVIDIA ConnectX-9 SuperNIC, 풀스택 네트워킹 소프트웨어를 결합하며, 이 모두가 AI를 위해 함께 설계됐습니다. 이 플랫폼의 고급 기능은 트래픽이 패브릭을 통과하는 방식을 끊임없이 최적화합니다.

또한 NVIDIA Spectrum-X 기술은 가용 경로 전반에 트래픽을 지능적으로 분산하고, 장애를 신속하게 우회하며, 네트워크를 이동하던 데이터가 목적지에 도달하지 못했을 때 정밀하게 복구합니다. 여기에 개방형 네트워크 운영체제 지원과 RDMA 전송 모델 선택권까지 더해져, AI 빌더는 성능을 희생하지 않고도 유연성을 확보할 수 있습니다.

Spectrum-X 이더넷은 수직적으로 통합하되 수평적으로는 개방하는 NVIDIA의 접근 방식에 뿌리를 두고 있습니다. 컴퓨팅 플랫폼 전반에 걸쳐 실리콘과 시스템, 소프트웨어를 함께 설계하는 동시에 표준 이더넷과 개방형 네트워크 운영체제, 개방형 프로토콜, 그리고 클라우드 제공업체와 시스템 제조사, 인프라 파트너로 이뤄진 폭넓은 생태계를 지원하는 것입니다. 고객은 여러 부품을 모아 조립한 뒤 사후에 최적화할 필요 없이, 가장 빠른 학습 시간과 가장 낮은 토큰당 비용을 제공하도록 설계된 완성형 AI 팩토리 플랫폼을 확보하게 됩니다.

이러한 접근 방식을 입증하듯, Spectrum-X 이더넷은 기성 이더넷 대비 최대 1.6배 높은 AI 네트워킹 성능을 제공하며, GPU 10만 개가 넘는 배포 환경에서도 최대 95%의 네트워크 효율을 유지합니다.

하드웨어 가속 기반의 Spectrum-X 멀티플레인 토폴로지는 데이터센터에 필요한 스위치 수를 1.7배 줄여 네트워크 효율을 한층 끌어올립니다. 여기에 5배 높은 전력 효율과 10배 개선된 인시던트 간 평균 시간(MTBI)을 비롯한 Spectrum-X 이더넷 포토닉스의 이점까지 더해지면서, 네트워크 패브릭 개선은 부품 단위 최적화를 넘어서는 워크로드 가속을 계속해서 제공하고 있습니다.

NVIDIA Spectrum-X 이더넷 플랫폼에 대해 자세히 알아보세요.