AI 팩토리는 대규모로 지능을 생산하기 위해 쉬지 않고 가동되며, 그 경제성은 실제로 만들어낸 산출량으로 결정됩니다. 초당 토큰 수와 와트당 토큰 수, 토큰당 비용, 가동률, 가동 시간이 그 지표이죠.
그러려면 AI 인프라를 개별 가속기의 모음이 아니라 하나의 완결된 팩토리로 설계하고 구축해야 하는데요,
맞춤형 XPU를 만드는 하이퍼스케일러와 AI 네이티브 기업은 XPU 설계만이 아니라 AI 플랫폼 전체의 설계와 개발을 함께 고려해야 합니다. 스케일업·스케일아웃 네트워킹과 랙 스케일 아키텍처, 프로덕션 팩토리 소프트웨어, 그리고 탄탄한 공급사 생태계가 여기에 포함됩니다.
AI 팩토리 규모에서 이 길은 복잡하고 비용이 많이 들며, XPU를 빠르게 시장에 내놓는 데 근본적인 장애물이 됩니다.
이 제약을 깨는 방법은 바로 맞춤형 XPU를 검증된 성숙한 인프라와 결합하는 것입니다. 그러면 개발자는 가장 중요한 지점에 혁신을 집중하고, 나머지는 이미 확립된 기술을 활용할 수 있습니다.
NVLink Fusion이 바로 그 요구에 답하는 기술입니다. XPU를 NVIDIA의 세계 최고 수준 AI 인프라에 연결해 성능을 높이고 출시 시점을 앞당기며, 세미 커스텀 AI 팩토리의 리스크를 낮춰줍니다.
빠른 스케일업으로 XPU 성능을 끌어내다
조 단위 파라미터 모델 실행과 전문가 혼합(MoE) 아키텍처, 에이전틱 AI 같은 최신 워크로드에서는 스케일업 패브릭이 속도를 따라가지 못하면 가동률이 떨어지고 토큰당 비용이 올라갑니다.
스케일업 네트워킹 솔루션은 세 가지 측면에서 뛰어나야 합니다.
- 실제 구현되는 성능: 엔드투엔드 네트워크 성능과 인네트워크 컴퓨팅(in-network compute), 그리고 성숙한 소프트웨어 통합
- 팩토리 복원력: 가동 시간, 지속적인 상태 모니터링과 텔레메트리, 그리고 팩토리를 계속 가동하면서도 부품 단위로 정비할 수 있는 정비성
- 플랫폼 성숙도: 대규모 배포 실적과 실현된 투자 수익이 입증된 성숙한 기술 스택을 사용해 운영 리스크를 낮추는 것
예를 들어 NVLink Fusion은 XPU를 NVIDIA NVLink 스케일업 도메인으로 끌어들입니다. 6세대 NVLink는 72개 XPU 도메인 전반에 걸쳐 최고 수준의 고대역폭·저지연 네트워킹을 제공합니다. XPU 간 전송의 엔드투엔드 지연 시간은 기성 이더넷 기반 대안 대비 3분의 1이고, 패킷 전송률은 10배 높습니다.
엔드투엔드 성능 측면에서 NVIDIA GB300 NVL72 시스템은 NVL72를 쓰지 않는 구성 대비 훨씬 높은 처리량과 더 나은 상호작용성을 제공합니다. 향후 NVLink 로드맵에는 최대 1,152개 가속기 규모의 도메인과 코패키지 광학(co-packaged optics)이 포함됩니다.

72-GPU NVLink 스케일업 도메인 덕분에 GB300 NVL72는 NVIDIA B300보다 높은 GPU당 처리량과 상호작용성을 제공합니다. NVIDIA AI Inference Performance Benchmarks 페이지의 결과입니다.
NVLink Fusion에는 XPU를 NVIDIA Vera CPU나 다른 생태계 CPU에 연결하는 NVIDIA NVLink-C2C도 포함됩니다. PCIe 인터페이스 대비 최대 6배의 에너지 효율을 제공해, 에이전틱 시스템에서 제어와 연산 사이의 장벽을 걷어내도록 돕습니다.
개발과 배포를 위한 검증된 스택과 생태계
맞춤형 XPU를 개발하는 팀은 XPU 혁신을 데이터센터 배포로 옮기는 데 드는 노력과 복잡성을 과소평가하곤 합니다. 여기에는 다음이 포함됩니다.
- 고속 CPU 인터페이스와 스케일업 인터페이스 통합
- 스케일업 네트워크 솔루션 조달과 검증
- 컴퓨팅 트레이와 스위치 트레이 설계
- 냉각과 전력을 포함한 랙 아키텍처 설계와 검증
- 보안과 스토리지 통합
- 복잡한 공급사 생태계 관리
이상적인 플랫폼은 이 모두를 제공해, 각 팀이 목표한 혁신에 집중하고 나머지는 검증된 솔루션을 쓰도록 합니다.
NVLink Fusion은 신속한 개발과 통합, 배포를 위해 설계된 생태계의 지원을 받습니다. ASIC 설계와 CPU, IP 및 광 인터커넥트 파트너가 여기에 참여합니다.
Intel의 데이터센터 실리콘 엔지니어링 부문 부사장 Tim Wilson은 “NVLink Fusion은 고객이 중요하게 여기는 워크로드에 가장 잘 맞는 CPU 아키텍처와 성능 수준, 소프트웨어 역량을 직접 선택할 수 있게 해줍니다”고 말했습니다.
NVLink Fusion 도입 기업은 NVIDIA MGX 랙 스케일 아키텍처와, NVIDIA Vera Rubin NVL72 같은 MGX 기반 시스템에 쓰이는 것과 동일한 공급망도 활용할 수 있습니다. 제조 파트너가 설계와 통합을 맡고, MGX 공급사가 랙과 냉각, 전력, 그리고 새롭게 부상하는 800 VDC 설계의 구성 요소를 제공합니다.
QCT와 Quanta Computer의 제품·솔루션 총괄 Jack Luoh는 “Vera Rubin [NVL72]에서는 제조 라인의 시스템 조립을 거의 100% 자동화하는 것을 보고 있습니다”며 “XPU가 NVLink Fusion을 활용한다면 이러한 투자 대부분을 그대로 살릴 수 있습니다”고 말했습니다.
NVIDIA AI 인프라 플랫폼은 수직으로 통합돼 있으면서 수평으로는 개방돼 있습니다. NVLink Fusion 도입 기업은 필요에 따라 NVIDIA Rubin GPU와 Vera CPU, 코패키지 광학 스위치, ConnectX SuperNIC, BlueField DPU, Mission Control 소프트웨어, 그리고 NVIDIA Vera Rubin NVL72와 Vera CPU Rack, LPX, STX, SPX를 포함한 풀랙 솔루션을 함께 채택할 수 있습니다.
인프라 표준화로 리스크를 관리하다
AI 팩토리 기획은 실리콘을 기다려 주지 않습니다. 전력 조달과 시설 설계, 냉각, 랙 배치, 네트워크 아키텍처는 최종 가속기 구성이 확정되기 훨씬 전에 시작됩니다. 특정 칩 하나에 묶인 데이터센터는 일정 리스크가 될 수 있습니다.
워크로드에 따라 XPU와 GPU, CPU, LPU 등 선호하는 가속기가 달라질 수 있습니다. 학습과 포스트 트레이닝, 추론, 검색, 서빙에서 GPU 시스템이 세미 커스텀 시스템과 나란히 작동할 수도 있습니다.
MediaTek의 데이터센터·컴퓨팅 사업부 총괄 겸 기업 수석 부사장 Vince Hu는 “NVLink Fusion 프로그램의 가치는 고객이 NVIDIA GPU로 랙 단위 솔루션을 먼저 배포한 뒤, XPU 개발을 분리해 다른 속도로 진행할 수 있다는 점입니다”이라고 말했습니다.
NVLink Fusion은 통합 아키텍처로 이러한 과제를 해결합니다. Vera Rubin NVL72 같은 XPU 기반 시스템과 GPU 기반 시스템이 랙 공간과 네트워킹, 냉각, 전력 공급, 관리 시스템을 공유할 수 있습니다. 운영사는 정확한 실리콘 구성을 나중으로 미룬 채 구축을 진행하고, 이후 워크로드 수요와 실리콘 공급, 사업 우선순위가 바뀌면 용량을 다시 프로비저닝할 수 있습니다.
GUC의 회장 겸 최고 전략 책임자 Lie-Szu Juang은 “NVLink Fusion은 하이퍼스케일러나 맞춤형 ASIC 설계사가 자체 CPU나 XPU를 통합할 수 있게 하고, NVIDIA 기술과 서드파티 공정을 이어 하나의 통합된 랙 스케일 아키텍처를 만들어냅니다”고 말했습니다.
팩토리로 설계하고 검증하고 운영하다
팩토리 구축에는 큰 비용이 들고, 실수가 생기면 값비싼 재작업으로 이어집니다. 인프라는 착공 전에 검증돼야 합니다. NVLink Fusion은 건물과 전력, 냉각, 컴퓨팅, 네트워킹을 함께 설계하는 AI 팩토리용 NVIDIA DSX 레퍼런스 아키텍처와 발을 맞춥니다. NVIDIA Omniverse DSX AI Factory Blueprint는 기가와트급 AI 팩토리를 위한 디지털 트윈과 개방형 레퍼런스 디자인을 제공해, 파트너가 배포에 앞서 시설과 기술을 함께 모델링할 수 있게 합니다.
랙 수준에서는 정비성도 성능의 일부인데요. 레퍼런스 컴퓨팅 트레이는 팬과 케이블, 호스가 없는 100% 액체 냉각 방식이며, 랙의 나머지가 계속 가동되는 동안 트레이를 분리할 수 있습니다. NVLink 스위치 트레이 역시 액체 냉각 방식이고 서비스 중에도 가동을 이어갑니다.
Amazon 계열사 Annapurna Labs의 하드웨어 개발 수석 매니저 CC Lee는 “NVLink Fusion 덕분에 검증된 NVL72 랙 설계를 활용해 출시 시점을 앞당길 수 있고, 여러 공급사를 확보해 고객에게 더 많은 제품을 전달할 수 있게 되었습니다”고 밝혔습니다.
소프트웨어가 팩토리를 완성합니다. 분산 워크로드를 위한 NVIDIA NCCL, 분리 실행을 위한 NVIDIA Dynamo와 NIXL, 클러스터 관리와 텔레메트리, 디버깅을 위한 NVIDIA Mission Control이 운영사가 여러 종류가 섞인 AI 인프라를 하나의 조율된 시스템으로 운영하도록 돕게 됩니다.
NVLink Fusion으로 XPU는 이제 세계 최고 수준의 AI 플랫폼과 만납니다. 하이퍼스케일러와 AI 네이티브 기업은 여러 개발 주체의 강점을 결합해, 어느 한 기업도 홀로 만들 수 없는 통합형 세미 커스텀 AI 팩토리를 구축할 수 있습니다.
NVLink Fusion에 대해 자세히 알아보세요.
