MLPerf Inference v6.1 첫 출전에서 최고 성능을 기록한 NVIDIA Vera Rubin NVL72

NVIDIA Vera Rubin NVL72 시스템으로 제출한 첫 프리뷰 결과가 NVIDIA GB300 NVL72 대비 최대 3.7배 높은 처리량을 기록했습니다.
by

시스템 성능과 효율적인 인프라 확장, 그리고 지속적인 소프트웨어 최적화는 AI 추론의 경제성을 좌우하는 핵심 지렛대입니다. 시스템 성능이 높아지면 더 많은 토큰을 만들어 내고, 그만큼 매출도 늘어나죠. 효율적인 확장이란 하드웨어를 추가한 만큼 처리량이 비례해 늘어나는 것을 뜻하는데요. 그래야 더 적은 자원으로 대규모 사용자를 감당할 수 있습니다. 지속적인 최적화는 인프라 투자에서 더 큰 가치를 뽑아낸다는 의미입니다.

이 세 가지를 떠받치는 것이 플랫폼의 범용성입니다. 동일한 인프라로 어떤 모델이든, 어떤 워크로드든 돌릴 수 있어야 하죠. 학습부터 추론까지, 추천 시스템부터 추론형 모델까지, 언어부터 영상까지 가리지 않고 소화하면서 가동률을 높게 유지하는 것입니다.

NVIDIA 플랫폼은 이 모든 항목을 아울러 최적화하도록 설계됐습니다. 최근에 공개된 MLPerf Inference v6.1 결과가 이를 잘 보여 주죠.

  • NVIDIA Vera Rubin NVL72 시스템, 최고 성능으로 데뷔: NVIDIA Vera Rubin NVL72는 첫 MLPerf Inference 프리뷰 제출에서 GB300 NVL72 대비 최대 3.7배 높은 처리량을 기록했습니다.
  • NVIDIA GB300 NVL72, 최고 수준의 확장 효율 달성: GB300 NVL72 랙 4대에 걸친 288-GPU 제출 결과가 99%의 확장 효율을 달성했습니다. 단일 랙 기준선에서부터 처리량이 거의 선형으로 늘어났습니다.
  • 지속적인 소프트웨어 최적화가 이끈 성능 향상: NVIDIA의 MLPerf Inference v6.1 제출 결과는 소프트웨어 최적화를 통해 v6.0 대비 최대 1.6배 높은 성능을 보였습니다. 최적화는 v6.1 제출 이후에도 이어져 추가 성능 향상을 만들어 냈습니다.

AI 인프라를 결정해야 하는 조직이라면 성능과 확장 효율, 소프트웨어 개선 속도가 장기적인 추론 경제성을 좌우하는 중요한 고려 요소입니다.

MLPerf Inference에 데뷔한 Vera Rubin NVL72, 최고 성능을 기록하다

NVIDIA는 MLPerf Inference v6.1 벤치마크 모음에서 가장 까다로운 두 가지 벤치마크인 DeepSeek-R1과 Qwen3-VL에 Vera Rubin NVL72 프리뷰 결과를 제출했습니다.

Vera Rubin NVL72는 vLLM과 NVIDIA Dynamo 오픈 소스 추론 프레임워크를 활용해 Qwen3-VL에서 오프라인·서버·인터랙티브 시나리오 전반에 걸쳐 GB300 NVL72 대비 최대 3.7배 높은 처리량을 냈습니다. DeepSeek-R1에서는 NVIDIA TensorRT-LLM 라이브러리를 써서 처리량이 최대 2.5배 높았죠. 이 초기 결과는 NVIDIA의 빨라진 혁신 속도와 더불어, 소프트웨어 최적화가 이어지면서 성능이 앞으로 어떻게 더 좋아질지를 함께 보여 줍니다.

Vera Rubin NVL72 성능 비교 차트
MLPerf Inference v6.1, Closed Division. 2026년 9월 16일 www.mlcommons.org에서 확인한 결과. NVIDIA 플랫폼 결과는 6.1-0106, 6.1-0074 항목 기준. MLPerf 명칭과 로고는 미국 및 기타 국가에서 MLCommons Association의 등록 및 미등록 상표입니다. 모든 권리 보유. 무단 사용을 금합니다. 자세한 내용은 www.mlcommons.org를 참조하세요.

이 성능은 Vera Rubin NVL72 랙 한 대가 GB300 NVL72 랙보다 훨씬 많은 토큰을 만들어 내고 더 많은 사용자를 감당하며 더 큰 매출을 올린다는 뜻입니다. 그러면서도 토큰당 비용은 낮아지죠.

이 결과는 하드웨어와 소프트웨어를 아우르는 풀스택 코디자인에서 나왔습니다. Vera Rubin의 향상된 텐서 코어와 트랜스포머 엔진은 추론의 프리필과 디코드 단계를 모두 가속하고, NVFP4 정밀도는 모델 가중치와 어텐션, KV 캐시 전반에서 메모리 사용량을 줄여 출력 품질 저하를 최소화하면서 처리량을 끌어올립니다.

Vera Rubin 제출 결과는 분리형 서빙을 적극 활용했습니다. 프리필과 디코드를 나누고 대규모 전문가 병렬화를 함께 적용해, DeepSeek-R1이나 Qwen3-VL 같은 모델을 떠받치는 전문가 혼합(mixture-of-experts) 계층 전반에서 효율을 최대로 끌어올린 것이죠.

NVL72 스케일업 도메인은 이러한 기법이 랙 규모에서 제대로 작동하게 만드는 인터커넥트 기반입니다. 6세대 NVIDIA NVLink와 NVLink 스위치로 구동되며, 범용 이더넷 대비 패킷 처리율은 10배 높고 지연 시간은 3배 낮습니다.

이 코디자인은 NVIDIA 파트너 생태계로도 이어집니다. Nebius 역시 Vera Rubin NVL72 프리뷰 결과를 제출해 뛰어난 성능을 입증했죠.

여러 단계에 걸쳐 추론하고 계획하며 행동하는 AI 에이전트는 추론 성능을 재는 방식 자체를 바꾸고 있습니다. 이런 변화를 담아내도록 설계된 SemiAnalysis AgentX 같은 벤치마크에서 Vera Rubin NVL72는 프리뷰 테스트 기준 GB300 NVL72보다 30배 뛰어난 성능을 기록했습니다. 여기에 더해 곧 공개될 MLPerf Endpoints 벤치마크는 기존 처리량 벤치마크가 담아내지 못하던 에이전틱 추론 워크로드에 표준화된 측정 방식을 제시할 예정이죠.

최고 수준의 효율로 확장하는 NVIDIA GB300 NVL72

GPU를 더했을 때 그만큼 처리량이 늘어나는지를 뜻하는 확장 효율은 AI 인프라 생산성을 재는 핵심 척도입니다. NVIDIA는 랙 내부의 고대역폭·저지연 스케일업 인터커넥트와 랙 사이를 잇는 고대역폭 네트워킹, 그리고 노드 전반의 효율적인 요청 오케스트레이션으로 이를 구현합니다.

NVIDIA의 DeepSeek-R1(DSR1) 제출 결과는 GB300 NVL72 랙 한 대(GPU 72개)에서 네 대(GPU 288개)까지 확장하며 오프라인 시나리오에서 99%의 확장 효율을 달성했습니다. 처리량이 추가한 하드웨어에 거의 비례해 늘어난 것이죠.

GB300 NVL72 확장 효율 차트
MLPerf Inference v6.1, Closed Division. 2026년 9월 16일 www.mlcommons.org에서 확인한 결과. NVIDIA 플랫폼 결과는 6.1-0073, 6.1-0074 항목 기준. MLPerf 명칭과 로고는 미국 및 기타 국가에서 MLCommons Association의 등록 및 미등록 상표입니다. 모든 권리 보유. 무단 사용을 금합니다. 자세한 내용은 www.mlcommons.org를 참조하세요.

확장 효율이 중요한 이유는 GPU를 늘린다고 처리량이 자동으로 비례해 늘지는 않기 때문입니다. GPU 수를 두 배 가까이 늘렸는데 처리량이 한 자릿수 퍼센트만 개선된다면, 인프라 비용이 성능으로 돌아오는 이득을 한참 앞질러 버리죠. 아키텍처와 인터커넥트, 소프트웨어가 함께 확장돼야 합니다.

GB300 NVL72는 WAN 2.2 텍스트-투-비디오 벤치마크에서도 랙 스케일 효율을 입증했습니다. 720p 영상을 초당 0.65편, 영상 한 편당 5.7초에 생성해 단일 노드 대비 처리량은 9배 높고 지연 시간은 7.5배 낮았습니다.

지속적인 성능 향상을 이끄는 소프트웨어 최적화

NVIDIA 플랫폼은 소프트웨어 개발이 끊임없이 이어지면서 성능과 기능이 계속 좋아집니다.

v6.1에서 GB300 NVL72의 Qwen3-VL 성능은 v6.0 결과 대비 최대 1.6배 향상됐습니다. KV 캐시 정밀도를 낮추고, 커널 퓨전을 추가하고, 커널 자체를 개선하고, vLLM과 NVIDIA Dynamo로 분리형 서빙을 적용한 것이 성과로 이어졌죠.

소프트웨어 최적화는 v6.1 제출 마감 이후에도 계속됐습니다. 마감 이후 측정한 결과라 아직 MLCommons의 검증을 거치지는 않았지만, GPT-OSS-120B와 DLRMv3에서 추가 성능 향상이 확인됐습니다.

지속적인 소프트웨어 최적화 성과 차트

모든 규모에서 구현하는 AI 추론

NVIDIA는 Grace Blackwell 및 Vera Rubin NVL72 플랫폼 결과 외에도, 새롭게 도입된 Qwen3.6-27B 기반 Edge-Agentic 벤치마크에 NVIDIA TensorRT Edge-LLM을 활용한 Jetson AGX Thor 결과를 제출했습니다.

NVIDIA 파트너 생태계도 폭넓게 참여했습니다. 19개 파트너가 결과를 제출했고 그중 8곳은 멀티 노드 Blackwell NVL72 시스템으로 뛰어난 성능을 입증했는데요. ASUS, Azure, Cisco, CoreWeave, Crusoe, Dell Technologies, Fujitsu, Giga Computing, HPE, Inventec, Lambda, MiTAC Computing, Nebius, Oracle Cloud Infrastructure, Quanta Cloud Technology, Red Hat, ScitiX, Supermicro, Wiwynn이 여기에 포함됩니다.

소형 엣지 디바이스부터 최대 규모의 AI 팩토리까지, NVIDIA는 해마다 이어지는 플랫폼 아키텍처 주기와 끊임없이 개선되는 소프트웨어, 그리고 이를 대규모로 전달하는 생태계를 통해 기술 스택 전반의 성능을 계속 끌어올리고 있습니다.

NVIDIA Vera Rubin 플랫폼에 대해 자세히 알아보세요.