NVIDIA, Groq 3 LPX 본격 양산으로 에이전트를 위한 Vera Rubin 추론 확장

NVIDIA Groq 3 LPX가 본격 양산에 들어갔습니다. Nebius와 CoreWeave, SpaceXAI를 비롯한 파트너들이 Vera Rubin 플랫폼을 도입하고, Spectrum-X Multiplane과 Scale-In, NVLink Fusion이 AI 팩토리를 끝에서 끝까지 재설계합니다.
by

AI 추론의 다음 시대는 획기적인 칩이나 네트워크, 시스템 하나로 정의되지 않습니다. AI 팩토리의 모든 계층이 어떻게 함께 작동하느냐가 그것을 결정합니다. NVIDIA가 에이전틱 시스템을 위한 빠른 토큰 생성으로 Vera Rubin NVL72를 확장하는 이유이죠.

이번에 새롭게 발표된 대로 NVIDIA Vera Rubin 랙 스케일 시스템 NVIDIA Groq 3 LPX가 본격 양산에 들어갔습니다. 오픈 소스 에이전틱 모델 Gemma 4 31B로 진행한 Artificial Analysis 벤치마크에서, 에이전틱 시스템에 결정적인 10만 토큰 규모의 긴 컨텍스트 활용 사례에서 초당 3,400개의 출력 토큰을 생성해 가장 근접한 경쟁 플랫폼보다 4배 빨랐습니다.

전 세계 업계 파트너들이 Vera Rubin 플랫폼 솔루션을 도입하고 있는데요, SpaceXAI는 차세대 에이전틱 AI를 NVIDIA Vera CPU로 구동한다고 발표했습니다. CoreWeave는 여러 병렬 스위치로 NVIDIA Vera Rubin 랙을 연결해 고대역폭의 평탄하고 무손실인 AI 네트워크를 제공하는 Spectrum-X Multiplane을 프로덕션에 배포했습니다. Nebius는 NVIDIA Groq 3 LPX를 도입한 첫 AI 클라우드입니다.

AI가 학습에서 추론과 에이전틱으로 옮겨 가면서 추론이 새로운 개척지가 됐습니다. 에이전틱 AI 시스템은 더 많은 토큰을 생성하고, 훨씬 큰 컨텍스트 윈도우를 처리하며, 복잡한 문제를 풀기 위해 다른 AI 시스템과 협업하는 일이 늘고 있습니다.

이러한 워크로드에는 성능뿐 아니라 전례 없는 규모에서의 처리량과 응답성, 경제성까지 최적화된 새로운 부류의 인프라가 필요합니다.

이번 주 미국 캘리포니아주 팰로앨토에서 열리고 있는 Hot Chips 콘퍼런스에서 NVIDIA는 극한의 공동 설계가 AI 팩토리를 끝에서 끝까지 어떻게 재편하고 있는지 보여주고 있는데요, 컴퓨팅과 네트워킹, 추론 가속을 하나의 통합 시스템으로 설계함으로써, NVIDIA는 고객이 긴 컨텍스트 추론과 멀티 에이전트 시스템이라는 새로운 요구에 맞춘 인프라를 구축하도록 돕고 있습니다.

Hot Chips 2026 콘퍼런스의 NVIDIA 부스

극한의 공동 설계가 성능을 끌어올립니다

극한의 공동 설계는 NVIDIA 플랫폼을 관통하는 원칙입니다. Vera Rubin은 에이전트가 점점 더 긴 시퀀스를 추론할 때 추론 속도를 끌어올리도록 설계됐습니다.

NVIDIA Spectrum-X Ethernet은 이 방대한 데이터 흐름을 AI 팩토리 전반에서 효율적으로 옮기고, NVIDIA Groq 3 LPX는 토큰을 초고속으로 생성하도록 만들어졌습니다. 두 기술은 NVIDIA가 컨텍스트와 통신에서 생성에 이르기까지 AI 파이프라인의 모든 단계를 하나의 통합된 AI 팩토리 아키텍처로 최적화하고 있음을 보여줍니다.

NVIDIA Groq 3 LPX는 가장 범용성이 높은 AI 팩토리 플랫폼인 Vera Rubin NVL72와 함께 작동하도록 설계된 새로운 저지연 추론 아키텍처를 제시합니다. 이를 통해 기업과 클라우드 사업자는 에이전틱 애플리케이션에 필요한 낮은 지연 시간과 극한의 처리량, 확장 가능한 경제성을 확보할 수 있습니다.

획기적인 성능은 개별 구성 요소를 따로 최적화해서가 아니라, 스택의 모든 계층을 함께 설계할 때 나옵니다. 네트워킹과 컨텍스트 처리부터 대규모 추론까지, NVIDIA의 풀스택 플랫폼은 AI 팩토리를 지능을 만들어내는 통합 엔진으로 바꿔놓습니다. 갈수록 늘어나는 토큰을 매출로 전환하도록 설계된 엔진입니다.


8월 24일 화요일 오전 8시(태평양 시간) 🔗

NVIDIA 파트너들, 최저 토큰 비용을 위해 Vera Rubin 도입

선도적인 AI 클라우드 Nebius가 NVIDIA Groq 3 LPX를 처음으로 도입해, 개발자가 응답성이 매우 높은 에이전틱 AI 애플리케이션을 위한 최고 수준의 토큰 생성 속도를 활용할 수 있게 합니다.

Nebius Token Factory의 NVIDIA Vera Rubin NVL72에 NVIDIA Groq 3 LPX를 더하면 추론 성능이 향상돼, 개발자가 상호작용이 활발한 에이전트와 코딩 시스템을 비롯한 실시간 AI 경험을 대규모로 구축할 수 있습니다.

CoreWeave는 NVIDIA Vera Rubin 랙을 연결하는 Spectrum-X Multiplane을 프로덕션에 배포해 자사 AI 클라우드 인프라의 도약을 이끌고 있습니다.


8월 24일 화요일 오전 8시(태평양 시간) 🔗

SpaceXAI, 에이전틱 AI에 NVIDIA Vera CPU 도입

SpaceXAI는 지구의 데이터센터부터 궤도 위성에 이르기까지 향후 AI 아키텍처를 NVIDIA Vera Rubin을 중심으로 구축하고 확장할 계획입니다. 이 기업은 오케스트레이션과 도구 사용, 코드 실행, 데이터 처리, 시뮬레이션 등 에이전틱 AI의 CPU 집약적 작업을 가속하기 위해 NVIDIA Vera CPU를 배포할 예정입니다.

NVIDIA Vera CPU

SpaceXAI와의 파트너십은 NVIDIA의 풀스택 AI 플랫폼을 SpaceXAI로 확장해, Vera CPU와 NVIDIA 가속 컴퓨팅, 네트워킹, 소프트웨어를 한데 모아 전례 없는 규모의 AI를 진전시킵니다.

에이전틱 시대를 위해 설계된 Vera Rubin은 코어당 최고 수준의 성능과 뛰어난 메모리 대역폭, 부하 상태에서도 예측 가능한 성능을 제공해, 에이전트가 작업을 더 빠르게 끝내고 값비싼 GPU 인프라를 온전히 활용하도록 돕습니다.


8월 24일 화요일 오전 8시(태평양 시간) 🔗

NVIDIA Groq 3 LPX: 인터랙티브 AI 추론 가속기

Vera Rubin NVL72 플랫폼과 함께 코디자인된 NVIDIA Groq 3 LPX는 AI 팩토리가 에이전틱 워크로드에 가장 낮은 지연 시간으로 토큰을 전달하도록 돕습니다.

에이전틱 AI는 새로운 성능 과제를 만들어내고 있습니다. 바로 디코드 지연입니다. AI 에이전트는 추론하고 도구를 사용하고 다른 시스템과 상호작용하면서 응답을 토큰 하나씩 생성하기 때문에, 아주 작은 지연도 복잡한 작업 사슬 전체에 걸쳐 몇 배로 불어납니다. 에이전트가 사용자가 기대하는 속도를 유지하도록, NVIDIA Groq 3 LPX는 토큰 생성에 특화된 가속으로 Vera Rubin NVL72 플랫폼을 확장합니다.

NVIDIA Rubin GPU가 대규모 컨텍스트 처리를 맡고, LPX는 지연에 민감한 디코드 워크로드를 가속합니다. 그 결과 토큰 생성이 더 빠르고 예측 가능해져, AI 팩토리가 반응이 빠른 추론과 매끄러운 에이전트 상호작용, 더 높은 인프라 효율을 제공할 수 있습니다.

NVIDIA Groq 3 LPX 성능 차트

Rubin GPU와 LPU는 함께 속도와 처리량 사이의 전통적인 트레이드오프를 없애도록 설계돼, AI 제공업체가 차세대 에이전틱 AI 애플리케이션을 위한 반응성 높은 대규모 추론을 구현하도록 돕습니다.

토큰 팩토리를 짓다

업계가 모델 학습에서 대규모 지능 서비스로 옮겨 가면서, 인프라는 NVIDIA가 ‘토큰 팩토리’라고 부르는 형태로 진화해야 합니다. 성능과 처리량, 지능의 신뢰성, 경제적 효율을 동시에 제공하는 인프라입니다. 에이전틱 AI 시스템은 다른 AI 시스템과 소통하고, 여러 데이터 소스에 접근하며, 방대한 컨텍스트를 유지하는 일이 늘면서 빠른 추론에 대한 전례 없는 수요를 만들어내고 있습니다.

NVIDIA Groq 3 LPX는 바로 이런 워크로드를 위해 설계됐습니다. Vera Rubin NVL72의 확장으로서, 거대한 컨텍스트 윈도우에서도 초고속 응답성을 구현하는 동시에 서비스 제공업체가 처리량과 인프라 활용도를 극대화하도록 돕습니다.

추론을 위한 극한의 공동 설계

독립형 가속기와 달리 NVIDIA Groq 3 LPX는 극한의 코디자인으로 GPU와 LPU의 강점을 결합합니다. Rubin GPU와 LPU가 AI 모델의 모든 계층을 함께 연산해, 에이전틱 워크로드에서 새로운 수준의 추론 성능을 구현합니다.

대규모 환경에서 LPU 집합은 결정론적 추론에 최적화된 하나의 거대한 프로세서처럼 동작합니다. 랙 스케일 NVIDIA Groq 3 LPX 배포에는 칩 간 직접 링크로 연결된 LP30 가속기 256개가 포함될 수 있으며, 이는 현대 AI 팩토리를 위해 만들어진 매우 효율적인 추론 엔진이 됩니다.

에이전틱 AI 시대를 위한 설계

추론 모델이 커지고 에이전틱 워크플로우가 갈수록 더 많은 토큰을 만들어내면서, 이를 서비스할 인프라도 함께 진화해야 합니다. NVIDIA Groq 3 LPX는 응답성과 처리량, 효율을 극대화하도록 특별히 설계된 추론 아키텍처로 Vera Rubin NVL72 플랫폼을 확장하며 차세대 AI 팩토리를 뒷받침합니다.

그리고 이것은 시작에 불과합니다. Vera Rubin NVL72와 결합하면 더 많은 최적화와 더 많은 모델, 더 높은 성능이 뒤따릅니다. 새로운 수준의 처리량과 상호작용성이 다가오고 있습니다. 계속 지켜봐 주시기 바랍니다.


8월 24일 화요일 오전 8시(태평양 시간) 🔗

NVIDIA Spectrum-X Multiplane, 더 평탄하고 견고한 네트워크로 대규모 AI 팩토리를 구현하다

AI 팩토리가 거대해지면서 네트워크는 성능을 좌우하는 핵심 엔진이 됐습니다. NVIDIA는 Hot Chips에서 Spectrum-X Multiplane을 강조하고 있는데요. 하드웨어 가속 Spectrum-X Ethernet 아키텍처의 최신 기술로, 네트워크 계층을 하나 더 추가할 때 따라오는 지연과 지터, 비용 없이 이더넷을 전례 없는 규모로 확장할 수 있게 해줍니다.

NVIDIA Spectrum-X Multiplane 아키텍처

NVIDIA Spectrum-X Ethernet은 엔드투엔드 AI 최적화 이더넷 플랫폼으로 설계돼, NVIDIA Spectrum-X Ethernet 스위치와 SuperNIC, 소프트웨어를 결합해 AI 팩토리와 클라우드를 위한 이더넷 기반 AI 인프라의 성능과 효율을 높입니다. 이 플랫폼은 기성 이더넷 대비 1.6배 나은 AI 네트워킹 성능을 제공하는 한편, 멀티테넌트 환경에서도 일관되고 예측 가능한 성능을 유지하도록 설계됐습니다.

Multiplane, 계층을 더하는 대가 없이 규모를 열다

최대 규모 클러스터를 넘어 AI 팩토리를 확장하려면 통상 세 번째 네트워크 계층을 추가해야 했습니다. 이는 지연을 늘리고 속도를 예측하기 어렵게 만들며 케이블과 광학 부품, 전력 비용을 끌어올립니다. Spectrum-X Multiplane은 더 단순한 방식을 택했는데요, 각 서버의 네트워크 연결을 여러 개의 독립 경로, 즉 ‘플레인’으로 나누고 각 플레인이 자체적인 가벼운 2계층 네트워크를 구성하도록 합니다. 그 결과 세 번째 계층의 비용과 복잡성 없이 GPU 51만 2,000개까지 확장되는 평탄하고 단순한 네트워크가 만들어집니다.

이 모든 과정은 자동으로 이뤄집니다. NVIDIA ConnectX SuperNIC 내부의 전용 하드웨어 엔진이 플레인 전반의 트래픽을 관리하고 장애가 생기면 즉시 우회 경로로 재라우팅하기 때문에, 애플리케이션과 소프트웨어는 하나의 빠르고 안정적인 연결만 보게 됩니다. 8개 플레인 구성에서 한 플레인에 장애가 발생해도 네트워크는 전체 대역폭의 약 90%를 유지하며, 하드웨어 복구 속도는 소프트웨어 기반 멀티플레인 로드 밸런싱보다 11배 빠릅니다. 이는 AI 팩토리 산출량 1.6배 향상으로 이어집니다.

극한의 공동 설계로 완성되다

이러한 안정성은 스위치 실리콘과 SuperNIC, 소프트웨어를 아우르는 Vera Rubin NVL72의 극한의 공동 설계에서 나옵니다. 102.4Tb/s Spectrum-6 이더넷 ASIC을 기반으로 한 Spectrum-X SN6000 시리즈 스위치와 GPU당 최대 1,600Gb/s를 지원하는 ConnectX-9 SuperNIC은 Vera Rubin NVL72 AI 팩토리를 위해 특별히 설계됐습니다. Spectrum-XGS Ethernet은 이 코디자인을 데이터센터 전반으로 확장해, 여러 시설이 하나의 AI 슈퍼 팩토리처럼 작동하게 하고 다중 사이트 NCCL 집합 연산을 1.9배 가속합니다.


8월 24일 화요일 오전 8시(태평양 시간) 🔗

NVIDIA, BlueField-4와 DOCA로 구동되는 에이전틱 AI 팩토리용 Scale-In 인프라 공개

NVIDIA는 NVIDIA AI 네트워킹의 다섯 번째 축이자 에이전틱 AI 팩토리를 위한 새로운 부류의 가속 네트워크 인프라인 NVIDIA Scale-In을 선보입니다. Scale-In은 AI 팩토리를 보호하고 관리하고 운영하는 인프라 서비스로 특화된 가속을 확장합니다.

NVIDIA BlueField-4 프로세서

NVIDIA BlueField-4 프로세서와 NVIDIA DOCA 소프트웨어 플랫폼으로 구동되고 NVIDIA Spectrum-X Ethernet으로 연결되는 NVIDIA Scale-In은 기존의 노스-사우스(north-south) 액세스 네트워크를 하나로 통합된 가속 인프라 도메인으로 바꿔놓습니다.

클라우드 컴퓨팅은 데이터센터에 소프트웨어 정의 네트워킹과 구성 가능성(컴포저빌리티), 탄력성을 가져왔고, 사용자와 애플리케이션, 데이터, 서비스가 동적으로 확장될 수 있게 했습니다.

에이전틱 AI는 그다음 플랫폼 전환입니다. AI 팩토리는 방대한 가속 컴퓨팅에 점점 늘어나는 사용자와 애플리케이션, 자율 에이전트를 한데 모으고, 이들은 데이터와 스토리지, 서비스와 끊임없이 상호작용합니다. 이는 AI를 구현하는 인프라에 대한 요구를 바꿔놓습니다. 이제 네트워킹과 스토리지, 사이버보안, 운영도 AI 컴퓨팅과 함께 가속돼야 하며, 소프트웨어 정의의 유연성에 목적에 맞게 설계된 하드웨어 가속과 풀스택 코디자인이 더해져야 합니다.

NVIDIA Scale-In은 멀티테넌트 네트워킹과 고성능 스토리지 접근, 칩 내장(in-silicon) 보안, 탄력적 프로비저닝, 실시간 관측성을 제공하면서도 인프라 처리를 호스트 컴퓨팅 자원과 분리해 유지합니다. 이러한 서비스를 AI 팩토리의 일부로 가속하고 공동 설계함으로써 Scale-In은 보안과 데이터 접근, 운영이 AI 컴퓨팅과 함께 확장되도록 돕습니다. 그 결과 에이전틱 AI를 대규모로 배포하고 운영하기 위한 안전하고 효율적이며 관리 가능한 공유 인프라가 만들어집니다.

Hot Chips 2026 현장의 NVIDIA 전시

8월 24일 화요일 오전 8시(태평양 시간) 🔗

NVIDIA NVLink Fusion, XPU를 NVIDIA의 선도적인 AI 플랫폼에 연결하다

NVIDIA NVLink Fusion은 맞춤형 실리콘을 NVIDIA의 세계 최고 수준 AI 인프라 플랫폼으로 끌어들여, 하이퍼스케일러와 AI 네이티브 기업이 더 높은 성능과 유연성, 속도로 세미 커스텀 AI 팩토리를 구축할 수 있게 합니다.

AI 모델이 커지고 복잡해질수록 순수한 연산력만으로는 충분하지 않습니다. AI 팩토리에는 고대역폭·저지연 스케일업 네트워킹과 검증된 랙 스케일 아키텍처, 그리고 전력과 냉각, 관리 소프트웨어, 공급망을 아우르는 완전한 생태계가 필요합니다. NVLink Fusion은 맞춤형 XPU와 CPU를 NVIDIA의 스케일업·스케일아웃 기술 스택에 연결해 이러한 과제를 해결합니다.

이 플랫폼에는 스케일업 네트워킹을 위해 특별히 설계된 6세대 NVIDIA NVLink와 NVLink 스위치, 그리고 XPU와 CPU 사이의 에너지 효율적인 연결을 위한 NVLink-C2C가 포함됩니다. NVIDIA MGX 생태계를 통해 도입 기업은 양산으로 검증된 랙 설계와 부품, 제조 파트너 솔루션, 그리고 분산 컴퓨팅과 분리형 워크로드, 클러스터 관리를 위한 개방적이고 확장 가능한 소프트웨어도 활용할 수 있습니다.

GPU 기반 시스템과 XPU 기반 시스템을 하나의 통합 아키텍처로 표준화함으로써, NVLink Fusion은 데이터센터 구축을 실리콘 준비 시점과 분리할 수 있게 합니다. 운영사는 랙 공간과 네트워킹, 냉각, 전력 공급, 관리 시스템을 공유하고, 공급 상황과 워크로드 요구가 달라지면 GPU와 XPU의 구성 비율을 조정할 수 있습니다.

NVLink Fusion은 수직으로 통합하되 수평으로는 개방한다는 NVIDIA AI 플랫폼의 접근 방식을 맞춤형 실리콘으로 확장합니다. 파트너는 자신이 차별화하는 영역에서 자유롭게 혁신하면서 컴퓨팅과 네트워킹, 인프라, 소프트웨어 전반의 NVIDIA 기술을 활용할 수 있습니다. 어느 한 기업도 홀로 만들 수 없는 단일하고 유연한 AI 팩토리가 그렇게 만들어집니다.