NVIDIA Groq 3 LPX, 에이전틱 AI 위한 세계적 수준의 속도로 본격 양산에 돌입하다

Groq 3 LPX는 NVIDIA Vera Rubin NVL72 시스템의 추론 성능을 확장해 토큰 생성 속도를 크게 높입니다.
by

인터랙티브 AI 추론 가속기인 NVIDIA Groq 3 LPX가 본격적인 양산에 들어갔습니다. NVIDIA Vera Rubin 플랫폼을 확장하는 Groq 3 LPX는 반응성이 뛰어난 에이전틱 시스템의 초고속 토큰 생성을 지원해 AI 추론 성능을 크게 향상시킵니다.

에이전틱 시스템은 수백에서 수천 단계에 걸친 추론 과정에서 방대한 양의 토큰을 생성할 수 있는데요. 따라서 에이전트의 실시간 추론·행동과 복잡한 작업을 완료하기 위해서는 토큰 생성 속도를 높이는 것이 매우 중요합니다.

Vera Rubin NVL72 시스템은 모든 AI 팩토리를 위한 가장 다재다능한 학습 및 추론 플랫폼을 제공합니다. NVIDIA Groq 3 LPX는 토큰 생성 속도를 획기적으로 높여 Vera Rubin NVL72의 추론 성능을 확장하며, 대규모 컨텍스트를 처리하는 워크로드에 최상의 사용자 경험을 제공합니다. 이를 통해 에이전트가 극한의 속도로 작동할 수 있도록 지원하죠.

NVIDIA Groq 3 LPX는 AI 추론의 한계를 확장하고 있습니다. Groq 3 LPX는 오픈소스 에이전틱 모델 Gemma 4 31B를 대상으로 에이전틱 시스템에 필수적인 10만 토큰 컨텍스트를 적용한 아티피셜 애널리시스(Artificial Analysis) 벤치마크에서 초당 3,400개의 출력 토큰이라는 기록적인 성능을 달성했는데요. 이는 해당 모델에서 지금까지 기록된 가장 빠른 성능입니다.

Groq 3 LPX는 코딩과 같은 에이전틱 작업을 몇 시간이 아닌 단 몇 분 만에 수행할 수 있도록 지원하며, 가장 유사한 대체 플랫폼 대비 에이전트와 지연 시간에 민감한 워크로드에서 4배 빠른 응답 속도를 제공합니다.

NVIDIA 젠슨 황 CEO는 “추론은 AI 성장의 원동력입니다. NVIDIA Grace Blackwell과 NVL72는 전례 없는 성능과 효율성 향상을 통해 거대 언어 모델(large language model, LLM) 추론에 혁신을 가져왔죠. Vera Rubin은 에이전틱 AI 시대를 위해 워크로드에 최적화된 AI 팩토리 구성으로 이러한 비전을 확장하며, 초고속 토큰 생성을 위한 LPX로 성능의 한계를 한층 더 끌어올립니다. 이는 지능이 생산되는 방식을 혁신하며, 전 세계적으로 AI 컴퓨팅 수요가 증가하는 가운데 AI 처리량, 효율성, 응답성 측면에서 또 한 번의 획기적인 도약을 가능하게 합니다”라고 말했습니다.

Groq 3 LPX, 인터랙티브 AI 추론 가속기

에이전틱 AI는 두 가지 뚜렷한 컴퓨팅 과제를 제시하는데요. 하나는 방대한 양의 컨텍스트를 효율적으로 처리하는 것이고, 다른 하나는 매우 낮은 지연 시간으로 토큰을 생성하는 것입니다.

NVIDIA Groq 3 LPX는 Vera Rubin의 상호작용성 향상을 위해 특별히 설계됐습니다. 이는 개별 사용자를 위한 토큰이 생성되는 속도를 의미하며, 에이전트가 각 작업 단계를 얼마나 빠르게 완료할 수 있는지를 결정합니다.

생성 속도가 빨라지면 에이전트는 반응성이 뛰어난 사용자 경험을 유지하면서 파일 검토, 코드 작성·테스트, 도구 호출, 결과 검증, 반복 작업에 더 많은 시간을 할애할 수 있죠.

Groq 3 LPX로 가속화되는 AI 클라우드

AI 클라우드는 AI 경제의 원동력으로 자리 잡고 있으며, 기업과 개발자가 대규모 학습, 추론(reasoning), 인퍼런스(inference)를 위한 첨단 인프라를 활용할 수 있도록 지원합니다. 지연 시간에 민감한 대규모 추론 워크로드를 처리하는 서비스 제공업체에 NVIDIA Groq 3 LPX는 검증된 랙 스케일 시스템에서 차별화된 컴퓨팅을 구축할 수 있는 기반을 제공합니다.

선도적인 AI 클라우드 기업 Nebius는 자사의 생산용 추론 플랫폼인 Nebius 토큰 팩토리(Token Factory)에 NVIDIA Groq 3 LPX를 도입할 계획입니다. 이를 통해 개발자들은 뛰어난 응답성을 갖춘 에이전틱 AI 애플리케이션을 위해 초고속 토큰 생성 기능을 활용할 수 있는데요.

Nebius 최고기술책임자(CTO) Danila Shtan은 “생성은 AI 시스템의 실제 응답 속도를 결정하는 추론 단계이며, NVIDIA Groq 3 LPX는 바로 이 과정을 가속화하기 위해 설계됐죠. 우리는 Nebius 토큰 팩토리를 통해 이를 실제 운영 환경에 도입하는 최초의 AI 클라우드 기업으로서, 개발자들이 새로운 스택으로 마이그레이션할 필요 없이 기존 API를 그대로 사용하면서 에이전트 루프의 모든 단계가 즉각적으로 이뤄지는 경험을 제공합니다”라고 말했습니다.

Nebius에 이어, AI 추론에 특화된 클라우드 기업 Groq도 해당 플랫폼을 가장 먼저 도입하는 기업 중 하나가 될 예정입니다.

AI 팩토리를 위한 극한의 공동 설계

NVIDIA Vera Rubin은 7개의 칩과 5개의 특수 설계된 랙 전반에 걸친 극한의 공동 설계(extreme codesign)를 통해 가장 포괄적인 AI 팩토리 플랫폼을 제공합니다.

NVIDIA Vera Rubin NVL72와 Groq 3 LPX는 프론티어 모델 개발사와 오픈 모델 서비스 제공업체를 비롯한 AI 팩토리의 다양한 워크로드 요구 사항을 충족합니다.

이러한 랙 플랫폼에는 NVIDIA BlueField®-4 DPU가 탑재됩니다. 또한, NVIDIA Vera CPU 랙, NVIDIA Vera BlueField-4 STX 스토리지, NVIDIA SpectrumTM-6 SPX Ethernet과 결합해 멀티 에이전트 시스템을 최적화함으로써 와트당 최고 처리량과 최저 지연 시간의 인퍼런스를 제공합니다.