NVIDIA Vera Rubin, 포스트 트레이닝 워크로드의 달러당 지능 극대화 — 에이전틱 AI 시대의 핵심 지표

극한의 코디자인으로 구현한 최저 토큰당 비용이 에이전틱 시대 포스트 트레이닝의 달러당 지능을 극대화합니다.
by

프로 운동선수를 떠올려 보세요. 최정상급 선수를 만드는 것은 경기와 경기 사이에 일어나는 일입니다. 끊임없는 연습, 새로운 상대에 대한 적응, 그리고 지난 경기에서 드러난 약점을 바탕으로 한 기량 연마입니다.

에이전틱 AI도 마찬가지입니다. 이제 모델에 요구되는 것은 단순한 답변이 아닙니다. 모델은 목표를 부여받고, 환경이 바뀌고 엣지 케이스가 등장하며 도구가 달라지는 상황에 계속 적응해야 합니다. 프롬프트에 응답하는 생성형 모델과 달리 에이전틱 모델은 계획을 세우고, 다양한 도구를 사용하며, 작업 도중 마주치는 문제로부터 스스로 회복해야 합니다.

원본 데이터로 초기 학습을 마친 모델을 다듬는 단계인 포스트 트레이닝(post-training)이 더 이상 일회성 마무리 작업이 아닌 이유가 바로 여기에 있습니다. 에이전틱 모델이 작동하는 환경은 빠르게 변하기 때문에 포스트 트레이닝은 지속적으로 이뤄집니다. 에이전트가 사용하는 도구는 주 단위로 바뀔 수 있습니다. 어떤 테스트 세트로도 예측하지 못한 엣지 케이스가 실제 운영 환경에서 나타납니다. 배포되는 현장마다 고유한 코드베이스와 정책, 환경이 존재하죠.

새로운 문제가 드러날 때마다 운영 환경의 피드백이 다시 포스트 트레이닝 실행으로 이어집니다. 개별 실행 규모가 커져서가 아니라 실행이 결코 멈추지 않기 때문에 컴퓨팅 규모가 커집니다. 에이전틱 AI는 포스트 트레이닝에 새로운 컴퓨팅 패턴을 도입하며, 포스트 트레이닝을 에이전틱 시대의 핵심 워크로드이자 달러당 지능(intelligence per dollar)을 좌우하는 주된 요인으로 만들고 있습니다.

포스트 트레이닝의 목표는 지속적인 학습 사이클에서 모든 순전파와 역전파의 산출을 극대화해 달러당 지능을 최대치로 끌어올리는 것입니다. 순전파, 즉 추론은 토큰당 비용으로 측정됩니다. 다시 말해 토큰당 비용이 개선될 때마다 그 효과가 곧바로 달러당 지능으로 이어집니다.

에이전틱 포스트 트레이닝의 이해

지능이 만들어지는 곳은 바로 포스트 트레이닝입니다. 사전 학습 단계에서 모델은 다음 토큰을 예측하는 법을 배우며, 이를 통해 유창함은 얻지만 지능을 갖추지는 못합니다. 코드를 작성하고, 여러 단계로 이뤄진 과제를 계획하고, 검색 도구를 활용하고, 문제가 생겼을 때 회복하는 법을 익히는 단계가 포스트 트레이닝입니다. 그다음에 오는 것이 추론으로, 실제 현장에서 작업을 수행하는 모델의 활동이며 토큰당 비용으로 가격이 매겨집니다.

외워야 할 정답지 없이 보상만 주어지기 때문에 모델은 강화 학습(RL) 기법으로 학습합니다. 과제가 주어지면 모델은 답을 작성하는데, 이 순전파 과정은 실제 현장에서 수행하는 작업과 동일합니다. 그 결과에 점수가 매겨지고, 여기서 얻은 교훈이 모델의 가중치를 갱신합니다. 이것이 역전파입니다. 수백만 번의 시도를 거치며 지능이 자라납니다.

각 단계는 컴퓨팅 집약적이며, 이 루프를 대규모로 실행하는 일은 곧 오케스트레이션의 문제입니다. 수천 개의 환경이 병렬로 롤아웃을 생성하고, 보상이 검증되며, 갱신된 가중치가 다시 학습 과정으로 흘러 들어가는 동안 가속기는 완전히 가동돼야 합니다. 학습 환경을 위한 NeMo Gym, 분산 포스트 트레이닝을 위한 NeMo RL 같은 NVIDIA NeMo 오픈 라이브러리는 포스트 트레이닝을 맞춤형 연구 코드에서 반복 사용 가능한 인프라로 바꿔 놓습니다.

달러당 지능이 토큰당 비용을 확장하는 이유

추론이 매출 엔진이라면 포스트 트레이닝은 그 성과를 배가하는 증폭기입니다. 모델의 역량이 뛰어날수록 제공되는 모든 토큰의 가치가 높아지기 때문입니다.

토큰당 비용은 추론 팩토리의 핵심 지표로, 100만 개의 토큰을 제공하는 데 드는 총비용을 뜻합니다. 달러당 지능은 그보다 한 단계 위에서 다른 질문에 답합니다. 제공할 만한 가치가 있는 모델을 만드는 데 얼마가 들고, 환경이 변하는 가운데 그 가치를 유지하는 데 또 얼마가 드는가 하는 물음입니다.

두 지표는 서로 경쟁하는 것이 아니라 포개져 있습니다. 토큰당 비용을 낮추는 AI 인프라는 모델에 담기는 지능 한 단위를 만드는 비용도 함께 낮춥니다. 그리고 모델에 담긴 지능이 한 단계 높아질 때마다 추론 팩토리가 제공하는 모든 토큰의 가치가 올라갑니다.

다시 말해 토큰당 비용은 운영 효율을 측정하고, 달러당 지능은 모델 지능에 대한 투자가 성과를 내고 있는지를 측정합니다.

달러당 지능 극대화: Nemotron 3 Ultra 포스트 트레이닝

NVIDIA Nemotron 3 Ultra는 5,500억 개의 파라미터를 갖춘 오픈 웨이트 전문가 혼합(MoE) 모델로, 검증 가능한 벤치마크와 NeMo RL에서 실행된 포스트 트레이닝 레시피 전체를 공개합니다. 이 모델은 실제 코딩 능력을 평가하는 표준 벤치마크인 SWE-bench Verified에서 71.7%를 기록했습니다. 오픈 소스 프로젝트에서 발생한 실제 소프트웨어 버그 10건 중 약 7건에 대해 작동하는 수정 코드를 만들어냈으며, 각 결과는 해당 프로젝트 자체 테스트로 검증됐습니다.

예시로 사용된 200억 개의 롤아웃 토큰은 이전 세대인 Nemotron 3 Super의 약 120만 회 롤아웃(회당 약 1만 토큰)을 기준으로 더 큰 Ultra 모델에 맞게 확대 적용한 수치입니다. 플랫폼 간 달러당 지능 비교는 이 가정과 무관하며, 절대값은 토큰 수에 따라 달라집니다.

NVIDIA Blackwell 플랫폼은 실행 1회당 비용을 낮춰, 에이전틱 시대가 요구하는 잦은 포스트 트레이닝을 경제적으로 실현 가능하게 만듭니다. 그렇게 확보한 지능은 제공되는 모든 토큰에서 결실을 맺습니다.

NVIDIA Vera Rubin 플랫폼은 이 흐름을 한층 더 확장해, Blackwell 세대의 4분의 1에 해당하는 GPU만으로 최대 규모의 모델을 학습시킵니다. Vera Rubin은 에이전틱 포스트 트레이닝 부하에서 달러당 지능을 극대화하도록 처음부터 끝까지 코디자인됐습니다. 실행당 더 많은 롤아웃, 더 많은 환경의 동시 활용, 그리고 결코 멈추지 않는 포스트 트레이닝 사이클을 뒷받침합니다.

실제 현장의 포스트 트레이닝 워크플로우

Prime Intellect Lab은 NVIDIA Blackwell에서 프런티어 오픈 모델을 지속적으로 포스트 트레이닝하며, 추론 오케스트레이션에 NVIDIA Dynamo를 활용합니다. Prime Intellect는 Vera Rubin을 통해 강화 학습 환경을 확장하고 실행당 롤아웃을 늘리며 학습에서 추론으로 이어지는 반복 루프를 가속화해 기업의 달러당 지능을 극대화할 계획입니다.

Prime Intellect는 NVIDIA Vera CPU와 통합되도록 샌드박스 인프라를 최적화해 저지연·에너지 효율적인 강화 학습을 구현했습니다. NVIDIA Nemotron, NVIDIA NeMo Gym 같은 오픈 소스 도구와 모델도 소프트웨어 스택에 통합했습니다. 실제와 유사한 RL 샌드박스 워크로드를 대체 x86 아키텍처와 비교한 결과, Prime Intellect는 Vera가 CPU당 평균 30% 높은 처리량을 제공한다는 사실을 확인했습니다.

Perplexity의 RL 포스트 트레이닝 스택은 수백 개의 NVIDIA GPU에 걸쳐 비동기로 실행되며, RDMA 기반 가중치 전송 엔진을 통해 조 단위 파라미터 모델을 학습 노드와 추론 컴퓨팅 노드 사이에서 2초 이내에 동기화합니다. 이렇게 포스트 트레이닝을 마친 Qwen3 235B 모델은 NVIDIA GB200 NVL72 시스템에서 서비스됩니다.

Together AI는 지도 미세 조정, RL, 직접 선호 최적화를 포함한 포스트 트레이닝을 서비스 형태로 제공합니다. 이 서비스는 자사 AI 네이티브 클라우드 플랫폼에서 포스트 트레이닝 전 과정을 지원하는 다양한 기능의 애플리케이션 프로그래밍 인터페이스와 소프트웨어 개발 키트를 통해 제공됩니다. Together AI는 NVIDIA 플랫폼과 최적화된 커널 라이브러리 위에서 서비스를 운영해 왔으며, 다음 단계로 Vera Rubin 플랫폼 활용을 검토하고 있습니다.

워크로드 전반에서 달러당 지능을 극대화하는 AI 팩토리용 플랫폼 NVIDIA Vera Rubin에 대해 자세히 알아보세요. 또한 프런티어 모델 학습을 위한 NVIDIA의 풀스택 플랫폼도 살펴보시기 바랍니다.