NVIDIA Blackwell GPU에서 구동되는 GPT-6 Astra Ultrafast가 OpenAI API와 자격 요건을 갖춘 ChatGPT Work·Codex 사용자에게 제공되고 있습니다.
Ultrafast는 NVIDIA Blackwell 아키텍처의 역량을 활용하는 OpenAI 모델 기반의 추론 최적화로 가속돼, Astra Standard 모드보다 토큰 생성이 최대 8배 빠릅니다. 개발자 입장에서 생성 속도가 빨라지면 코딩 에이전트의 편집-테스트-디버그 주기가 짧아지고, 도구 호출 사이에 응답을 만들어 내는 시간이 줄며, 인터랙티브 애플리케이션의 반응이 한결 민첩해지죠.
응답이 빨라지는 효과는 그것이 워크플로우 전반에서 반복될 때 가장 크게 나타납니다. 에이전트가 코드를 쓰고, 도구를 사용하고, 결과를 확인한 뒤 다음에 무엇을 할지 정하는 식이죠. Ultrafast는 Astra의 역량을 이처럼 시간에 민감한 루프 안으로 가져옵니다. NVIDIA AI 인프라는 개발자가 필요로 하는 순간에 OpenAI가 더 쓸모 있는 모델 출력을 제공하도록 뒷받침합니다.
OpenAI 추론 총괄 Philippe Tillet은 “NVIDIA가 툴링과 문서화에 깊이 투자해 온 덕분에, 저희는 자사 모델이 Blackwell과 Rubin GPU를 프로그래밍하는 일을 대단히 잘 해내도록 만들 수 있었습니다”라며 “Astra는 그 지식을 고성능 커널로 바꿔 내며, 지연 시간과 처리량, 비용이라는 프론티어 전반에서 NVIDIA 하드웨어를 매력적인 선택지로 만들어 줍니다. Astra Ultrafast에서는 에이전트가 코드를 쓰고 도구를 사용하며 복잡한 작업을 풀어 가는 동안 모델 응답이 더 빨라진다는 뜻입니다”라고 말했습니다.
계속해서 나아지는 성능
성능 향상은 모델을 배포한 뒤에도 멈추지 않습니다. OpenAI는 자사 모델을 활용해 NVIDIA GPU에서 돌아가는 추론 소프트웨어를 다듬고 있으며, 이 과정에서 플랫폼의 프로그래밍 가능성을 살려 개선안을 시험하고 적용하고 있죠. 이렇게 이어지는 작업은 시간이 지날수록 모델 응답을 더 빠르게 만들고 배포된 인프라의 생산성도 끌어올립니다.
OpenAI 컴퓨팅 부문 최고기술책임자(CTO) Uday Ruddarraju는 “NVIDIA와의 협업은 저희가 AI를 더 빠르고 더 쓸모 있게 만드는 데 도움이 되고 있습니다”라며 “저희는 내부 모델을 활용해 NVIDIA GPU에서의 추론을 최적화했고, NVIDIA의 프로그래밍 가능성이 Astra Ultrafast를 떠받치는 가속을 구현하는 데 힘이 됐습니다”라고 말했습니다.
프로그래밍 가능한 NVIDIA 플랫폼 덕분에 개발자와 연구자는 모델이 발전하는 동안에도 학습과 추론, 강화 학습에 걸쳐 인프라를 재활용할 수 있습니다. 이런 유연성은 수요가 달라질 때 컴퓨팅 자원을 다른 용도로 돌려 쓰도록 도와, 가동률을 높이고 워크로드마다 과잉 프로비저닝하는 일을 피하게 해 주죠.
개발자는 API를 통해 GPT-6 Astra Ultrafast를 사용할 수 있습니다. 이용 방법과 가격, 구현 세부 사항은 Ultrafast 가이드에서 확인하세요.
