NVIDIA, IBC에서 방송·스포츠·글로벌 스트리밍에 실시간 AI를 선보이다

NVIDIA는 IBC에서 NVIDIA AI for Media의 대규모 확장을 발표합니다. 동작을 이해하고, 영상을 검증하고 개선하며, 프로그램을 현지화하고, AI 기반 미디어 애플리케이션을 구축하는 새로운 길이 열립니다.
by

9월 11일부터 14일까지 네덜란드 암스테르담에서 열리는 IBC 콘퍼런스는 크리에이티브·기술·비즈니스 커뮤니티가 한자리에 모여 아이디어를 실행으로 옮기고 미디어·엔터테인먼트 산업 전반의 혁신을 논의하는 자리인데요, 170개국이 넘는 곳에서 4만 4,000명 이상이 모여 14개 이상의 홀과 야외 공간에 마련된 1,300개 이상의 전시를 둘러보고, 600명이 넘는 연사가 인사이트를 전합니다.

NVIDIA가 이번 행사에서 선보이는 내용을 아래에서 확인해 보세요.


NVIDIA AI for Media, 방송·스포츠·프로덕션 워크플로우에 실시간 인텔리전스를 더하다 🔗

미디어 기업들은 라이브 프로덕션과 스포츠, 뉴스, 스트리밍 워크플로우에 AI를 점점 더 깊이 통합하고 있습니다. 더 풍부한 경기력 인사이트를 얻고, 영상의 진위를 검증하며, 콘텐츠를 개선하고 현지화하기 위해서입니다. 이 모든 과정이 검증된 기존 방송 환경을 그대로 유지한 채 이뤄집니다.

NVIDIA는 암스테르담에서 열리는 IBC 2026에서 NVIDIA AI for Media의 대규모 확장을 발표했습니다. NVIDIA AI for Media는 미디어·엔터테인먼트 워크플로우의 오디오와 비디오, 증강현실 효과를 향상하는 GPU 가속 소프트웨어 개발 키트(SDK)와 NVIDIA NIM 마이크로서비스, 플레이북, 블루프린트를 모은 것입니다. 이번 확장으로 동작을 이해하고, 영상을 검증하고 개선하며, 프로그램을 현지화하고, AI 기반 미디어 애플리케이션을 구축하는 새로운 길이 열리게 됩니다.

SIGGRAPH에서 발표된 NVIDIA Synthetic Video Detector(SVD) NIM 마이크로서비스는 특정 영상이 실제 촬영본인지 AI로 생성된 것인지 그 가능성을 평가하도록 돕습니다. 편집과 콘텐츠 인증, 디지털 포렌식, 미디어 무결성을 담당하는 팀에 검토 과정에서 참고할 또 하나의 분석 근거를 제공합니다.

최초 공개 이후 SVD의 정확도는 텍스트-투-비디오 콘텐츠에서 99.3%, 이미지-투-비디오 콘텐츠에서 97.7%에 도달했습니다. 특히 판별이 까다로운 이미지-투-비디오 사례에서 큰 폭의 개선이 있었죠.

Dalet은 뉴스 조직을 위한 안전한 클라우드 기반 검증 워크플로우에 SVD를 통합하고 있습니다. 이를 통해 편집팀은 Dalet 인터페이스 안에서 영상을 SVD로 보내고, 그 결과 점수와 메타데이터를 확인하고 검토할 수 있습니다.

TwelveLabs는 자사 영상 인텔리전스 플랫폼 위에 구축한 첫 애플리케이션 Compliance by TwelveLabs의 정식 출시를 발표했습니다. 미디어·방송 팀이 지역별 및 자체 컴플라이언스 기준에 맞춰 콘텐츠를 신속하게 점검하도록 돕는 솔루션입니다. 여기에 SVD를 통합해 프레임 단위의 진위 신호와 신뢰도 점수를 더함으로써, 미디어 팀이 동일한 컴플라이언스 워크플로우 안에서 합성 가능성이 있는 미디어를 식별할 수 있게 했습니다.

Wowza의 Wowza Streaming Engine 미디어 서버 기술은 170개가 넘는 국가에서 3만 5,000건 이상의 영상 배포를 구동하고 있습니다. Wowza는 Wowza Video Intelligence Framework를 통해 SVD를 공급할 예정인데요, NVIDIA 가속 인프라로 구동되는 이 솔루션은 방송사와 스트리밍 사업자를 비롯한 여러 조직이 라이브 영상 피드를 분석해 감지된 객체와 장면, AI 생성 흔적에 관한 데이터를 실시간으로 추출할 수 있게 합니다. 이로써 온프레미스와 엣지, 클라우드, 하이브리드 환경은 물론 완전한 에어갭 환경에서도 배포·실행할 수 있어, 조직이 핵심 미디어 워크플로우를 더 강하게 통제할 수 있습니다.

NVIDIA 3D Body Pose는 카메라 한 대로 촬영한 영상에서 사람의 2D·3D 관절 위치와 각도를 추정합니다. 마커 기반 캡처 시스템 없이도 동작을 구조화된 데이터로 바꿔 줍니다.

스포츠 조직에게 이 데이터는 선수의 움직임 추적과 생체역학·경기력 분석, 리플레이 개선, 심판 판정 워크플로우, 선수 안전 관련 활용, 가상 인터랙션과 몰입형 경험까지 뒷받침할 수 있습니다.

이 기술은 콘텐츠 제작 워크플로우에 필요한 구조화된 인체 동작 데이터도 제공합니다. 호환되는 캐릭터 리그에 매핑하면 관절과 동작 데이터를 애니메이션 블로킹과 디지털 더블, 캐릭터 리타기팅, 버추얼 프로덕션 경험의 입력값으로 활용할 수 있습니다.

Vizrt는 라이브 버추얼 스튜디오 환경에서 Body Pose 기술을 활용하고 있습니다. 추적된 신체 움직임이 반사와 그림자, 환경 렌더링 같은 실시간 3D 조명 효과를 구동합니다.

Video Frame Generation(VFG)은 생성형 AI로 원본 프레임 사이에 새로운 프레임을 만들어 영상의 움직임을 더 부드럽게 보이게 합니다. 시각적 품질과 시간적 일관성을 유지하면서 프레임 레이트를 2배 또는 4배로 높일 수 있어, 스포츠와 슬로모션 리플레이, 라이브 미디어를 비롯한 움직임이 많은 영상 경험을 한층 매끄럽게 만듭니다. 또한 VFG는 프레임 레이트 변환과 생성형 AI 영상 워크플로우를 위한 프레임 부스팅도 지원합니다.

Ross Video는 스포츠 프로덕션용 AI 보조 슬로모션 영상을 만들기 위해 자사 Rio Replay 플랫폼에 VFG를 통합하고 있습니다.

이 작업은 스포츠 리플레이를 위한 6배속 슬로모션 생성을 지원합니다. 현재 8배 보간을 목표로 개발이 진행 중인데, 이는 초고속 프레임 카메라로 모든 프레임을 촬영하지 않고도 생성된 중간 프레임만으로 리플레이 팀이 더 부드러운 움직임을 얻을 수 있다는 뜻입니다.

NVIDIA Video Super Resolution(VSR)은 AI로 영상을 업스케일링하면서 노이즈와 블러, 압축 아티팩트를 줄입니다. 새로운 스트리밍 모드를 통해 개발자는 실시간 성능과 더 높은 화질 가운데 선택할 수 있고, 조절 가능한 제어 옵션으로 원하는 수준의 화질 개선을 얻을 수 있습니다. VSR은 10비트 영상 지원을 추가하고 전반적인 성능과 품질도 개선했습니다. VSR은 NVIDIA Video Effects SDK와 NIM 마이크로서비스로 제공되어 스트리밍과 방송, 콘퍼런싱, 영상 재생, 콘텐츠 제작 애플리케이션에 활용할 수 있습니다.

이 기술은 공통 인터페이스를 통해 영상 플레이어와 콘퍼런싱 애플리케이션, 크리에이터 도구, 스트리밍 서비스, 트랜스코더, 방송 시스템을 지원할 수 있습니다.

NVIDIA TrueHDR은 표준 다이내믹 레인지(SDR) 영상을 실시간으로 하이 다이내믹 레인지(HDR) 출력으로 변환합니다. 최대 약 2,000니트에 이르면서도 국소 대비를 유지하고 콘텐츠에 맞춰 밝기를 조정합니다.

VSR과 VFG, TrueHDR은 하나의 비디오 이펙트 파이프라인 안에서 함께 사용할 수 있습니다. 미디어 기업이 기존 콘텐츠 라이브러리를 스트리밍과 트랜스코딩, 게이밍, 크리에이터 워크플로우에 맞게 개선하도록 돕습니다.

NVIDIA LipSyncActive Speaker Detection NIM 마이크로서비스는 인터뷰와 뉴스, 스포츠, 엔터테인먼트 등 여러 사람이 화면에 등장할 수 있는 프로그램을 위한 현지화 시스템을 개발자가 구축하도록 돕습니다.

LipSync는 입력 영상의 입 모양을 목표 오디오 트랙에 맞게 변환하면서 자연스러운 머리 자세와 눈 깜박임, 몸동작을 그대로 유지하는데요, 이번 릴리스는 얼굴 가림 처리를 개선하고 치아와 입술, 얼굴 질감을 더 잘 보존합니다.

새로운 Active Speaker Detection NIM 마이크로서비스는 여러 오디오 트랙에 대해 더 이상 화자 분할(speaker diarization)을 요구하지 않으며, 음성 활동 감지 기능을 추가하고 gRPC 인터페이스와 더 폭넓은 GPU 호환성으로 배포 지원 범위를 넓혔습니다.

NDI는 NVIDIA LipSync NIM 마이크로서비스를 포함한 NVIDIA AI for Media를 활용해, 기존 방송 워크플로우 안에서 실시간 번역과 립싱크 더빙, 지역 언어 적응을 구현하고 있습니다. 하나의 미디어 스트림에서 여러 언어 경험을 만들어내는 이 방식은 방송사가 전 세계 시청자에게 다가가면서도, 다국어 배포에 통상 필요했던 대역폭과 인프라, 제작 복잡성을 줄이도록 돕습니다.

Studio Voice에는 NVIDIA Studio Voice NIM 마이크로서비스를 기반으로 한 새로운 마이크 프로파일이 추가돼, 사용자가 향상된 음성의 음색을 더 세밀하게 조절할 수 있습니다.

이 기능은 배경 소음을 억제하고 실내 잔향을 줄여 음성 명료도를 높인 뒤, 향상된 출력을 선택한 마이크 프로파일에 맞게 다듬습니다. 라이브 커뮤니케이션과 스트리밍, 팟캐스팅, 콘텐츠 제작을 한층 완성도 있게 만들어 줍니다.

NVIDIA AI for Media NIM 마이크로서비스를 직접 사용해 보세요. NVIDIA와 파트너사의 최신 워크플로우는 IBC 2026에서 확인할 수 있습니다.


NVIDIA Holoscan for Media, 라이브 미디어 애플리케이션을 구축하고 연결하는 개방형 미디어 교환 계층 제공 🔗

NVIDIA Holoscan for Media

방송사와 스트리밍 서비스, 스포츠 조직이 소프트웨어와 AI를 도입하면서, 라이브 콘텐츠를 뒷받침하는 인프라는 더 유연하고 더 촘촘히 연결되며 공유 가속 컴퓨팅 위에 구축되는 방향으로 나아가고 있습니다.

Media Exchange Layer(MXL)와 NVIDIA Holoscan for Media의 통합은 이 전환을 앞당기고 있는데요, 미디어 애플리케이션들이 서로 연결되고 함께 작동하도록 돕는 공통 교환 계층을 제공하기 때문입니다.

Holoscan for Media는 소프트웨어 정의 라이브 프로덕션을 위한 AI 기반 미디어 기능과 애플리케이션을 구축하는 개방형 레퍼런스 아키텍처이자 개발자 툴킷입니다. 여기에 MXL은 소프트웨어 기반 미디어 기능들이 분산 환경 전반에서 라이브 영상과 오디오, 데이터를 주고받는 개방형 방식을 더합니다.

프로덕션 기능이 소프트웨어로 옮겨가면서 개발자는 가속 인프라를 공유하고, 동적으로 연결되며, 각자 독립적으로 발전하는 애플리케이션을 만들 수 있습니다. 이를 통해 미디어 기업은 인프라를 더 효율적으로 활용하고, 새로운 기능을 더 빠르게 도입하며, 애플리케이션 간에 필요한 맞춤 통합 작업을 줄일 수 있습니다.

이번 통합은 라이브 미디어에서 AI를 위한 더 탄탄한 토대도 만들어냅니다. AI 처리와 영상 애플리케이션, 기존 미디어 기능이 점점 더 동일한 가속 인프라와 동일한 소프트웨어 정의 환경에서 함께 작동할 수 있게 됩니다.

기술 공급사에게는 더 넓은 멀티 벤더 생태계 전반에서 작동하는 애플리케이션을 만들 기회가 열립니다. 미디어 기업에게는 포맷과 애플리케이션, AI 역량이 달라져도 함께 적응할 수 있는 인프라로 가는 길이 열립니다.

IBC의 EBU 부스 10.D21에서 데모를 확인해 보세요. Holoscan for Media에 대해 자세히 알아보세요.


NVIDIA Sports Intelligence Playbooks, 스포츠용 멀티모달 AI로 가는 길을 제시하다 🔗

NVIDIA Sports Intelligence Playbooks

스포츠는 AI의 더 큰 흐름을 가늠하는 시험대가 되고 있습니다. 범용 모델에서, 자체 데이터로 파인 튜닝한 개방형 모델로 옮겨 가는 흐름입니다.

NVIDIA Sports Intelligence Playbooks는 이 전환을 앞당기기 위해 만들어졌습니다. 리그와 미디어 기업, 기술 공급사가 자사 스포츠 영상과 주석 데이터로 NVIDIA 개방형 모델을 파인 튜닝할 수 있는 체계적인 프레임워크를 제공해, 특정 종목 고유의 규칙과 선수, 득점, 전략, 맥락을 이해하는 멀티모달 AI를 만들 수 있게 합니다.

스포츠 조직은 경쟁사가 따라 하기 어려운 방대한 자체 영상과 메타데이터, 경기력 정보를 보유하고 있습니다. 플레이북은 이러한 자산을 새로운 분석 제품과 미디어 경험, 자동화 도구, 수익원의 토대가 될 AI 역량으로 바꾸는 실질적인 청사진을 제시합니다.

또한 플레이북은 데이터 준비와 파인 튜닝, 추론, 평가, 최적화, 배포에 이르는 AI 라이프사이클 전반을 아우르며 NemotronNeMo AutoModel, Megatron Bridge, NIM 마이크로서비스, NVIDIA 가속 컴퓨팅 같은 기술을 한데 모읍니다.

모델 맞춤화에서 프로덕션까지 통합된 경로를 제공함으로써, Sports Intelligence Playbooks는 특화된 스포츠 AI를 구축하는 비용과 복잡성을 낮추는 동시에 컴퓨팅과 소프트웨어, 추론 스택 전반의 수요를 끌어올릴 수 있습니다.

초기 테스트는 도메인 특화의 잠재력을 보여주는데요, 학습에 쓰인 것과 유사한 질문 형식으로 이전에 보지 못한 영상을 평가한 결과, 객관식 정확도는 약 53%에서 94%로, 주관식 평가는 약 5.7%에서 66%로 올랐습니다.

Machina Sports는 자사의 스포츠 특화 데이터·평가·에이전트 인프라에 Sports Intelligence Playbooks를 통합하고 있습니다. 이를 통해 중계권 보유자가 자체 미디어와 전문성을 라이브 프로덕션과 콘텐츠, 팬 경험에 쓸 수 있는 비공개 배포형 인텔리전스로 바꿀 수 있게 됩니다.

에이전틱 AI 도입이 늘면서 기회는 더 커지고 있는 가운데, NVIDIA AI-Q 블루프린트를 활용하면 조직은 도메인 특화 스포츠 모델을 영상과 기업 데이터, 소프트웨어 시스템을 넘나들며 추론하는 에이전트 안의 전문 지능으로 활용할 수 있습니다. 플레이북이 스포츠 이해를 넘어 의사결정과 자동화로까지 확장되는 것이죠.

Wowza는 NVIDIA Cosmos 3와 Nemotron을 비롯한 비전 언어 모델을 Wowza Video Intelligence Framework에 통합하고 있습니다. NVIDIA Sports Intelligence Playbooks로 파인 튜닝해 라이브 스트림에서 스포츠의 결정적 장면을 감지해 대응 시간을 줄이기 위해서입니다.

NVIDIA Sports Intelligence Playbooks를 살펴보세요.


NVIDIA, 라이브 방송에 다국어 콘텐츠 현지화를 도입하다 🔗

라이브 프로그램으로 전 세계 시청자에게 다가가려면 단어를 옮기는 것만으로는 부족합니다. 언어의 뉘앙스와 목소리, 타이밍, 얼굴 움직임, 자막, 화면 그래픽이 실시간으로 맞물려야 하며, 그러면서도 원본 프로그램의 편집 의도와 제작 품질을 지켜야 합니다.

NVIDIA는 방송사와 스포츠 리그, 중계권 보유자, 스트리밍 서비스가 이 요소들을 하나의 소프트웨어 정의 실시간 현지화 워크플로우로 묶을 수 있도록, 자사 콘텐츠 현지화 기술을 NVIDIA Holoscan for Media 개발자 툴킷에 도입합니다. 방송·스트리밍 개발자를 위해 설계된 이 레퍼런스 워크플로우는 자막과 번역 오디오, 더빙, 동기화된 영상, 현지화된 그래픽을 구현합니다.

Holoscan for Media 기반 콘텐츠 현지화는 현지화 기술들이 소프트웨어 정의 방송 애플리케이션 안에서 어떻게 함께 작동할 수 있는지에 대한 레퍼런스를 제시합니다. 개발자는 현지화 버전마다 별도의 인프라를 구축하는 대신, 프로그램과 시장, 배포 채널별로 필요한 기능만 골라 쓸 수 있습니다.

Holoscan for Media 기반 콘텐츠 현지화에는 NVIDIA AI for Media의 최신 성과가 반영돼 있습니다. 얼굴이 부분적으로 가려졌을 때의 LipSync 개선, 여러 사람이 등장하는 장면에서 누가 말하고 있는지 애플리케이션이 파악하도록 돕는 Active Speaker Detection 강화가 여기에 포함됩니다.

라이브 프로그램의 도달 범위를 넓히다

현지화는 라이브 프로그램의 도달 범위와 경제성을 바꿔놓을 수 있습니다. 공유 가능하고 조합할 수 있는 워크플로우는 미디어 기업이 지역별 중계를 더 빠르게 선보이고, 더 많은 시청자에게 다가가며, 개별 시장에 맞게 경험을 맞춤화하도록 돕습니다. 라이브 제작에 필요한 타이밍과 시각적 맥락, 편집권은 그대로 지키면서 말이죠.

AI-Media와 CAMB.AI, Chyron, Panjaya의 기술은 Holoscan for Media 기반 콘텐츠 현지화의 각 영역을 나눠 맡습니다. 목소리와 화면 속 전달 방식을 조정하는 일부터 다국어 자막과 번역 오디오 제작, 그래픽 현지화, 라이브와 주문형 콘텐츠 전반에서 표정과 정체성을 보존하는 일까지 아우릅니다.

콘텐츠 현지화 기술은 파일 기반과 스트리밍, 포스트 프로덕션 애플리케이션도 지원합니다. 개발자는 주문형 워크플로우에는 애플리케이션 프로그래밍 인터페이스(API)를, 현지화가 라이브 미디어 환경의 일부로 동작해야 할 때는 Holoscan for Media 레퍼런스 워크플로우를 사용할 수 있습니다. 두 가지를 함께 쓰면 제작부터 배포까지 다국어 미디어 서비스를 구축하는 일관된 토대가 마련됩니다.

NVIDIA Holoscan for MediaAI for Media에 대해 자세히 알아보세요.