NVIDIA, IFA 2026서 로컬 AI 가속하는 신기술·생태계 공개

NVIDIA는 다양한 AI 에이전트 지원과 ‘NVIDIA PAIR’를 통해 로컬 AI 활용을 간소화하는 한편, 10월 출시 예정인 RTX Spark를 중심으로 파트너 및 게임 생태계를 확대하고 있습니다.
by

프론티어 인텔리전스가 로컬 환경으로 확장되는 가운데, NVIDIA는 Microsoft를 비롯한 파트너사와 함께 NVIDIA 하드웨어에서 에이전트를 보다 쉽게 설정하고 로컬에서 실행할 수 있도록 빠른 추론 성능과 새로운 도구를 제공하기 위해 협력하고 있습니다. 한편 새로운 소형 Windows PC인 NVIDIA RTX Spark가 오는 10월 출시될 예정인데요. RTX Spark를 통해 AI 애호가와 개발자, 크리에이터는 강력한 에이전트를 로컬 환경에서 안전하게 실행할 수 있습니다.

IFA 2026에서 NVIDIA가 발표한 사항은 다음과 같습니다:

  • NVIDIA GPU를 위한 간소화된 로컬 AI 지원이 Hermes Agent, OpenClaw, Perplexity Portable Computer에서 제공됩니다.
  • 최대9배 빠른 로컬 추론으로 신규 llama.cpp와 vLLM 최적화를 직접 이용하거나 LM Studio와 Ollama를 통해 활용할 수 있습니다.
  • NVIDIA PAIR가 새롭게 공개됐습니다. 이는 사용자 로컬 네트워크에 있는 PC 전반에 AI 추론을 지능적으로 분산하는 Personal AI Router 도구입니다.
  • NVIDIA RTX Spark가 Lenovo, Acer의 윈도우 PC 신제품과 함께 오는 10월 출시됩니다. Electronic Arts, Embark, Ubisoft를 비롯한 게임 개발사와 배급사는 NVIDIA RTX Spark에서 최신 블록버스터 타이틀을 선보일 예정입니다.

지난 8월 소개된 로컬 AI 분야 주요 소식은 다음과 같습니다.

  • Nemotron 3.5 Lightning은 NVIDIA RTX PC, RTX PRO Workstation, DGX Spark, Jetson에서 실행할 수 있는 300억 파라미터 모델로, 현재 사용 가능합니다.
  • aiGLM-5.3-Flash는 에이전틱 AI를 DGX Station으로 확장하는 멀티모달 전문가 혼합(MoE) 모델입니다.
  • Qwen8-Flash-Next를 공개했습니다. 이는 오픈 웨이트 기반의 멀티모달 MoE 모델로, DGX Spark와 DGX Station에서 로컬로 실행할 수 있습니다. 이와 함께 NVIDIA GPU에서 로컬 에이전틱, 코딩 워크로드에 최적화된 270억 파라미터 오픈 모델 Qwen3.8-27B도 공개됐습니다.
  • LTX의 LTX 2.5는 NVIDIA RTX GPU, DGX Spark, DGX Station에 최적화된 오픈 월드 비디오 생성 모델입니다. 더 빠르고 메모리 효율적인 로컬 생성을 위해 신규 NVFP4, FastVideo, ComfyUI 향상 기능을 제공합니다.
  • MiniMax-H3는 동기화된 오디오를 지원하는 오픈 웨이트 비디오 생성 모델로, ComfyUI를 통해 NVIDIA GPU에서 로컬로 실행할 수 있습니다. FastVideo는 NVIDIA 연구진과 협력해 성능을 한층 개선한 오픈 웨이트 기반 4단계 증류 버전인 FastH3를 공개했습니다. 이를 통해 최대 7배의 성능 향상을 제공하며, NVIDIA RTX GPU와 DGX Spark에 최적화된 FastVideo 레시피도 곧 제공될 예정입니다.
  • Meta의 Muse Glimmer는 코딩, 에이전틱 워크로드를 위한 300억 파라미터 오픈 웨이트 모델로, GeForce RTX PC, DGX Spark, DGX Station, Jetson에서 로컬로 실행할 수 있습니다. NVIDIA는 보다 메모리 효율적인 로컬 배포를 위해 DGX Spark를 지원하는 NVFP4 양자화도 공개했습니다.
  • DeepSeek v4 Flash는 활성 파라미터 130억 개를 포함하는 2,840억 파라미터 MoE 모델로, 2개의 DGX Spark 클러스터와 DGX Station에서 로컬로 실행할 수 있습니다.

 

간편히 시작하는 로컬 에이전트

로컬 모델로 로컬 에이전트를 실행하려면 일정 수준의 작업이 필요했습니다. 모델을 선택하고, 호환되는 추론 서버를 찾으며, 양자화 설정을 조정하고, 모든 구성 요소를 최신 상태로 유지해야 했죠. 이러한 과정은 RTX와 DGX 시스템에서 한층 간소화되고 있습니다.

가장 널리 사용되는 에이전트 앱 3종이 Windows에서 간소화된 로컬 모델 설정을 제공할 예정입니다. 각 앱은 llama.cpp를 기반으로 구축됐으며, NVIDIA의 최신 추론 최적화를 활용합니다. 새로운 설정 환경은 수동 구성을 줄이고 로컬 에이전트를 보다 쉽게 설정하고 실행할 수 있도록 설계됐습니다.

지난달 Perplexity는 Portable Computer agent를 공개했습니다. 사용자는 모델, 오케스트레이션, 도구가 하나의 앱 환경에 통합된 Perplexity를 NVIDIA DGX Spark와 같은 Linux 시스템에서 로컬로 간편하게 실행할 수 있습니다.

Perplexity Portable Computer는 Linux를 실행하는 최소 24GB VRAM NVIDIA RTX GPU에서 이용할 수 있으며, Windows 지원은 추후 제공될 예정입니다. 폭넓은 PC 사용자에게 간소화된 설정 환경을 제공하는 한편, 사용자는 크레딧을 사용하지 않고 전체 워크플로우를 로컬에서 실행할 수 있는데요. 추가적인 조사나 추론이 필요한 경우에는 작업의 일부를 클라우드의 15개 이상 프론티어 모델을 선택해 확장할 수 있습니다. Portable Computer는 콘텐츠를 클라우드로 전송하기 전에 사용자 권한을 요청하며, 사용자가 민감한 정보를 기기에 보관할 수 있도록 합니다.

다음은 Portable Computer의 일부 활용 사례입니다:

  • 엔지니어링: 연결된 GitHub 리포지토리의 공개 PR을 검토하고 준비 완료, 차단됨, 오래됨, 검토 필요로 분류하며 각각 다음 단계를 태그합니다. 최신 병합 내용과 동기화되지 않은 문서를 찾아 수정하고, 변경 사항에 대한 PR을 생성합니다.
  • 금융: 2년간의 증권사 거래 요약 자료, 통합 1099 양식, 세금 신고서를 에이전트에 제공하고, 가장 피할 수 있는 수수료와 세금 부담을 발생시키는 반복 보유 자산을 추적할 수 있습니다. 모든 수치는 정확한 파일과 페이지를 인용하며, 문서가 챗봇으로 전송되지 않은 상태에서 작업이 이뤄집니다.
  • 스타트업: 활성화가 정체된 이유를 질문하면 에이전트가 퍼널 데이터를 로컬에서 분석합니다. 설치와 최초 완료 작업 사이에서 신규 가입자가 이탈하는 지점을 파악한 뒤, 주요 인사이트를 조직의 Slack 채널에 게시합니다.

Portable Computer는 지금 이용할 수 있습니다.

Nous Research가 개발한 Hermes Agent는 수백만 명이 사용하는 범용 에이전트로, 높은 신뢰성과 자기 개선 능력이 강점입니다. 모델과 제공업체에 구애받지 않는 Hermes는 로컬 시스템에서 하루 종일 실행될 수 있으며, RTX PC, RTX PRO workstation, DGX Spark에서 활용할 수 있습니다.

Hermes에서 로컬 모델을 구성하면 Windows 환경의 RTX, DGX 시스템에서 원클릭 설정이 제공될 예정입니다. 에이전트는 NVIDIA GPU를 자동으로 감지하고 적절한 모델과 구성을 선택한 뒤, NVIDIA 추론 최적화가 적용된 통합 llama.cpp를 통해 실행합니다. 따라서 사용자는 모델을 직접 다운로드하거나 별도로 튜닝할 필요가 없어집니다. Linux 지원은 추후 제공될 예정입니다.

실행이 시작되면 Hermes는 다른 환경과 동일한 방식으로 작동합니다. 다양한 도구를 활용하고 작업 간 맥락을 유지하며, 세션 정보를 기억하고 시간이 지남에 따라 재사용 가능한 스킬을 생성하죠. 에이전트를 지속적으로 사용할수록 에이전트의 기능과 활용 범위가 더욱 확장됩니다. 모델을 GPU에서 로컬로 실행하면 빠른 성능을 유지하면서도 데이터를 시스템 내부에 보관할 수 있습니다.

원클릭 로컬 모델 설정 기능은 현재 Windows에서 사용 가능하며, 향후 Linux에서도 제공될 예정입니다. 여기에서 Hermes Agent에 대해 자세히 알아볼 수 있습니다.

OpenClaw는 대표적인 오픈 에이전트 프로젝트로 자리 잡았습니다. GitHub에서 38만 개 이상의 스타를 받은 최대 규모의 AI 프로젝트이며, 연구와 엔지니어링, 프로젝트 관리, 일상 업무 등 다양한 분야에서 도구와 스킬을 구축하는 커뮤니티도 빠르게 성장하고 있죠.

NVIDIA와 Microsoft, OpenClaw는 Windows PC에서 구축을 간소화하도록 협력해 왔습니다. OpenClaw Windows 앱은 최소 24GB VRAM을 갖춘 모든 RTX GPU에서 최적화된 로컬 모델 구축 과정을 간소화하며, 초기 설정의 불편을 줄입니다.

OpenClaw 블로그에서 자세히 알아볼 수 있습니다.

 

더 빠른 추론으로 로컬 에이전트 성능 향상

로컬 에이전트의 반응성을 유지하기 위해서는 추론 성능이 중요합니다. NVIDIA는 오픈소스 llama.cpp, vLLM 커뮤니티와 지속적으로 협력하며 로컬 NVIDIA 플랫폼 전반에서 에이전틱 워크로드를 가속하고 있습니다.

llama.cpp는 GeForce RTX 5090에서 커널 최적화와 향상된 추측 디코딩 기법, 더 빠른 프리필을 통해 최대 1.9배 높은 처리량을 제공합니다.

vLLM은 RTX PRO 6000 Blackwell Workstation Edition에서 1.2배, 2개의 DGX Spark 클러스터에서 최대 1.4배의 성능을 제공합니다. FlashInfer의 새로운 XQA 어텐션 커널과 백엔드 최적화는 두 플랫폼 전반에서 추론을 가속합니다.

이러한 성능 향상은 llama.cpp, vLLM 추론 백엔드를 통해 확인할 수 있습니다.

사용자는 또한 LM Studio와 Ollama 애플리케이션에서도 경험해볼 수 있습니다.

 

NVIDIA PAIR, 로컬 AI 컴퓨팅에 유휴 PC 자원 활용

미국 가정의 절반 이상은 PC를 두 대 이상 보유하고 있습니다. 그러나 상당한 컴퓨팅 성능이 하루 중 대부분 사용되지 않는 상태로 남아 있죠. NVIDIA Personal AI Router ‘PAIR’는 유휴 PC 컴퓨팅 자원을 로컬 AI에 활용할 수 있도록 지원하는 무료 오픈소스 소프트웨어 도구입니다.

많은 경우 에이전틱 워크플로우는 복잡한 작업을 병렬로 실행 가능한 작은 작업으로 분할합니다. 그러나 모든 요청이 동일한 GPU를 활용한다면 성능이 저하될 수 있는데요. PAIR는 로컬 네트워크에서 호환되는 PC를 자동으로 검색하고, 여유 용량이 있는 시스템으로 개별적인 추론 요청을 전달합니다. 이는 Ollama와 LM Studio에서 활용 가능하며, 기기가 네트워크에 연결되거나 연결 해제되는 상황에도 대응할 수 있습니다.

예를 들어 사용자는 Hermes에 복잡한 메일함을 정리하고 주의가 필요한 항목과 미룰 수 있는 항목, 건너뛸 수 있는 항목의 우선순위를 정하도록 요청할 수 있습니다. Hermes는 이러한 작업을 여러 하위 에이전트로 나눌 수 있으며, PAIR는 모든 작업을 하나의 GPU를 거치게 하는 대신 사용 가능한 여러 PC에 작업을 분산합니다.

그 결과 로컬 에이전트는 더 많은 컴퓨팅 성능을 활용할 수 있으며, 더 많은 작업을 병렬로 실행할 수 있습니다. 또한 메인 시스템이 게이밍이나 콘텐츠 제작, 기타 작업에 사용되는 동안 AI 워크로드를 다른 PC로 옮길 수도 있죠.

NVIDIA PAIR 베타는 그래픽, 터미널 인터페이스를 통해 Windows, macOS, Linux에서 이용할 수 있습니다. NVIDIA GeForce RTX 20 시리즈 GPU와 이후 제품군, Turing 또는 이후 아키텍처를 탑재한 NVIDIA RTX PRO workstation GPU, NVIDIA DGX Spark, Apple M4와 이후 제품이 지원됩니다.

NVIDIA 기술 블로그에서 NVIDIA PAIR 활용 방법을 확인할 수 있습니다.

 

PhotoDirector AI PC 모드, RTX Spark에서 지원… 강력한 온디바이스 사진 편집 성능 제공

아티스트는 오픈 이미지, 비디오 모델을 통해 PC에서 창작 AI 모델을 실험할 수 있습니다. 이를 통해 콘셉트와 아이디어를 토큰 부담 없이 반복적으로 실험하고 탐색할 수 있으며, 더 많은 창작 작업을 비공개 상태로 기기 내에서 이어갈 수 있죠.

CyberLink의 새로운 PhotoDirector AI PC 모드는 디퓨전 모델을 창작 소프트웨어에 통합해, 이를 아티스트가 손쉽게 활용할 수 있는 창작 도구로 구현한 최초 사례 가운데 하나입니다. 출시와 함께 NVIDIA RTX Spark에 최적화되며, PhotoDirector 365에서 제공될 예정입니다. AI PC 모드 사용자는 생성형 편집과 이미지 향상, 객체와 방해 요소 제거, 배경 제거와 교체, 인물 보정 등 AI 기반 편집 도구를 활용할 수 있습니다. 이를 통해 완전히 새로운 비주얼을 제작할 수 있으며, 작업에 따라 로컬 또는 클라우드 처리를 선택할 수 있습니다.

PhotoDirector는 NVIDIA GPU에서 TensorRT-RTX와 FP8을 활용해 로컬 AI를 가속합니다.

여기에서 CyberLink PhotoDirector 365 사진 편집 소프트웨어와 10월 RTX Spark와 함께 출시되는 PhotoDirector AI PC 모드에 대해 자세히 알아볼 수 있습니다.

 

NVIDIA RTX Spark Windows PC, 올해 10월 출시

NVIDIA RTX Spark는 오는 10월 출시 예정이며, 파트너사들은 이번 IFA에서 신규 하드웨어를 선보이고 있습니다. IFA에서 공개된 신제품 디자인은 10월 출시를 앞둔 기존 6개 OEM 제품군에 추가됩니다. Acer는 소형 데스크톱 RTX Spark 콘셉트를 공개했으며, Lenovo는 Yoga Pro 9n과 Yoga 9n 2-in-1을 발표했습니다.

크리에이터와 게이머, AI 에이전트를 위해 만들어진 RTX Spark는 Windows PC의 새로운 시대를 의미합니다. 강력한 1페타플롭 RTX Blackwell GPU와 최대 128GB의 통합 메모리, 고효율 20코어 Grace CPU를 탑재한 RTX Spark는 뛰어난 성능과 효율성을 제공하는데요. RTX Spark 슈퍼칩은 하루 종일 사용할 수 있는 배터리 수명의 고성능 슬림 노트북부터 상시 실행되는 에이전트를 구동하는 소형 데스크톱까지 다양한 시스템을 지원합니다. 새로운 Windows Agent 프레임워크와 결합하면 운영체제 수준의 제어 하에 에이전트를 안전하게 백그라운드에서 실행할 수 있습니다.

지난주 Gamescom에서 Electronic Arts와 Embark, Ubisoft는 최신 블록버스터 타이틀을 NVIDIA RTX Spark Windows PC에 제공하는 게임 배급사와 개발사 대열에 합류했습니다. 이들은 지난 5월 COMPUTEX에서 RTX Spark 지원을 발표한 KRAFTON, NetEase, Riot Games, XBOX 등과 함께 RTX Spark 지원 생태계를 확대하고 있습니다. 여기에서 관련 소식을 자세히 알아볼 수 있습니다.

여기에서 RTX Spark 노트북과 데스크톱 출시 알림을 신청할 수 있습니다.

 

최신 NVIDIA 로컬 AI 소식

 NVIDIA, Gamescom에서 신규 RTX 기술과 게임 공개: NVIDIA는 새로운 2세대 트랜스포머 모델을 탑재한 DLSS 4.5 Ray Reconstruction을 공개했습니다. 이는 레이 트레이싱, 패스 트레이싱 게임의 이미지 품질을 향상하며, 이 밖에도 Gamescom에서는 ‘007 First Light’, ‘CONTROL Resonant’, ‘Gears of War: E-Day’를 비롯한 신규 RTX 발표가 이어졌습니다. 이와 함께 NVIDIA RTX 스파크 게임 지원 확대도 공개됐습니다.

  • DeepSeek 하네스 공개: DeepSeek의 새로운 오픈소스 하네스DeepSeek-V4-Flash와 결합해 NVIDIA DGX Station과 다중 DGX Spark 구성에서 로컬 에이전틱 코딩 워크플로우를 지원합니다.
  • MLPerf Client v2.0, AI PC 벤치마킹 확대: MLCommons는 NVIDIA를 비롯한 선도 기업과의 협업으로 MLPerf Client v2.0을 공개했습니다. 이번 업데이트는 실제 로컬 AI 워크로드를 위한 확장된 거대 언어 모델(LLM) 테스트와 함께 에이전틱 AI, 이미지 생성에 대한 새로운 벤치마크를 추가했습니다.

X, Instagram, TikTok, Facebook에서 NVIDIA RTX Spark를 팔로우하고 NVIDIA 로컬 AI 뉴스레터를 구독해 최신 소식을 받아볼 수 있습니다. 또한 LinkedInX에서 NVIDIA Workstation을 팔로우할 수 있습니다.

 여기에서 소프트웨어 제품 정보 약관을 확인할 수 있습니다.