# NVIDIA는 방송용 “AI for Media”를 대폭 확장, 1대의 카메라로 3D 동작 추정 및 AI 기반 슬로우 영상/SDR→HDR 변환 기능 추가

> https://bookfactory.kr/board/news/17873
> 게시판: 뉴스
> 작성자: tachikoma43
> 작성일: 2026-09-20T05:07:34.909Z

---

이미지 출처: NVIDIA “AI for Media” 공식 페이지

NVIDIA는 2026년 9월 9일(현지 시간), 방송 및 스포츠, 영상 제작 분야를 위한 AI 툴 모음 “NVIDIA AI for Media”를 대폭 확장했다고 발표했다. 하나의 카메라 영상으로부터 인간의 움직임을 3D로 추정하는 “3D Body Pose”와, 생성 AI로 영상의 중간 프레임을 생성하는 “Video Frame Generation (VFG)” 등을 추가하고 강화한다. 네덜란드 암스테르담에서 9월 11일 ~ 14일에 개최된 방송 및 미디어 산업 행사 “IBC 2026”에 맞춰 발표했다.

NVIDIA AI for Media는 GPU에서 고속화된 SDK, “NVIDIA NIM” 마이크로 서비스, 개발자용 툴, Blueprint 등을 포함한 미디어 및 엔터테인먼트 분야를 위한 AI 툴 모음이다. 영상, 음성, AR(확장현실) 처리 및 단일 카메라로 촬영한 영상으로부터 인간의 2D/3D 관절 위치 및 각도를 추정하는 기술을 포함하며, 라이브 스트리밍, 방송, 영상 제작 등에서의 실시간 활용을 염두에 두고 있다.

## 1대의 카메라로 선수들의 움직임을 3D 데이터화

이번에 강화된 “3D Body Pose”는 1대의 카메라로 촬영한 영상으로부터 인간의 2D/3D 관절 위치 및 각도를 추정한다. 신체에 마커를 착용하는 모션 캡처 장비 없이, 인간의 움직임을 구조화된 데이터로서 획득할 수 있다.

스포츠 분야에서는 선수들의 동작 추적, 바이오메카니즘 분석, 성과 분석, 경기 재생 영상 강화, 판정 지원, 선수 안전 관련 용도 등을 염두에 두고 있다. 영상 제작에서는 획득한 관절 및 동작 데이터를 캐릭터의 Rig에 할당하여 애니메이션, 디지털 휴먼, 가상 현실 등에 활용할 수 있다.

■ NVIDIA가 공개한 “3D Body Pose” 데모. 영상에서 인물의 자세를 추정하고 있다

이미지 출처: NVIDIA AI 공식 X

방송용 그래픽스 등을 담당하는 Vizrt는 이 기술을 라이브의 가상 스튜디오 환경에서 활용한다. 인물의 신체 움직임을 추적하여 3D 공간 내의 반사, 그림자, 환경 렌더링 등을 실시간으로 변화시키고 있다는 것이다.

## AI로 중간 프레임을 생성, 스포츠의 느린 영상에도

“Video Frame Generation (VFG)”는 원본 영상 프레임 사이에 생성 AI로 새로운 프레임을 만들어 영상을 부드럽게 하는 기술이다. 프레임 레이트를 2배 또는 4배로 높이면서 영상 품질과 시간 방향의 일관성을 유지한다고 한다.

예시로 60fps의 영상을 120fps로 변환할 수 있으며, 움직임이 격렬한 스포츠 영상이나 슬로우 모션 리플레이 등에서의 이용을 염두에 둔다. 방송 장비 제조사 Ross Video는 스포츠용 리플레이 시스템 “Rio Replay”에 VFG를 통합하여 6배의 슬로우 모션 생성에 대응하고, 8배의 보간에 대해서도 개발을 진행하고 있다.

이 외에도, 영상을 AI로 고해상도화하는 “Video Super Resolution (VSR)”도 강화했다. 노이즈, 보케, 압축으로 인한 저하를 억제하면서 업스케일하고, 새로이 10bit 영상에도 대응한다. 실시간 성능을 우선할지, 혹은 더 높은 화질을 우선할지 선택할 수 있는 스트리밍 모드도 추가했다.

더욱이 “TrueHDR”은 SDR(표준 다이나믹 레인지) 영상을 실시간으로 HDR로 변환합니다. NVIDIA에 따르면, 최대 약 2000니트까지의 밝기에 대응합니다. VSR, VFG, TrueHDR는 하나의 영상 처리 파이프라인 내에서 통합하여 사용할 수 있습니다.

또한, 브이컬 래핑 영상의 입모음 보정 및 “누가 말하고 있는지”의 감지 또한 강화되었다. “LipSync”는 다른 오디오 트랙에 맞춰 영상 내 인물의 입모음을 변경하는 기능으로, 이번 업데이트에서는 마이크나 손 등으로 얼굴 일부가 가려진 경우의 처리를 개선하여, 치아, 립, 얼굴 질감을 더 유지할 수 있도록 했다.

영상 내에서 누가 말하고 있는지 식별하는 “Active Speaker Detection (ASD)”에서는 새로운 NIM 마이크로 서비스를 제공합니다. 여러 개의 오디오 트랙을 다룰 때 화자 지정을 불필요하게 하고, 오디오 활동 감지 및 gRPC 인터페이스 등에도 대응합니다.

영상 전송 기술을 담당하는 NDI는 LipSync 등을 사용하여 기존의 방송 워크플로우 내에서 실시간 번역 및 입술 움직임이 동기화된 자막, 지역별 언어 지원 등을 제공한다고 합니다.

■ NVIDIA “LipSync” 데모. 음성에 맞춰 영상 내 인물의 입술 움직임을 조정합니다.

이미지 출처: NVIDIA AI 공식 X

오디오 처리 기능 “Studio Voice”에는 “Microphone Profiles”를 추가했습니다. 배경 노이즈 및 실내 잔향을 억제하여 음성을 명료하게 만든 후, 선택한 마이크의 특성에 맞게 음질을 조정할 수 있습니다.

한편, AI 생성 영상을 감지하는 “Synthetic Video Detector (SVD)”는 이번에 처음 등장한 기능은 아니며, 2026년 SIGGRAPH에서 발표된 기술입니다. 이번 업데이트에서는 모델을 강화하여 NVIDIA에 따르면 텍스트에서 생성한 영상에서 99.3%, 이미지에서 생성한 영상에서 97.7%의 정확도를 달성했다고 합니다. 뉴스 영상의 진위성 확인이나 콘텐츠 심사 등에서의 활용을 염두에 두고 있습니다.

■ NVIDIA의 “Synthetic Video Detector” 데모 화면

이미지 출처: NVIDIA AI 공식 X

또한, NVIDIA의 제품 페이지에서는 LipSync 및 SVD와 같은 일부 기능은 제한 제공되어 있으며, 기능별로 제공 조건이 다름.

관련 기사: NHK 기술연구소, 영상의 기연 정보를 통해 “AI 가짜” 방제 – 촬영, 편집, 배포 기록을 C2PA로 검증. NHK 기술연구소 측은 영상 콘텐츠의 진위 여부를 확인하기 위해, 영상의 기연 정보, 즉 영상 제작의 흐름과 관련된 정보를 활용하고 있다고 밝혔습니다. 특히, 촬영, 편집, 배포 기록을 C2PA 표준으로 검증하여 “AI 가짜” 영상의 유통을 방지하는 방안을 모색하고 있습니다. C2PA는 콘텐츠 식별 및 추적을 위한 국제 표준으로, 영상 콘텐츠의 제작 과정을 투명하게 관리하고 위변조를 방지하는 데 기여합니다. NHK 기술연구소는 이러한 기술을 활용하여 영상 산업 전반에 걸쳐 디지털 콘텐츠의 신뢰도를 높이는 데 기여할 것으로 기대됩니다.  현재 NHK는 이 기술을 활용하여 다양한 영상 콘텐츠의 진위 여부를 검증하고 있으며, 관련 기술 개발 및 상용화를 위한 노력을 지속하고 있습니다.  더 자세한 내용은 다음 URL에서 확인하실 수 있습니다: [URL]

관련 기사: 일본 테레 자사 개발의 온디바이스 AI “viztrick AiDi”, NBC Sports에서 라이브 중계에 채택 결정

관련 기사: 구글이 겨울 동계 올림픽 대표팀을 AI로 지원합니다 – 촬영한 영상을 몇 분 만에 3D 분석하는 스키-스노보드용 분석 도구를 구축했습니다.

관련 기사: TBS, Google Cloud의 영상 생성 AI “Veo” 활용을 본격화 – 지상파 프로그램에서의 이용을 구체적으로 검토

관련 기사: 원본 화자의 감정 및 톤을 재현하는 AI 더빙 모델 “Dubbing v2” 제공 시작 – 음성 AI 기업 ElevenLabs가 90 이상의 언어에 대응

[원문 보기](https://ledge.ai/articles/nvidia_ai_for_media_ibc2026) | 출처: Ledge.ai