영상 속 '가려진 궤적'으로 로봇을 가르친다…비디오 모델을 세계 모형으로 통합한 새 기법 공개

임형광 기자 · 입력 2026.07.22 16:33 · 수정 2026.08.03 12:18
로봇 움직임을 보여주면 결과를 예측하고, 원하는 결과를 보여주면 필요한 동작을 되짚는 '마스크드 비주얼 액션'…실제·시뮬레이션 15시간 학습만으로 단일 모델 구현
영상 속 '가려진 궤적'으로 로봇을 가르친다…비디오 모델을 세계 모형으로 통합한 새 기법 공개
스탠퍼드대 등 연구진이 영상 생성 모델을 로봇 '세계 모형'으로 활용한 실제 로봇 조작 실험 장면 (사진 출처=arXiv:2607.19343, CC BY 4.0)

영상을 생성하는 인공지능(AI) 모델은 사물이 어떻게 움직이고 부딪히며 반응하는지에 관한 방대한 상식을 데이터로부터 흡수한다. 이 '물리 감각'을 로봇 제어에 그대로 빌려 쓰려는 시도가 이어지는 가운데, 행동을 영상의 언어로 직접 전달하는 새로운 방식이 제안됐다.

하디 알자예르(Hadi Alzayer)를 비롯한 해외 연구진 11명은 지난 21일 사전공개 논문 저장소 arXiv에 '통합 세계 모형을 위한 마스크드 비주얼 액션(Masked Visual Actions for Unified World Modeling)'을 공개했다. 컴퓨터 비전(cs.CV)과 로보틱스(cs.RO) 분야로 분류된 이 논문은 새로운 로봇 제어 기법을 제시하는 방법론 연구다.

영상 모델에 '행동'을 어떻게 전달할 것인가

대량의 동영상으로 학습한 생성 모델은 접촉과 충돌, 물체의 반응 같은 현실 세계의 움직임에 대한 사전 지식을 풍부하게 담고 있다. 연구진은 이런 영상 모델을 로봇이 다음에 벌어질 일을 머릿속으로 그려 보는 '세계 모형'의 토대로 삼을 수 있다고 봤다. 세계 모형이란 로봇이 실제로 움직여 보기 전에, 어떤 행동을 하면 주변이 어떻게 바뀔지를 내부적으로 예측하는 모델을 말한다.

문제는 '행동'을 이런 영상 모델에 전달하는 방법이다. 기존에는 관절 각도나 좌표 같은 수치 명령을 별도 신호로 집어넣는 방식이 많았는데, 이는 모델이 영상으로부터 배운 시각적 상식과 언어가 어긋난다는 한계가 있었다. 연구진은 행동 역시 모델이 이해하는 '영상의 언어'로 표현하되, 실제 물리적 조작에 뿌리를 두게 하는 것이 관건이라고 진단했다.

궤적의 일부만 드러내는 '마스크드 비주얼 액션'

연구진이 내놓은 해법이 '마스크드 비주얼 액션(Masked Visual Actions)'이다. 행동을 영상 속 어떤 대상의 이동 경로(궤적) 가운데 일부만 드러내고 나머지는 가린 형태로 표현하는, 픽셀 공간의 제어 방식이다. 마스크(mask)는 영상의 일부를 가린다는 뜻으로, 무엇을 드러내고 무엇을 가리느냐에 따라 같은 모델이 정반대 방향의 두 작업을 모두 수행한다는 점이 핵심이다.

로봇의 움직임을 드러내 주면, 모델은 그 저수준 동작에 장면이 어떻게 반응할지를 예측하는 '순방향 동역학 모델'로 작동한다. 반대로 원하는 물체의 움직임을 드러내 주면, 같은 모델이 그런 결과를 만들어 내는 데 필요한 로봇의 동작을 거꾸로 찾아내는 '역방향' 추론을 한다. 결과 예측과 동작 역추론이라는 서로 다른 문제를, 입력의 어느 부분을 열어 두느냐만 바꿔 하나의 모델로 통합한 셈이다.

연구진은 실제 영상과 시뮬레이션에서 뽑은 마스킹 예시 15시간 분량만으로 모델을 미세조정(finetuning)했다고 밝혔다. 이렇게 얻은 단일 모델 하나가 다양한 장면과 여러 형태의 로봇(embodiment)에 걸쳐 높은 영상 품질과 제어 가능성을 보였다는 설명이다.

정책 평가·계획·역모델링으로 확장

논문은 이 모델이 실제 조작 과제에서 세 가지 쓰임새를 보였다고 제시한다. 첫째, 모델이 상상해 낸 시나리오(가상 실행 결과)가 실제 로봇의 수행 결과와 상관관계를 보여 '정책 평가'에 활용할 수 있었다. 로봇을 실제로 굴려 보지 않고도 그 행동 전략이 얼마나 쓸 만한지를 가늠하는 용도다. 둘째, 여러 후보 미래를 순위 매겨 비교함으로써 모델 기반 계획에서 의사결정의 질을 끌어올렸다. 셋째, 원하는 물체 움직임으로부터 그에 맞는 로봇 동작을 합성하는 역모델링(inverse modeling)을 지원했다.

이번 연구는 영상 생성 모델이 축적한 시각적·물리적 상식을 로봇 제어와 직접 잇는 접근으로, 별도의 대규모 로봇 데이터 없이도 예측과 계획, 역추론을 아우르는 통합 모델이 가능함을 시사한다. 다만 이 논문은 사전공개 단계의 자료로 아직 동료 심사를 거치지 않았으며, 제시된 결과는 저자들이 설정한 실험 조건에서의 관찰이라는 점은 감안할 필요가 있다.


참고 자료
· Masked Visual Actions for Unified World Modeling — Hadi Alzayer 외, arXiv (2026)

저작권자 © 한국R&D신문 — 무단 전재 및 재배포 금지
임형광 기자 hg.lim@k-rnd.net
반도체·일반공학 — 공정·소자·파운드리·메모리 및 기계·전기·토목
댓글 0 최신순 추천순

첫 댓글을 남겨보세요.

0 / 400 · 회원 로그인 시 닉네임으로 작성 · 비회원 수정은 작성 후 1분 이내