H-JEPA, 시뮬레이션 로봇 미로 성공률 18.0%에서 73.3%로

김동현 기자 · 입력 2026.10.12 05:27
시간 범위와 잠재공간을 계층별로 분리해 장기 목표와 세부 행동을 함께 계획
기사 대표 이미지
Ecole polytechnique from Paris

로봇이 눈앞의 장애물을 피하면서도 멀리 있는 목적지를 놓치지 않도록 하는 계층형 월드 모델이 시뮬레이션 미로의 경로 계획 성공률을 18.0%에서 73.3%로 끌어올렸다. 다만 이는 실제 로봇이 현장에서 거둔 성공률이 아니라, 고정된 카메라와 배경을 사용한 Visual AntMaze 환경의 결과다.

뉴욕대학교와 Advanced Machine Intelligence, INRIA Paris, 브라운대학교 소속 연구진은 2026년 10월 5일 사전논문 ‘H-JEPA: End-to-End Learning of Hierarchical World Models for Visual Planning’을 공개했다. 저자는 완충 장, 바질 테르베르, 마이클 래벗, 얀 르쿤, 랜들 발레스트리에로다. 논문은 현재 arXiv v1으로 공개된 단계이며, 동료평가를 거친 학술지나 학회 논문으로는 확인되지 않았다.

월드 모델은 인공지능 에이전트가 현재 관측과 행동을 바탕으로 환경이 어떻게 달라질지 예측하고 다음 행동을 계획하도록 돕는 기술이다. 이 연구가 사용한 JEPA는 미래 화면의 픽셀을 일일이 그려내는 대신, 관측에서 계획에 필요한 특징을 압축한 ‘잠재 표현’의 변화를 예측한다. 복잡한 영상을 그대로 만드는 부담을 덜고 위치나 움직임처럼 행동 결정에 중요한 상태에 집중하는 방식이다.

기존 단일 계층 모델은 가까운 미래의 세부 움직임과 먼 목표까지 하나의 잠재공간에서 처리했다. 빠르게 바뀌는 시각 정보와 천천히 변하는 위치 정보를 한 표현에 함께 담으면 장거리 예측과 목표 진행 정도를 판단하기 어려워질 수 있다. H-JEPA는 여러 개의 행동 조건부 JEPA를 계층으로 구성하고, 각 단계가 서로 다른 시간 범위와 별도의 잠재공간을 학습하도록 했다.

계획은 위에서 아래로 진행된다. 최상위 계층이 최종 목표를 향한 큰 방향을 찾고, 그 예측을 아래 계층의 중간 목표로 전달한다. 하위 계층은 이를 더 구체적인 행동으로 바꾼다. 상위 표현에서는 오래 예측하기 어려운 빠른 세부 변화가 줄고, 로봇의 위치처럼 천천히 변하면서 목표 달성에 중요한 정보가 남도록 설계됐다.

연구진은 학습 중 잠재 표현이 모두 비슷한 값으로 무너지는 현상을 막기 위해 SIGReg라는 정규화 항도 적용했다. 쉽게 말해 압축된 정보가 한 점에 몰리지 않고 여러 방향으로 고르게 분포하도록 붙잡아 주는 장치다. 절제 실험에서는 H-JEPA가 여러 예측 길이를 쓰면서도 같은 잠재공간을 공유하는 HWM보다 AntMaze에서 크게 앞섰다. 연구진은 시간 범위를 나누는 것뿐 아니라 계층마다 다른 추상적 표현을 학습한 점도 성능 향상에 기여한 것으로 해석했다.

Visual AntMaze에서 3계층 H-JEPA의 평균 성공률은 73.3%로, 단일 계층 LeWM의 18.0%보다 높았다. 표준오차는 모델과 플래너에 같은 시드 42·43·44를 적용한 세 쌍의 결과로 계산했다. 최종 평가는 환경마다 별도로 만든 시작점과 목표점 과제 50개를 사용했으며, 플래너 설정은 평균 100 TFLOP 이하의 계산 예산에서 미리 선정했다. 학습에는 AntMaze 1005만 전이와 FourRoom 100만 전이가 포함됐고, 같은 환경의 모델들은 동일한 데이터를 사용했다.

성과가 모든 환경에서 똑같이 나타난 것은 아니다. 에피소드가 짧은 일부 물체 조작 환경에서는 깊은 계층이 학습할 자료가 부족해 성능이 낮아지기도 했다. 장면이 매번 달라지는 실제 로봇 영상 DROID에서는 SIGReg만 사용하면 표현이 장면의 정체성과 같은 느린 특징에 치우쳤다. 연구진은 연속된 상태에서 어떤 행동이 일어났는지 복원하는 역동역학 손실을 추가해 오프라인 경로 재현의 충실도를 높였다.

따라서 이번 결과는 장기 목표와 정밀한 동작을 계층으로 나누는 설계가 시각 기반 계획의 효율을 높일 가능성을 보여준 것으로 볼 수 있다. 그러나 DROID 평가는 저장된 영상에서 경로를 얼마나 충실하게 재현하는지를 살핀 것이며, 실제 물리 로봇을 온라인으로 제어해 성공률이 향상됐는지는 추가 검증이 필요하다.

자료: New York University, Advanced Machine Intelligence, INRIA Paris, Brown University, arXiv, DROID Dataset Consortium

저작권자 © 한국R&D신문 — 무단 전재 및 재배포 금지
김동현 기자 dh.kim@k-rnd.net
전자·AI·소프트웨어 — 전자회로·통신·임베디드, 생성형 AI·머신러닝·데이터
댓글 0 최신순 추천순

첫 댓글을 남겨보세요.

0 / 400 · 회원 로그인 시 닉네임으로 작성 · 비회원 수정은 작성 후 1분 이내