Dyna-2 로봇 스케일링 법칙 — 인간 영상 100만 시간의 의미

로봇 학습의 가장 큰 병목은 데이터입니다. 언어 모델은 인터넷 텍스트를 대규모로 활용할 수 있지만, 로봇의 행동 데이터는 원격조작이나 전용 장비로 직접 수집해야 해 비용과 시간이 많이 듭니다. Dyna Robotics가 2026년 8월 공개한 Dyna-2는 이 문제를 다른 방향에서 접근합니다. 100만 시간이 넘는 인간의 1인칭 작업 영상을 사전학습하고, 데이터 양이 늘수록 인간 행동 예측뿐 아니라 처음 보는 로봇 데이터에서도 성능이 규칙적으로 좋아지는지를 측정했습니다.
이번 결과의 핵심은 단순히 데이터셋이 크다는 데 있지 않습니다. 회사가 공개한 실험에서는 인간 영상의 규모를 1천·1만·10만·100만 시간으로 늘렸을 때 개선 추세가 유지됐고, 그 추세가 실제 로봇의 후속 학습 성능으로도 이어졌습니다. 다만 결과는 Dyna Robotics의 자체 기술 보고서에 기반하므로, 독립 재현과 외부 벤치마크 검증이 더 필요하다는 점도 함께 봐야 합니다.
Dyna-2는 무엇을 함께 학습하나
Dyna-2는 비디오 확산 모델을 바탕으로 미래 영상과 미래 행동을 함께 예측하는 월드-액션 모델입니다. 영상과 행동을 각각 토큰화한 뒤 서로 주의를 주고받는 트랜스포머 구조를 사용하며, 과거 프레임·로봇의 고유감각 정보·언어 지시를 조건으로 받습니다. 학습에는 flow matching을 적용합니다.
흥미로운 부분은 추론 때마다 미래 영상을 실제로 생성해 보고 움직이는 구조가 아니라는 점입니다. 미래 영상 예측 손실이 공통 표현을 학습시키지만, 행동 정책은 실행 시 예측 영상을 직접 입력으로 삼지 않습니다. 즉 비디오 예측은 물체와 접촉, 장면 변화에 관한 표현을 강화하는 학습 신호로 기능하고, 실제 제어는 반응형 정책으로 유지됩니다.

이미지 출처: Dyna Robotics 공식 Dyna-2 연구 페이지
100만 시간까지 확인한 데이터 스케일링
연구팀은 1인칭 인간 조작 영상에서 1천·1만·10만·100만 시간의 중첩 데이터셋을 만들었습니다. 큰 데이터셋은 작은 데이터셋의 샘플을 그대로 포함하고 같은 출처 비율을 유지해, 데이터 분포 변화가 결과를 왜곡할 가능성을 줄였습니다. 별도의 100시간 검증 세트도 모든 실험에서 동일하게 사용했습니다.
평가는 행동 예측의 MSE와 L1 오차, 두 개 임계값에서의 정확도로 진행됐습니다. 보고서에 따르면 네 지표 모두 데이터가 늘수록 단조롭게 개선됐고 시간 규모에 대한 거듭제곱 법칙으로 설명됐습니다. 특히 엄격한 정확도 지표 accuracy@0.1은 1천 시간에서 100만 시간으로 가는 구간에서 51% 개선됐다고 보고됐습니다. 연구팀은 이번 실험에서 모델 크기와 연산량은 고정하고 데이터 시간만 바꿨으며, 모델·컴퓨트 스케일링은 향후 과제로 남겼습니다.
인간 데이터가 로봇으로 전이됐다는 근거
가장 주목할 결과는 사전학습에서 로봇 데이터를 전혀 보지 않은 체크포인트를 39개 로봇 작업의 오프라인 데이터로 평가했을 때도 네 데이터 규모의 순서대로 성능이 개선됐다는 점입니다. 작업은 천 다루기, 매듭 묶기, 포장, 청소, 음식 서비스, 조립 등을 포함합니다. 보고서는 1만 시간에서 10만 시간 사이에 전이 효과가 뚜렷해지는 변곡점도 관찰했다고 설명합니다.
실제 로봇 후속 학습에서도 같은 경향이 나타났습니다. 각 체크포인트에 동일한 방식으로 최대 10시간의 로봇 데이터를 추가 학습하고 14개 작업을 평가했을 때, 평균 정규화 성능은 사전학습 규모에 따라 20%·28%·45%·53%로 상승했습니다. 100만 시간 모델은 14개 중 9개 작업에서 가장 좋은 결과를 냈습니다. 병뚜껑 열기 작업은 약 10분의 로봇 시연만 추가했는데도 사전학습 규모가 커질수록 성공률이 10%에서 40%, 50%로 상승했다고 보고됐습니다.
왜 행동 라벨보다 비디오 예측이 중요했나
연구팀은 같은 구조에서 행동만 예측하는 방식, 영상과 행동을 함께 예측하는 방식, 여기에 행동 라벨이 없는 영상을 더하는 방식을 비교했습니다. 공동 예측 방식은 모든 데이터 규모와 39개 작업에서 행동 전용 모델보다 나았지만, 행동 데이터만 늘리는 것만으로는 로봇 전이 성능이 안정적으로 확장되지 않았습니다.
반면 행동 라벨 데이터의 양을 고정한 채 비디오 전용 데이터를 늘리자, 처음 보는 로봇 데이터에서 성능이 단조롭게 개선됐습니다. 이는 인간과 로봇의 관절 구조가 달라도 물체가 잡히고 밀리고 접히는 장면의 변화에는 공유 가능한 정보가 있음을 시사합니다. 값비싼 정밀 행동 라벨이 없는 영상도 물리적 상호작용의 표현을 학습하는 데 쓸 수 있다는 점에서 실무적 의미가 큽니다.
실무에서 읽어야 할 세 가지와 한계
- 사전학습 데이터 전략: 로봇 데이터만 대량 수집하기보다 인간 작업 영상과 소량의 로봇 후속 학습 데이터를 결합하는 전략이 현실적인 선택지가 될 수 있습니다.
- 학습 목표 설계: 행동 오차만 최소화하기보다 미래 장면 예측을 보조 목표로 넣는 것이 다른 로봇 형태로의 전이에 도움이 될 가능성이 있습니다.
- 평가 분리: 오프라인 행동 예측, 실제 로봇 성공률, 정밀도와 복구 능력을 구분해 측정해야 단순한 예측 개선을 현장 성능으로 오해하지 않을 수 있습니다.
동시에 주의할 점도 분명합니다. 공개 글은 기업 자체 보고이며 원시 데이터와 전체 학습 코드가 공개된 동료평가 논문은 아닙니다. 인간 영상 데이터의 수집·동의·라이선스 조건도 공개 페이지에서 충분히 상세하지 않습니다. 또한 100만 시간까지 데이터 스케일링을 확인했지만 모델 크기나 연산량을 함께 바꾼 법칙은 아직 검증하지 않았습니다. 따라서 이번 결과는 일반적인 로봇 스케일링 법칙의 최종 결론이라기보다, 인간 비디오가 실제 로봇 학습의 유효한 확장 축이 될 수 있다는 강한 실증적 신호로 보는 편이 타당합니다.
마무리
Dyna-2가 던지는 메시지는 명확합니다. 로봇이 인간과 똑같은 몸을 갖지 않아도, 인간이 물체를 다루는 방대한 영상에서 장면 변화와 접촉의 규칙을 학습할 수 있다는 것입니다. 특히 행동 라벨이 없는 비디오도 전이 성능을 높였다는 결과는 로봇 데이터 파이프라인의 비용 구조를 바꿀 가능성이 있습니다. 다음 단계는 외부 연구자의 재현, 다양한 로봇과 장기 작업에서의 검증, 데이터 거버넌스 공개입니다.
참고 자료
'ML & DL' 카테고리의 다른 글
| Recurrent Looped Transformer란? RLT 구조·실행 결과 (0) | 2026.09.16 |
|---|---|
| Google HEIR 동형암호 AI 추론, 어떻게 시작할까? (0) | 2026.08.24 |
| NVIDIA RAPIDS가 CUDA-X로 바뀐다 — 26.08 전환 체크리스트 (0) | 2026.08.11 |
| VocalRender 공개 — 악보를 바로 읽는 가창 합성 AI (0) | 2026.08.10 |
| Wan-Animate-2 공개 — 구동 영상을 직접 읽는 캐릭터 애니메이션 AI (0) | 2026.08.10 |