[모델]Reward AI, 인간 시연 데이터로만 학습한 로봇 정책 OM-1 공개
Reward AI가 텔레오퍼레이션이나 로봇 실기 데이터 없이 인간의 시연 데이터만으로 학습된 범용 조작 정책 'OM-1'을 공개했습니다. 웨어러블 장갑으로 수집한 30분 미만의 데이터만으로 새 작업을 학습하며, 산업용 로봇 암과 휴머노이드에서 인간 수준의 속도로 동작합니다.
전문 읽기접기
무슨 일이야
Reward AI가 범용 로봇 조작 정책인 'OM-1(Omnibody Model 1)'을 발표했습니다. 가장 큰 특징은 로봇 원격 조종(Teleoperation)이나 로봇에서 직접 수집한 데이터를 전혀 쓰지 않고, 7자유도(7-DoF) 웨어러블 글러브를 통해 캡처한 인간의 시연 데이터로만 전체 학습을 진행했다는 점입니다.
OM-1은 30분 미만의 시연 데이터만 있어도 새로운 작업을 익힐 수 있는 성능을 보여줍니다. 하드웨어 추적에는 전자기(electromagnetic) 방식의 핸드 트래킹을 활용했는데, 67cm/s 속도 기준으로 시각-관성(visual-inertial) 추적 방식 대비 오버슈트를 60% 줄였습니다. 여기에 자체 클록으로 구동되는 강화학습(RL) 기반 제어 계층을 결합해 산업용 로봇 암과 휴머노이드 모두에서 인간과 비슷한 속도로 작업을 수행합니다.
왜 중요해
로봇 학습에서 가장 큰 병목 중 하나는 실제 로봇 하드웨어를 직접 조종하거나 굴려가며 고비용의 데이터를 모아야 한다는 점이었습니다. 인간이 글러브를 끼고 직접 보여준 짧은 데이터만으로 하드웨어가 다른 로봇 암이나 휴머노이드에 범용 정책을 배포할 수 있다면, 로봇 데이터 수집 비용과 태스크 확장 허들이 크게 낮아질 수 있습니다.
짚고 넘어갈 점
현재 OM-1의 모델 가중치(weights), 소스 코드, API 등은 아직 외부에 공개되지 않은 상태입니다. 실제 다양한 작업 환경에서의 일반화 성능이나 물리적 제약 조건을 어떻게 극복했는지는 구체적인 리소스가 공개된 이후 검증이 필요해 보입니다.
참고: MarkTechPost
댓글 0
첫 댓글을 남겨보세요.