Octo를 빠른 기준선 후보로 보되, 아직 비교 실험으로 부르지 않는 이유

새 로봇 과제를 시작할 때, 처음부터 정책을 학습해야 할까요. Octo는 다양한 로봇 시연으로 미리 학습한 정책을 새로운 관측과 행동 공간에 적응시키려는 시도입니다. 저는 이 모델을 ‘당장 쓸 수 있는 범용 해답’이 아니라, 현재 데이터와 인터페이스가 어느 수준까지 준비돼야 비교 기준선을 만들 수 있는지 알려 주는 논문으로 읽었습니다.

Octo 구조도

Octo가 해결하려는 문제

Octo는 Open X-Embodiment의 다양한 조작 궤적에서 학습한 transformer 기반 정책입니다. 모델은 언어 지시 또는 목표 이미지를 받고, 로봇이 다음에 취할 행동을 생성합니다. 핵심은 특정 로봇에 완성된 정책을 주는 것이 아니라, 새 센서와 행동 공간에도 적응할 수 있는 초기 표현을 제공하려는 데 있습니다. 논문은 여러 로봇 플랫폼에서 적응 가능성을 보였지만, 데이터 형식과 과제가 달라져도 무조건 성능이 보장된다는 뜻은 아닙니다.

이 논문을 읽으며 제가 버린 선택지는 “사전학습 모델을 받으면 데이터 준비는 나중에 해도 된다”는 생각이었습니다. 사전학습 정책일수록 입력 이미지, 상태 표현, 행동의 단위, 과제 성공 기준이 무엇인지 더 분명해야 합니다. 그렇지 않으면 성능 저하가 모델의 한계인지, 변환 과정의 오류인지, 과제 정의의 불일치인지 구분할 수 없습니다.

프로젝트 적용 위치

현재 Octo는 실행 중인 정책이 아니라 비교 후보입니다. 우선은 한정된 조작 과제에서 관측·행동·평가의 계약을 고정하고, 그 위에서 처음부터 학습한 기준선과 사전학습 정책의 적응 결과를 비교해야 합니다. 그 비교가 가능해지면 Octo는 “작동한다”는 데모가 아니라 데이터 준비가 실제 일반화에 어떤 영향을 주는지 보는 실험 도구가 됩니다.

Open X-Embodiment가 데이터 계보를, OpenVLA가 시각언어행동 모델의 공개 기준선을 제시한다면, Octo는 적응 실험을 설계할 때의 현실적인 중간 지점입니다. 따라서 지금은 참고만 하고, 구현 선언은 데이터와 평가 조건이 갖춰진 뒤에만 하려 합니다.


논문 원문: Octo Model Team, Octo: An Open-Source Generalist Robot Policy

함께 읽기: Open X-Embodiment · OpenVLA

Octo가 선택한 문제의 범위

거대한 VLA가 좋은 일반화 성능을 보여도 연구자가 새 로봇과 센서에 맞춰 다시 학습하기 어렵다면 실험 기준선으로 쓰기 힘듭니다. Octo는 최고 성능 하나보다 공개성, 모듈성, 빠른 적응을 우선했습니다. 약 9천만 매개변수의 트랜스포머를 Open X-Embodiment의 선별된 궤적으로 학습하고, 입력과 출력 모듈을 교체할 수 있게 설계했습니다.

토큰을 모으는 방식과 행동을 만드는 방식

주 카메라와 손목 카메라는 작은 이미지 패치 토큰으로, 로봇 자체 상태는 선형 투영 토큰으로 바뀝니다. 언어 지시나 목표 이미지는 “무엇을 해야 하는가”를 나타내는 task token이 됩니다. readout token은 이 모든 토큰을 읽는 학습 가능한 질문표와 비슷하며, 특정 출력에 필요한 정보를 한곳에 모아 diffusion action head로 넘깁니다.

확산 헤드는 정답 행동에 잡음을 더한 뒤 그 잡음을 예측하도록 학습합니다. 추론 때는 무작위 잡음에서 여러 단계에 걸쳐 행동 묶음을 복원합니다. 평균제곱오차 회귀가 왼쪽과 오른쪽 두 가지 유효한 잡기 경로를 평균내 어중간한 행동을 만들 수 있는 반면, 확률분포를 학습하는 확산 방식은 복수의 행동 모드를 표현할 수 있다는 논리입니다.

결과를 읽는 기준

논문은 여러 플랫폼에서 제로샷과 미세조정 성능을 비교하고, 작은 모델이 새 로봇에 빠르게 적응할 수 있음을 보였습니다. 그러나 제로샷 성능이 항상 대형 VLA보다 높은 것은 아니며 확산 추론 단계가 제어 지연을 만듭니다. 제 프로젝트에서는 Octo를 설치 후보가 아니라 데이터와 센서 인터페이스를 분리한 비교 기준선으로 두고, 실제 채택은 동일 데이터·동일 평가 조건에서 지연과 성공률을 측정한 뒤 판단합니다.

확산 헤드와 빠른 적응을 분리해 본 실험

행동 헤드 WidowX 성공률
이산화(discretized) 예측 18%
연속(MSE) 회귀 35%
Octo-Small, 확산 헤드 83%

이 절제 실험(논문 Table II)은 확산 헤드가 단지 최신 기법이라 선택된 것이 아님을 보여 줍니다. 같은 문맥에서 행동 출력 방식만 바꿨을 때 복수 경로를 표현하는 확산 헤드가 이산화·MSE 회귀보다 크게 높았습니다. 제로샷 성능은 평가 플랫폼마다 달라 WidowX 50%, UR5 70%, RT-1 Robot 80% 수준이고, 여섯 개 미세조정 평가의 평균은 약 72%로 다음으로 좋은 기준선을 약 52% 앞섰다고 논문은 보고합니다. Octo의 주장은 절대적인 제로샷 우승보다 적은 비용으로 새 환경에 적응하는 실용성에 가깝습니다.


원문 보기: Octo (arXiv 2405.12213)

댓글 달기

이메일 주소는 공개되지 않습니다. 필수 필드는 *로 표시됩니다

위로 스크롤