PPO 하이퍼파라미터는 무엇부터 바꿔야 하나: G1에서 clip·gamma·lambda·batch를 고정한 이유
현재 G1 기본 설정은 한 번의 PPO iteration에서 98,304개의 transition을 모은 뒤 20번의 optimizer step을 수행합니다. 경로가 갑자기 무너지는 현상을 […]
현재 G1 기본 설정은 한 번의 PPO iteration에서 98,304개의 transition을 모은 뒤 20번의 optimizer step을 수행합니다. 경로가 갑자기 무너지는 현상을 […]
G1 PPO의 seed 재현성을 확인하던 M68 실험에서는 seed 42·43·44가 모두 목표로 삼은 두 지표를 개선했습니다. vertical CAM z RMSE는 3.67~4.09%,
현재 G1 기본 설정은 PPO iteration 하나를 위해 4,096개 환경에서 각각 24 step을 수집합니다. 한 번에 생기는 transition은 98,304개입니다. 이
G1 PPO 실험에서 정책은 한동안 두 발을 바닥에 붙인 채 움직였습니다. reward를 여러 차례 바꿔도 single_support는 0이었습니다. 정책이 발을 들기
G1 PPO 보행 실험 v161의 15초 trace를 정리하다가 서로 양립하기 어려워 보이는 숫자를 만났습니다. 로봇 기준 전진 속도는 평균 +0.590m/s였는데,
초기 G1 보행 환경에서는 발을 조금 들어도 공중 시간 보상이 음수가 되는 구간이 있었습니다. 정책은 발을 들지 않는 쪽으로 움직였습니다.
G1용 WBC-lite 보행 목표 생성기는 순수 Python 검사에서 왼발 12회, 오른발 13회의 교대 스텝을 만들었습니다. 스텝 수 비대칭은 0.08이었고, single
VLA 경로의 계약 테스트를 처음 돌렸을 때 결과는 6개 시나리오 모두 PASS였습니다. 그런데 테스트에 사용한 이미지 경로 중에는 실제 파일이
G1의 자체 변환 USD와 자체 actuator 설정을 사용했을 때 zero policy는 평균 약 2.68초 뒤 무너졌습니다. 정책 action을 모두 0으로
data/raw/를 열어 보면 11.8MB짜리 dryrun_test.hdf5가 하나 있습니다. 확장자와 크기만 보면 이미 로봇 시연 데이터를 수집한 것처럼 보입니다. 저장 코드는 카메라