PPO를 다시 돌리기 전에 관절을 직접 흔들어 본 이유: G1 contact actionability 진단
M95에서 다섯 관절에 작은 pulse를 넣자, 재현해 둔 여덟 개의 접촉 실패가 8개 모두 같은 방향으로 줄었습니다. 보통이라면 “유효한 방향을 […]
M95에서 다섯 관절에 작은 pulse를 넣자, 재현해 둔 여덟 개의 접촉 실패가 8개 모두 같은 방향으로 줄었습니다. 보통이라면 “유효한 방향을 […]
현재 G1 기본 설정은 한 번의 PPO iteration에서 98,304개의 transition을 모은 뒤 20번의 optimizer step을 수행합니다. 경로가 갑자기 무너지는 현상을
G1 PPO의 seed 재현성을 확인하던 M68 실험에서는 seed 42·43·44가 모두 목표로 삼은 두 지표를 개선했습니다. vertical CAM z RMSE는 3.67~4.09%,
현재 G1 기본 설정은 PPO iteration 하나를 위해 4,096개 환경에서 각각 24 step을 수집합니다. 한 번에 생기는 transition은 98,304개입니다. 이
G1이 넘어지지 않고 앞으로 걸었습니다. 처음에는 이것만으로 학습이 성공했다고 생각하기 쉽습니다. 하지만 최근 실험에서 가장 중요한 판단은 새 체크포인트를 채택한
G1 PPO 실험에서 정책은 한동안 두 발을 바닥에 붙인 채 움직였습니다. reward를 여러 차례 바꿔도 single_support는 0이었습니다. 정책이 발을 들기