로봇의 발은 바닥을 어떻게 느끼는가: G1의 접촉·마찰·single-support 판정
G1 v92 정책은 slow command 평가에서 15초 동안 넘어지지 않고 +4.748m를 이동했습니다. 이 숫자만 보면 보행이 시작된 것처럼 보입니다. 그러나 […]
G1 v92 정책은 slow command 평가에서 15초 동안 넘어지지 않고 +4.748m를 이동했습니다. 이 숫자만 보면 보행이 시작된 것처럼 보입니다. 그러나 […]
G1 보행 실험 v131에서 저는 무게중심을 지지발 쪽에 붙잡는 보상을 추가했습니다. 결과만 보면 어느 정도 효과가 있었습니다. 느린 명령에서 평균
v99의 G1 정책은 아직 걷지 못했지만, nominal 명령에서 처음으로 아주 작은 single-support 신호를 만들었습니다. 두 발 중 하나가 떠 있던
G1 보행 정책을 학습시키면서 한동안 이상한 현상을 보고 있었습니다. 로봇의 발 교차를 실패로 판정하도록 평가기를 만들었는데, 학습된 로봇은 특정 구간에서
G1 모션 트래킹 정책을 처음 학습했을 때, 환경에는 이미 9개의 reward term이 있었습니다. 몸통의 위치와 자세, 여러 링크의 위치와 자세,
발목 높이 오차는 1.822cm에서 1.662cm로 줄었습니다. 제가 추가한 reward가 계산되고, PPO가 그 값을 실제로 최적화했다는 뜻이었습니다. 그런데 같은 정책의 false
M95에서 다섯 관절에 작은 pulse를 넣자, 재현해 둔 여덟 개의 접촉 실패가 8개 모두 같은 방향으로 줄었습니다. 보통이라면 “유효한 방향을
현재 G1 기본 설정은 한 번의 PPO iteration에서 98,304개의 transition을 모은 뒤 20번의 optimizer step을 수행합니다. 경로가 갑자기 무너지는 현상을
G1 PPO의 seed 재현성을 확인하던 M68 실험에서는 seed 42·43·44가 모두 목표로 삼은 두 지표를 개선했습니다. vertical CAM z RMSE는 3.67~4.09%,
training/rl/train.py의 시작 부분을 보면 Isaac Sim과 Isaac Lab의 관계가 드러납니다. 스크립트는 먼저 AppLauncher로 simulation app을 띄웁니다. 그 다음에야 Gym 환경과