로봇 강화학습 환경 읽기 — G1의 관측·행동·보상
초기 G1 보행 환경에서는 발을 조금 들어도 공중 시간 보상이 음수가 되는 구간이 있었습니다. 정책은 발을 들지 않는 쪽으로 움직였습니다. […]
초기 G1 보행 환경에서는 발을 조금 들어도 공중 시간 보상이 음수가 되는 구간이 있었습니다. 정책은 발을 들지 않는 쪽으로 움직였습니다. […]
G1 보행 정책의 한 실험에서는 느린 명령 구간의 이동거리가 0.187m 늘었습니다. 넘어지거나 발이 교차하는 문제도 없었습니다. 숫자만 보면 정책이 좋아진
G1용 WBC-lite 보행 목표 생성기는 순수 Python 검사에서 왼발 12회, 오른발 13회의 교대 스텝을 만들었습니다. 스텝 수 비대칭은 0.08이었고, single
G1의 자체 변환 USD와 자체 actuator 설정을 사용했을 때 zero policy는 평균 약 2.68초 뒤 무너졌습니다. 정책 action을 모두 0으로
training/rl/train.py의 시작 부분을 보면 Isaac Sim과 Isaac Lab의 관계가 드러납니다. 스크립트는 먼저 AppLauncher로 simulation app을 띄웁니다. 그 다음에야 Gym 환경과
G1에 아무 행동도 주지 않은 zero-policy 검사에서, 양쪽 발목 토크는 시작 후 0.02초 만에 한계에 도달했습니다. 몸의 무게중심이나 ZMP가 지지
G1 PPO 실험에서 정책은 한동안 두 발을 바닥에 붙인 채 움직였습니다. reward를 여러 차례 바꿔도 single_support는 0이었습니다. 정책이 발을 들기
G1 PPO 보행 실험 v161의 15초 trace를 정리하다가 서로 양립하기 어려워 보이는 숫자를 만났습니다. 로봇 기준 전진 속도는 평균 +0.590m/s였는데,