보상 함수는 어떻게 실패하는가 — 발을 들지 않던 G1과 Reward Hacking
G1 보행 정책의 한 실험에서는 느린 명령 구간의 이동거리가 0.187m 늘었습니다. 넘어지거나 발이 교차하는 문제도 없었습니다. 숫자만 보면 정책이 좋아진 […]
진행 중인 로보틱스 프로젝트의 설계, 구현, 실험 기록
G1 보행 정책의 한 실험에서는 느린 명령 구간의 이동거리가 0.187m 늘었습니다. 넘어지거나 발이 교차하는 문제도 없었습니다. 숫자만 보면 정책이 좋아진 […]
2026년 8월 1일 업데이트. G1은 Isaac Sim에서 전진 보행의 1차 기준을 통과했고, 정량 평가와 사람이 직접 확인한 화면을 함께 근거로
2026년 7월 19일 현재 G1 작업은 M160a 오른팔 독립 excitation의 CPU 계약 7/7 통과까지 진행됐습니다. Isaac runtime capture, PPO, actor
2026년 7월 19일 현재 G1 작업은 M160a 오른팔 독립 excitation의 CPU 계약 7/7 통과까지 진행됐습니다. Isaac runtime capture, PPO, actor
처음에는 폴더를 잘 나누면 작업도 자연스럽게 정리될 거라고 생각했습니다. 하지만 G1 보행 실험이 수백 개의 계획·실행·평가 산출물로 늘어나자, sim/이나 training/이라는
로봇에게 “앞으로 걸어”라고 말했을 때 실제로 필요한 건 언어 모델 하나가 아닙니다. 명령을 해석하는 계층, 균형을 지키며 움직임을 만드는 제어기,
2026년 7월 19일 현재 G1 작업은 M160a 오른팔 독립 excitation의 CPU 계약 7/7 통과까지 진행됐습니다. Isaac runtime capture, PPO, actor
로봇 학습에서는 파일이 생겼다는 사실과 학습에 쓸 수 있다는 사실이 다릅니다. 현재 data/raw/에 있는 HDF5 dry-run 파일은 episode schema가 기록되는지
WBC 모듈 평가에서 28개 점검 항목이 모두 통과했습니다. 처음에는 이 숫자를 그대로 “보행이 된다”는 결과처럼 적고 싶었지만, 그 표현은 정확하지
정책의 한 지표가 좋아지면 다음 체크포인트로 승격시키고 싶어집니다. G1 보행 실험에서도 M158d는 접촉 횟수를 87회에서 71회로 줄였고, 충격량은 9.8347 N·s에서