손을 멈추는 것과 물체를 잡는 것은 다르다
로봇 손이 물체 앞에서 멈췄다. 힘이 급격히 커지지도 않았고, 보호 장치가 동작해 실험이 중단되지도 않았다. 이 정도면 접촉 문제를 해결했다고 […]
Life of Mechanic의 현재 휴머노이드 로보틱스 워크스페이스와 구현 흐름
로봇 손이 물체 앞에서 멈췄다. 힘이 급격히 커지지도 않았고, 보호 장치가 동작해 실험이 중단되지도 않았다. 이 정도면 접촉 문제를 해결했다고 […]
손목을 목표 위치로 보내는 것까지는 통과했는데, 물체에 닿는 순간부터 막혔습니다. 게인을 더 만지는 대신 접촉을 하나씩 제거해 보며 무엇이 남는지 확인한 기록입니다. 아직 원인은 확정되지 않았고, 대신 질문의 형태가 바뀌었습니다.
G1이 걷는 데 성공한 뒤 다음 목표는 팔로 물건을 집는 일이었습니다. 그런데 로봇의 손에는 물건을 만질 수 있는 표면조차 없었습니다. 거기서부터 시작해 지금까지 부딪힌 문제와, 확정된 것과 아직 안 되는 것을 구분해 남긴 기록입니다.
학습을 더 오래 돌리면 로봇의 걸음은 조금씩 좋아질까? 강화학습을 처음 볼 때는 시행착오를 많이 할수록 정답에 가까워질 것처럼 보입니다. 하지만
로봇이 넘어지지 않고 앞으로 움직이면, 이제 “걷기에 성공했다”고 말해도 될까요? 3주 넘게 G1 보행 정책을 학습시키며 이 질문의 기준이 계속
네 번의 reward 변경에서 학습 점수와 생존 시간은 모두 올랐지만 전진 거리, 발 교차, 팔 사용량은 서로 다른 방향으로 움직였습니다. 학습 곡선과 고정 평가를 함께 보며 reward가 올라가도 원하는 보행이 보장되지 않는 이유를 정리합니다.
강화학습을 3주 넘게 돌렸는데도 휴머노이드가 제대로 걷지 못했다면, 단순히 학습 시간이 부족했던 걸까요? 저도 처음엔 더 오래 학습시키거나 보상 계수를
로봇이 원하는 대로 걷지 못할 때, 가장 먼저 해야 할 일은 보상을 바꾸거나 학습을 더 오래 돌리는 일일까요? 저도 한동안은
Physical AI, 자연어 명령, 시뮬레이션, 강화학습이라는 말을 한꺼번에 들으면 “그래서 이 프로젝트는 정확히 무엇을 만드는 건가?”라는 질문이 남습니다. 그 질문은
H1 보행에서 처음 얻은 체크포인트는 평균 episode length가 743까지 올라갔지만, 저는 그것을 자연 보행이라고 받아들이지 않았습니다. 넘어지지 않는 시간과 사람이