포지션 상세
Humanoid Whole-Body Control RL Engineer는
강화학습을 기반으로 휴머노이드 로봇의 전신 제어 정책을 학습시키고,
이를 실제 로봇 환경에서 안정적으로 동작하도록 만드는 역할입니다.
이 포지션은 단순한 제어 알고리즘 개발이 아니라,
로봇의 전신 움직임을 학습 기반으로 최적화하고,
시뮬레이션부터 실제 환경까지 연결하는 end-to-end 학습 시스템을 구축하는 역할
입니다.
- Whole-body control을 위한 RL policy 설계 및 최적화
- locomotion, balancing, manipulation이 결합된 복합 행동 학습
- long-horizon task에서의 안정적인 정책 학습
• Interaction 기반 학습 시스템 구축
- 로봇이 환경과 상호작용하며 학습하는 RL 구조 설계
- simulation 및 실제 로봇 환경에서 policy 학습 및 검증
- 경험 기반 학습 루프 (rollout 학습 평가) 구축
• 모델 최적화 및 개선
- inference latency, stability, robustness 개선
- 데이터 수집 및 모델 성능 향상
- 필요 시 RL / IL 기반으로 policy 개선
• Reward 설계 및 학습 안정성 개선
- 전신 제어를 위한 reward function 설계
- curriculum learning, domain randomization 등 학습 전략 적용
• 정책의 안정성 및 일반화 성능 개선
- 다양한 환경 변화에 robust한 정책 개발
- noise, delay, partial observability 대응
- sim-to-real gap 최소화
• 실제 로봇 시스템과의 통합
- 소프트웨어/하드웨어 팀과 협업하여 policy를 실제 로봇에 적용
- real-world 테스트 및 문제 해결
- 학습 결과를 시뮬레이션 환경에 반영
• Reinforcement Learning
- PPO, SAC 등 로보틱스 적용 강화학습 알고리즘 경험
- RL 기반 policy 학습 및 실제 문제 적용 경험
- 하이퍼파라미터 및 cost/reward function 튜닝 경험
- 다음과 같은 RL 학습 기법에 대한 이해 및 활용 경험
- Domain Randomization
- Curriculum Learning
- Reward Shaping
- 안정적인 정책 학습을 위한 실험 설계 및 개선 경험
• Dynamics & Control
- 로봇 동역학 및 제어 이론에 대한 탄탄한 이해
- 특히 legged robot 또는 humanoid 시스템 제어 경험 우대
• Engineering & Leadership
- 복잡한 제어 또는 RL 프로젝트를 end-to-end로 수행한 경험
- 실험 분석 개선 사이클을 주도적으로 이끌 수 있는 능력
- 주니어 엔지니어를 멘토링하거나 기술 리딩한 경험
강화학습을 기반으로 휴머노이드 로봇의 전신 제어 정책을 학습시키고,
이를 실제 로봇 환경에서 안정적으로 동작하도록 만드는 역할입니다.
이 포지션은 단순한 제어 알고리즘 개발이 아니라,
로봇의 전신 움직임을 학습 기반으로 최적화하고,
시뮬레이션부터 실제 환경까지 연결하는 end-to-end 학습 시스템을 구축하는 역할
입니다.
주요업무
• 휴머노이드 전신 제어를 위한 강화학습 알고리즘 개발- Whole-body control을 위한 RL policy 설계 및 최적화
- locomotion, balancing, manipulation이 결합된 복합 행동 학습
- long-horizon task에서의 안정적인 정책 학습
• Interaction 기반 학습 시스템 구축
- 로봇이 환경과 상호작용하며 학습하는 RL 구조 설계
- simulation 및 실제 로봇 환경에서 policy 학습 및 검증
- 경험 기반 학습 루프 (rollout 학습 평가) 구축
• 모델 최적화 및 개선
- inference latency, stability, robustness 개선
- 데이터 수집 및 모델 성능 향상
- 필요 시 RL / IL 기반으로 policy 개선
• Reward 설계 및 학습 안정성 개선
- 전신 제어를 위한 reward function 설계
- curriculum learning, domain randomization 등 학습 전략 적용
• 정책의 안정성 및 일반화 성능 개선
- 다양한 환경 변화에 robust한 정책 개발
- noise, delay, partial observability 대응
- sim-to-real gap 최소화
• 실제 로봇 시스템과의 통합
- 소프트웨어/하드웨어 팀과 협업하여 policy를 실제 로봇에 적용
- real-world 테스트 및 문제 해결
- 학습 결과를 시뮬레이션 환경에 반영
자격요건
• AI, Robotics, Computer Science 등 관련 분야 석사 학위 이상• Reinforcement Learning
- PPO, SAC 등 로보틱스 적용 강화학습 알고리즘 경험
- RL 기반 policy 학습 및 실제 문제 적용 경험
- 하이퍼파라미터 및 cost/reward function 튜닝 경험
- 다음과 같은 RL 학습 기법에 대한 이해 및 활용 경험
- Domain Randomization
- Curriculum Learning
- Reward Shaping
- 안정적인 정책 학습을 위한 실험 설계 및 개선 경험
• Dynamics & Control
- 로봇 동역학 및 제어 이론에 대한 탄탄한 이해
- 특히 legged robot 또는 humanoid 시스템 제어 경험 우대
• Engineering & Leadership
- 복잡한 제어 또는 RL 프로젝트를 end-to-end로 수행한 경험
- 실험 분석 개선 사이클을 주도적으로 이끌 수 있는 능력
- 주니어 엔지니어를 멘토링하거나 기술 리딩한 경험

