핵심 내용 요약
이 기사는 MIT, DeepMind, Berkeley, Galaxy General, Sony AI 등의 팀들이 개발한 골프 로봇 기술을 분석하여 물리적 인공지능(Physical AI) 분야의 핵심 경쟁점을 밝혀냅니다. 이 경쟁은 “물리적 모델과 머신러닝 중 어느 쪽이 다른 쪽을 대체하는가”가 아니라, 두 가지 기술이 어떻게 분업하고 협력하는가에 있습니다. 물리적 모델은 중력이나 공의 기본 운동 법칙과 같은 안정적이고 저비용의 ‘알려진 지식’을 제공하는 역할을 하며, 머신러닝은 인간형 로봇이 공을 치는 데 필요한 고차원적이고 복잡한 ‘알려지지 않은 기술’을 처리합니다. 각 팀의 접근 방식은 두 기술의 역할을 재조정하는 것입니다. 즉, 모델을 직접 사용하여 로봇을 제어하는 것에서 모델을 이용해 시뮬레이션 환경을 구축하여 훈련하는 것, 그리고 모델을 통해 ‘가능한 세계’의 범위를 정의하는 것까지, 최종적으로는 “물리적 모델이 기본 구조를 제공하고 머신러닝이 세부 사항을 완성하는” 혼합 모델로 발전하고 있습니다.
상세한 분석
1. 골프 로봇: 왜 기술적 경로를 파악하는 데 이상적인 예시인가?
골프는 단순해 보이지만, 로봇 기술의 핵심 문제들을 극명하게 보여줍니다:
- 매우 짧은 반응 시간: 탁구공의 속도는 초당 20미터 이상이며, 두 번의 타격 사이의 간격은 0.5초도 채 되지 않습니다. 로봇은 공이 떨어지는 위치를 미리 예측해야 하며, 공이 다가올 때까지 기다리면 이미 늦습니다;
- 복잡한 동적 변화: 공의 회전(예: 초당 1000라디안의 속도)은 공의 궤적과 충돌 결과를 바꾸며, 공기 저항과 바닥 마찰도 고려해야 합니다;
- 전신의 조정: 인간형 로봇이 테니스를 칠 때는 다리(이동), 허리(회전), 어깨(스윙) 등 20개 이상의 관절을 동시에 제어해야 하며, 균형을 유지해야 합니다. 같은 타격 목표에도 수십 가지의 신체 자세가 가능합니다.
이러한 문제들은 “모델 vs 머신러닝”의 갈등을 명확하게 보여줍니다. 모든 세부 사항을 모델로 계산하는 것은 너무 복잡하고, 순수한 머신러닝만으로는 오류가 발생하기 쉽습니다. 따라서 골프 로봇은 기술적 경로를 파악하는 데 이상적인 예시가 됩니다.
2. 물리적 모델의 변화 과정: 제어에서 시뮬레이션, 그리고 경계 정의까지
물리적 모델은 사라진 것이 아니라 시스템 내에서 그 역할이 계속 변화하고 있습니다:
- MIT: 모델을 직접 사용하여 제어 (2025년 탁구 로봇): 로봇은 공을 매번 받을 때마다 물리 공식을 사용하여 공의 미래 궤적을 계산하고 스윙 동작을 계획합니다 (마치 엔지니어가 단계별로 가르치는 것처럼);
- DeepMind: 시뮬레이션 내에 모델을 숨김 (2024년 경쟁용 탁구 시스템): 로봇은 실제 세계에서 연습하지 않고, 물리 법칙에 따라 구축된 가상 환경에서 수백만 번의 연습을 통해 ‘근육 기억’을 형성한 후 실제 세계에서 연습합니다 (모델은 가상 훈련장을 만드는 역할을 합니다);
- Berkeley HITTER: 계층적 분업 (2025년 인간형 탁구 로봇): 상위 모델은 공의 떨어지는 위치와 라켓의 목표를 계산하고, 하위 모델은 로봇이 어떻게 움직여야 하는지 스스로 학습합니다 (공의 궤적은 모델로, 신체 동작은 학습으로);
- Galaxy General LATENT: 모델로 ‘가능한 세계’를 정의 (2026년 테니스 로봇): 가상 훈련 시 공의 무게, 바닥 마찰, 공기 저항을 합리적인 범위 내에서 무작위로 변화시켜 로봇이 다양한 상황에 적응하도록 합니다 (모델은 정확성을 추구하지 않고 ‘오차 허용 범위’를 제공합니다);
- Sony Ace: 혼합 모델 (2026년 Nature 논문): 핵심은 머신러닝이지만, 물리적 시뮬레이션 훈련, 공의 회전 예측, 충돌 제약 최적화를 여전히 사용합니다 (학습을 주로 하고 모델은 오류를 보완합니다).
3. 물리적 모델이 왜 사라지지 않았는가? “지식의 재사용”이 경제적이기 때문입니다
물리적 모델의 핵심 가치는 저비용의 사전 지식을 제공하는 것입니다:
- 예를 들어, 중력의 경우, F=mg와 같은 공식을 작성하는 데 거의 비용이 들지 않지만, 로봇이 10만 번의 실험을 통해 공이 떨어진다는 것을 알아내려면 많은 데이터와 계산 자원이 필요합니다;
- 공의 궤적을 계산하는 것도 뉴턴의 운동 법칙을 사용하는 것이 모델을 통해 영상에서 학습하는 것보다 훨씬 빠릅니다.
이러한 안정적이고 일반적인 법칙들을 로봇에게 직접 제공하는 것이 새로운 것을 학습하게 하는 것보다 경제적입니다. 마치 아이에게 “1+1=2”를 다시 발명하게 하는 대신 그냥 가르치는 것과 같습니다.
4. 경쟁의 진짜 이유: 누가 다른 쪽을 대체하는가가 아니라, “어떻게 분업하는가”입니다
실제로는 경제학적 문제입니다. 특정 기능에 대해 방정식, 데이터, 또는 계산 자원 중 어느 것이 더 저렴한가에 달려 있습니다:
- 방정식 우선: 안정적이고 간단하며 표현 비용이 낮은 법칙(예: 중력, 공의 기본 운동);
- 학습 우선: 고차원적이고 복잡하며 열거하기 어려운 행동(예: 인간형 로봇의 전신 타격 동작);
- 혼합 모델: 두 가지의 중간(예: 공의 복잡한 회전, 모델과 실제 데이터를 결합하여 수정).
예를 들어, HITTER의 경우, 공의 궤적은 모델로 계산하고(저비용), 신체 동작은 학습으로 처리합니다; LATENT의 경우, 모델은 파라미터의 범위를 정의하고(오차 방지), 학습을 통해 변화에 적응합니다(안정성이 높음).
5. 범용 로봇의 미래: 안정성이 정확성보다 중요한가?
범용 로봇은 가정, 공장, 야외 등 다양한 환경에서 사용되어야 하므로, 매번 모든 파라미터를 정확하게 설정할 수는 없습니다. 따라서:
- ‘절대적인 정확성’을 추구하지 않습니다: LATENT처럼 로봇이 ‘가능한 세계’에 적응하는 것이 완벽한 가상 복제를 추구하는 것보다 더 실용적입니다;
- 분업을 지속적으로 최적화합니다: 데이터와 계산 자원이 증가함에 따라, 오늘날 수동으로 설정해야 하는 모듈(예: 복잡한 접촉)은 미래에 머신러닝으로 대체될 수 있으며, 오늘날 학습에 의존하는 부분(예: 안전 제약)은 미래에 모델로 보완될 수 있습니다.
결론적으로, 물리적 모델은 여전히 중요한 역할을 하며, 기술 발전에 따라 그 역할이 변화하고 있습니다. 다양한 요소를 고려하여 최적의 솔루션을 찾는 것이 중요합니다.