로봇이 단순히 팔만 움직이는 수준을 넘어, 전신을 자유자재로 제어하고 다섯 손가락으로 섬세한 작업을 수행하며, 여러 대가 협력하는 시대가 열리고 있습니다. 구글 딥마인드가 최근 공개한 제미니 로보틱스 2(Gemini Robotics 2)는 이러한 비전을 현실로 옮기는 핵심 지능층으로, 세 가지 모델로 구성돼 각각 다른 접근 권한과 역할을 부여받았습니다. 이번 발표는 로봇 산업의 패러다임 전환을 예고하며, 관련 기술과 생태계에 광범위한 파장을 일으키고 있습니다.
무슨 일이 있었나: 세 가지 모델의 분업 구조
제미니 로보틱스 2는 비전-언어-행동(VLA) 모델, 내재적 추론(ER) 모델, 그리고 온디바이스 VLA 모델로 구성됩니다. VLA 모델은 시각과 언어 입력을 모터 제어 신호로 직접 변환해 휴머노이드 로봇의 발끝부터 손끝까지 전신을 구동합니다. ER 모델은 고수준의 두뇌 역할을 하며, 사람과 소통하고 물리적 세계를 이해한 뒤 최대 수 분에 걸친 다단계 작업을 계획합니다. 이 ER 모델은 구글의 최신 언어 모델인 제미니 3.5 플래시를 기반으로 하며, 최대 128K 토큰의 컨텍스트를 처리할 수 있습니다. 온디바이스 VLA 모델은 로봇 내부에서 로컬로 실행되도록 최적화된 경량 버전으로, 제미니 로보틱스 1.5 기술과 구글의 온디바이스 젬마 모델을 기반으로 합니다. 이렇게 세 모델이 분업함으로써, ER 모델이 작업을 계획하고 추적한 뒤 VLA 모델을 도구처럼 호출해 실제 모터 제어를 위임하는 구조가 완성됐습니다.
왜 중요한가: 전신 제어와 손재주의 혁신
이전 세대 모델은 휴머노이드의 상체만 제어해 탁상 위 작업에 국한됐습니다. 하지만 제미니 로보틱스 2는 처음으로 전신 운동 제어를 지원합니다. 예를 들어 ‘물뿌리개를 집어 아래 선반의 초록색 통에 넣어라’는 명령에 로봇이 걸어가 물뿌리개를 집고, 몇 걸음 이동한 뒤 목적지에 물건을 내려놓는 동작이 가능해졌습니다. 또한 다섯 손가락 로봇 핸드(SharpaWave, 22자유도)를 제어해 매듭을 묶거나 지퍼백을 밀봉하는 작업을 수행하며, 동시에 일반적인 두 손가락 평행 그리퍼를 장착한 플랫폼에서도 동일한 모델 체크포인트가 작동합니다. 이는 하나의 모델이 전혀 다른 로봇 구조와 손 형태를 모두 제어할 수 있는 범용성을 입증한 것입니다. 다만 구글 딥마인드는 아직 움직임 속도와 다섯 손가락 손재주 성공률(32%~92%로 편차가 큼)에서 개선 여지가 있다고 밝히고 있습니다. 특히 먼지받이를 사용하는 작업의 성공률이 32%에 그치는 등 섬세한 조작은 여전히 도전 과제입니다.
우리의 해석: 로봇 지능의 분업화와 생태계 영향
이번 발표의 핵심은 ‘하나의 지능이 모든 것을 해결한다’는 접근이 아니라, 계층화된 지능 구조를 통해 확장성과 안정성을 동시에 추구했다는 점입니다. ER 모델이 계획하고 VLA 모델이 실행하는 분업은, 마치 인간의 대뇌와 소뇌의 관계와 유사합니다. 이는 로봇 소프트웨어 스택이 더욱 모듈화되고, 각 계층이 독립적으로 발전할 수 있는 길을 열어줍니다. 또한 ER 모델이 제미니 3.5 플래시를 기반으로 하면서도 온디바이스 모델은 별도의 경량 아키텍처를 사용한다는 점은, 클라우드 의존도를 낮추고 실시간 응답성을 높이려는 전략으로 풀이됩니다. XPLAIN AI는 이 구조가 로봇 운영체제(ROS)와 같은 기존 표준과 어떻게 통합될지, 그리고 개발자들이 ER 모델을 통해 어떤 새로운 응용을 만들어낼지가 향후 생태계의 방향을 결정할 것으로 전망합니다.
수혜와 리스크: 투자자가 주목할 지점
이 기술의 확산은 로봇 하드웨어 제조사와 부품 공급망에 새로운 기회를 창출할 가능성이 큽니다. 특히 전신 제어와 손재주를 갖춘 휴머노이드 로봇의 상용화가 가속화되면, 모터, 센서, 액추에이터, 배터리 등 관련 부품 수요가 증가할 수 있습니다. 반면, 기존의 단순 반복 작업용 산업용 로봇이나 제한된 프로그래밍에 의존하는 로봇 기업들은 기술 전환 압박을 받을 수 있습니다. 또한 구글 딥마인드가 ER 모델을 공개 프리뷰로 제공하는 반면, VLA 모델과 온디바이스 모델은 게이트(승인제)로 유지하는 전략은, 핵심 기술을 제한적으로 공개해 생태계 내에서 구글의 영향력을 유지하려는 의도로 해석됩니다. 이는 클라우드 AI 서비스와의 연계 가능성을 시사하며, 관련 인프라 및 반도체 수요에도 영향을 미칠 수 있습니다.
반대 시나리오와 불확실성
그러나 넘어야 할 산도 많습니다. 첫째, 다섯 손가락 손재주의 성공률이 작업에 따라 32%에서 92%까지 큰 편차를 보인다는 점은, 아직 실용화에 한계가 있음을 의미합니다. 둘째, 로봇의 움직임 속도가 충분히 빠르지 않다는 점도 생산 현장 도입에 걸림돌입니다. 셋째, ASIMOV-Agentic이라는 새로운 안전 벤치마크를 허깅페이스에 공개했지만, 실제 환경에서의 안전성과 신뢰성 검증은 아직 초기 단계입니다. 넷째, 구글 딥마인드 외에도 다양한 기업과 연구소가 유사한 기술을 개발 중이므로, 이 분야의 경쟁은 더욱 치열해질 전망입니다. 따라서 투자자들은 단기적인 기대보다는 기술의 성숙도와 실제 도입 사례를 면밀히 관찰할 필요가 있습니다.
다음에 확인할 지표
향후 몇 분기 동안 주목해야 할 지표는 다음과 같습니다: ① ER 모델의 공개 프리뷰 이후 개발자 커뮤니티의 반응과 실제 사용 사례, ② VLA 모델의 성공률 향상 속도(특히 손재주 작업에서 50% 미만 구간의 개선), ③ 구글 딥마인드가 게이트를 유지하는 VLA 및 온디바이스 모델의 상업화 조건, ④ 경쟁사(예: 테슬라, 피규어 AI, 보스턴 다이내믹스 등)의 유사 기술 발표 시점과 성능 비교, ⑤ 로봇 하드웨어 제조사(앱트로닉, 샤프웨이브 등)의 실제 양산 계획 및 수주 동향입니다. 이러한 지표들이 긍정적으로 확인된다면, 로봇 지능 분야의 본격적인 투자 시대가 열릴 것으로 기대됩니다.
#구글딥마인드 #제미니로보틱스2 #휴머노이드로봇 #전신제어 #손재주AI #로봇지능 #AI투자 #산업용로봇
출처
- Google DeepMind Ships Three Physical AI Models For Whole Body Control, Dexterity And Multi Robot Collaboration — MarkTechPost · 언론 보도 · Thu, 30 Jul 2026 17:20:50 +0000
작성: XPLAIN AI 편집팀 · 검수: XPLAIN AI Editorial Desk
이 콘텐츠는 공개된 출처를 기반으로 AI의 도움을 받아 작성되었으며, XPLAIN AI의 편집·검수 기준을 적용했습니다. 사실과 분석 의견을 구분하며, 오류가 확인되면 수정합니다.