증권사 리포트&코멘트
<구글 딥마인드 Gemini Robitcs 2 Familiy 공개
*총평: 전신 제어, 온디바이스 VLA, Long-Horizon 작업, 멀티로봇, Cross-embodiment 등 이미 그동안 제시되었던 방향이라 크게 새로운 점은 없지만, 최근 트렌드를 집대성한 발표라고 봐주시면 될 것 같습니다.
https://deepmind.google/models/gemini-robotics/
- 2026년 7월 30일 Gemini Robotics 2를 공개하며 로봇 AI 스택을 세 개로 분리(Gemini Robotics 2, Gemini Robotics ER 2, On-Device 2). 아래와 같은 구조로 이해.
----
사용자 명령 / 카메라 / 오디오
↓
Gemini Robotics ER 2
- 상황 이해
- 작업 분해
- 순서 계획
- 로봇별 역할 분담
- 진행률·실패 여부 확인
↓
VLA 또는 로봇 제어 API 호출
↓
Gemini Robotics 2
또는 On-Device 2
↓
관절·손·그리퍼·보행 Action 출력
↓
센서 피드백을 ER 2가 다시 확인
----
- Gemini Robotics 2
*기존 Gemini Robotics는 주로 고정된 상체나 테이블 위 양팔 작업에 집중했음. 이번 모델은 휴머노이드의 발부터 손가락까지 전체 몸을 하나의 모델로 제어하는 형태임.
*보행 모델과 매니퓰레이션 모델을 단순히 따로 구동하는 것이 아니라, 이동·균형·몸통·팔·손을 통합적으로 컨트롤하는 방향.
*한계는 아직 다지 손을 완벽히 컨트롤 하지 못한다는 점.
- Gemini Robotics ER 2
*Embodied Reasoning 모델로 액션 출력보다 상위의 플래닝(행동 계획)을 수행. 사람의 명령·카메라 영상에 기반해 ER 2가 상황 이해 및 작업 분해하는 구조.
*ER 2는 단일 이미지가 아니라 연속 영상을 이해. 어디까지 진행됐는지, 실패했는지, 재시도해야 하는지를 판단. 그리고 추론 지연을 피하기 위해 행동이 진행되는 동안 다음 행동을 추론.
*Multi-robot collaboration도 강조. 한 로봇이 모든 작업을 수행하는 대신, 서로 다른 로봇의 능력을 파악해 역할을 분담하는 구조.
- On-Device 2
*"통신 없이" 로컬에서 텍스트 명령·카메라 이미지·관절 및 센서의 고유감각 데이터를 받아 숫자 형태의 로봇 Action을 출력.
Google DeepMind
Gemini Robotics 2
The intelligence layer to power any kind of robot
외부 자료를 정리한 참고자료이며 투자 권유가 아닙니다. 기사·리포트의 저작권은 원저작자에게 있습니다. · 게시중단 요청