Le fait
Le 25 septembre 2025, Google DeepMind dévoile Gemini Robotics 1.5 et Gemini Robotics-ER 1.5, deux modèles conçus pour faire passer les robots du réactif à l’agentique. Architecture en duo : Robotics-ER 1.5 agit comme cerveau haut niveau (raisonnement spatial, planification multi-étapes, estimation de progrès, appels natifs à des outils numériques dont Google Search et fonctions tierces) ; Robotics 1.5, modèle vision-language-action (VLA), convertit les consignes en commandes motrices après un raisonnement interne en langage naturel. Exemples cités : trier linge clair/foncé, faire une valise selon la météo de Londres, trier déchets selon règles locales trouvées en ligne. Robotics-ER 1.5 est disponible en preview via l’API Gemini / Google AI Studio ; Robotics 1.5 reste réservé à des partenaires sélectionnés.
Contexte
La famille Gemini Robotics avait été introduite en mars 2025, puis déclinée On-Device en juin. La version 1.5 s’appuie sur le socle multimodal Gemini et ajoute trois leviers : (1) Embodied Thinking — le VLA intercale actions et chaînes de raisonnement, découpe les tâches longues et explique ses choix ; (2) Motion Transfer — un même modèle apprend sur des embodiments hétérogènes (ALOHA 2, Franka bi-bras, humanoïde Apptronik Apollo) et transfère des skills en zero-shot ; (3) raisonnement spatial SOTA sur 15 benchmarks académiques (ERQA, Point-Bench, etc.). Sécurité : filters sémantiques, respect des contraintes physiques (payload…), sous-systèmes collision onboard, et upgrade du benchmark ASIMOV. DeepMind positionne le duo comme jalon vers une AGI « dans le monde physique ».
Pourquoi ça compte
Jusqu’ici, la plupart des VLA exécutaient une consigne isolée. Ici, le robot cherche, planifie, agit, évalue — boucle closed-loop alignée sur les agents logiciels, mais ancrée dans la physique. Le transfert cross-embodiment attaque le coût historique du re-training par morphologie. Pour intégrateurs et OEM, le signal est double : une couche de planning ouverte (ER via API) et une couche d’actuation encore contrôlée (partenaires). Limite : la preuve terrain hors démos DeepMind, la latence du thinking budget, et la dépendance à l’écosystème Google Search / Gemini pour les outils.
Lecture Neurone21
Gemini Robotics 1.5 illustre la thèse « physical agents = cerveau + corps + outils ». Pour décideurs FR/EU : (1) tester Robotics-ER 1.5 dès maintenant comme planificateur multimodal sans attendre le VLA partenaire ; (2) exiger des interfaces ouvertes (fonctions user-defined) pour ne pas verrouiller la flotte à un seul VLA ; (3) croiser avec Isaac GR00T / Cosmos (NVIDIA), OM1 (OpenMind) et les stacks européens ROS 2. À suivre : trusted tester program, tech report, et premiers déploiements partenaires Apollo / Franka.
Sources : DeepMind — Gemini Robotics 1.5 (25/09/2025) · Google Developers Blog — Robotics-ER 1.5 · The Verge — robots + web search · The Decoder — agentic Gemini Robotics.