Gemini Robotics 2 : le nouveau cerveau de Google DeepMind pour les robots adaptatifs

  • Google DeepMind présente Gemini Robotics 2, un modèle de vision, de langage et d'action qui contrôle des robots entièrement humanoïdes.
  • Il comprend trois modèles : VLA pour l’exécution, ER 2 pour le raisonnement et On-Device 2 pour le fonctionnement local.
  • Elle permet d'effectuer des tâches de précision telles que faire des nœuds ou dévisser des ampoules, avec des taux de réussite supérieurs à 90 %.
  • Les robots peuvent collaborer entre eux et le système s'arrête automatiquement si une personne s'approche.

Gemini Robotics 2 de Google DeepMind

Google DeepMind franchit une étape majeure en robotique avec le lancement de Gemini Robotics 2, son modèle de vision, de langage et d'action le plus avancé . Cette nouvelle couche d'intelligence promet de transformer les robots en machines véritablement adaptables, capables de raisonner sur chaque mouvement et d'exécuter des tâches complexes dans des environnements réels. L'entreprise le présente comme un cerveau universel pouvant être installé sur tout type de robot, des bras industriels aux humanoïdes complets.

Le système est structuré autour de trois modèles spécialisés fonctionnant de concert. Le modèle VLA (Vision, Langage et Action) traduit les instructions en mouvements physiques. Le modèle ER 2, véritable cerveau du système, planifie les tâches et communique avec les humains. Enfin, le modèle On-Device 2 est optimisé pour fonctionner localement sur le robot, sans connexion internet. Cette architecture permet au robot de penser et d'agir simultanément , éliminant ainsi les pauses fréquentes dans les systèmes similaires jusqu'à présent.

Gemini sur Google Home
Article connexe:
Gemini sur Google Home : tout ce que vous devez savoir sur son déploiement et ses nouveautés

Trois modèles pour une intelligence robotique complète

Modèles Gemini Robotics 2

Le modèle VLA (Vision, Langage et Action) contrôle directement le corps du robot. Pour la première fois, il permet de gérer des humanoïdes complets, des orteils aux mains , leur permettant de marcher, de s'accroupir, de s'étirer et de manipuler des objets avec dextérité. Lors des tests, il a démontré une précision de 90 % pour les tâches d'insertion avec des pinces robotisées et de 92 % pour le dévissage d'ampoules grâce à des mains à cinq doigts et 22 degrés de liberté.

Le modèle ER 2 de Gemini Robotics, quant à lui, mise sur le raisonnement intégré. Il agit comme un agent observant son environnement, planifiant des séquences en plusieurs étapes et se coordonnant avec le VLA pour les exécuter . Il peut recourir à des outils externes, tels que la recherche Google, lorsqu'il a besoin d'informations complémentaires et est capable d'analyser des flux vidéo en temps réel pour suivre l'avancement des tâches. Selon Google, ce modèle atteint une précision de 57,4 % dans l'estimation de la progression et de 91,3 % dans l'identification des événements clés, avec une marge d'erreur inférieure à une seconde.

Le troisième modèle, Gemini Robotics On-Device 2, est conçu pour fonctionner hors ligne. Il peut s'adapter à un robot entièrement nouveau en quelques heures seulement, grâce à un entraînement de moins de 200 exemples . Il est ainsi idéal pour les environnements où la latence ou la confidentialité sont essentielles, comme les usines ou les objets connectés dans les habitations.

Maîtrise totale du corps et dextérité sans précédent

Robot humanoïde avec Gemini Robotics 2

L'une des nouveautés les plus marquantes est le contrôle complet du corps. Alors que les modèles précédents ne contrôlaient que la partie supérieure du robot pour les tâches sur une table, Gemini Robotics 2 étend l'intelligence artificielle physique aux mouvements de l'ensemble du corps. Les robots peuvent désormais marcher, s'accroupir, s'étirer et manipuler des objets tout en planifiant des actions complexes . Lors de démonstrations, le robot Apollo 2 d'Apptronik, équipé de mains SharpaWave, a pu ranger des étagères et faire des nœuds avec une précision absolue.

La motricité fine s'est également remarquablement améliorée. Le modèle peut contrôler la préhension à deux doigts parallèles pour les tâches exigeant de la force, ainsi que la préhension à cinq doigts pour les gestes délicats. Parmi les compétences démontrées, on peut citer la fermeture de sacs, la réalisation de nœuds, le dévissage d'ampoules et l'assemblage de petites pièces . Google a publié des données confirmant ces capacités : les tâches d'insertion précises atteignent un taux de réussite de 90 % et les tâches de dévissage, un taux de réussite de 92 %.

Mangue et avocat, les nouveaux modèles d'IA de Meta
Article connexe:
Mangue et avocat : ce sont les nouveaux modèles d’IA de Meta.

Collaboration entre robots et raisonnement en temps réel

Collaboration multi-robots

Une autre innovation majeure réside dans la capacité à coordonner plusieurs robots au sein d'un même espace de travail. Le Gemini Robotics ER 2 permet à différents types de machines de partager une compréhension commune de leur environnement et de se répartir les tâches . Lors d'un test, un robot Franka F3 Duo a placé des objets dans des boîtes tandis que l'humanoïde Apollo 2 les déposait sur une étagère. Selon Google, aucun des deux n'aurait pu accomplir cette tâche seul, mais leur collaboration a permis de la mener à bien.

Le système intègre également un suivi de progression en temps réel. Grâce à une analyse continue de la vidéo capturée par le robot, le modèle classe chaque image sur une échelle à cinq niveaux, du début à la fin de l'activité. En cas de problème inattendu, le robot peut localiser précisément la panne et reprendre son exécution après correction , sans avoir à redémarrer l'intégralité du processus. Cela représente une amélioration significative par rapport aux versions précédentes, où la moindre erreur nécessitait de recommencer depuis le début.

Sécurité et disponibilité pour les développeurs

La sécurité dans Gemini Robotics 2

Google a particulièrement insisté sur la sécurité de cette nouvelle génération. Le modèle repose sur une approche multicouche intégrant des systèmes de protection robustes et un nouvel outil d'évaluation, ASIMOV-Agentic , qui vérifie si les robots refusent les commandes dangereuses, détectent les situations incertaines et s'arrêtent lorsqu'une personne s'approche de trop près. Lors de démonstrations, le système a pu interrompre automatiquement le mouvement d'un robot humanoïde dès la détection d'un humain dans sa zone de travail et reprendre son activité une fois la zone dégagée.

Gemini Robotics ER 2 est désormais disponible pour les développeurs via l'API Gemini, Google AI Studio et en avant-première privée sur la plateforme Gemini Enterprise Agent. Les modèles VLA et On-Device 2, quant à eux, sont réservés aux partenaires bénéficiant d'un accès anticipé . Google prévoit que cette technologie accélérera l'adoption des robots dans des secteurs tels que la logistique, l'industrie et la domotique, où la polyvalence et la sécurité sont essentielles.

L'association du raisonnement continu, de la conscience environnementale, de la planification en plusieurs étapes, de la collaboration entre robots et de l'intégration avec des outils externes positionne Gemini Robotics 2 comme l'une des innovations les plus abouties de DeepMind à ce jour. Avec cette version, Google réaffirme son engagement envers l'intelligence artificielle physique, avec pour objectif de permettre aux robots d'accomplir toutes les tâches qu'un humain pourrait réaliser, du remplissage du lave-vaisselle au travail en usine, le tout avec la fluidité et la sécurité nécessaires à une coexistence harmonieuse avec les humains.

ChatGPT
Article connexe:
GPT-5 réorganise ChatGPT : changements clés, limites et débat

Ajouter comme source préférée dans Google