Outils Intelligence Artificielle
Accueil/ Actualités/ Modèles/ Gemini Robotics 2 : Google fait bouger le robot entier, et publie ses taux de réussite
Modèles · 7 min de lecture

Gemini Robotics 2 : Google fait bouger le robot entier, et publie ses taux de réussite

Google DeepMind a présenté Gemini Robotics 2 le 30 juillet 2026. Ses propres taux de réussite, publiés dans l'annonce, disent ce qui bloque encore.

Illustration

Le 30 juillet 2026, Google DeepMind a publié un billet signé Carolina Parada pour présenter Gemini Robotics 2, sa nouvelle famille de modèles pour la robotique. L'argument est résumé dans le titre de l'annonce : l'« intelligence du corps entier ». Là où la génération précédente ne pilotait que le haut du corps d'un humanoïde pour des tâches de plan de travail, le nouveau modèle contrôle la machine complète, des pieds au bout des doigts, et peut faire travailler plusieurs robots ensemble.

L'annonce est spectaculaire en vidéo. Elle est aussi, et c'est plus rare, accompagnée de graphiques de résultats chiffrés. Ce sont ces chiffres qui rendent l'exercice intéressant, parce qu'ils disent noir sur blanc ce qui sépare encore une démonstration DeepMind d'un robot utile dans un atelier ou une cuisine.

À retenir · l'essentiel
Le faitGoogle DeepMind annonce Gemini Robotics 2 le 30 juillet 2026, une famille de trois modèles pour piloter des robots.
La nouveautéLe contrôle du corps entier d'un humanoïde, la dextérité à cinq doigts, et la collaboration entre robots de types différents.
Ce qui est ouvertSeul le modèle de raisonnement, Gemini Robotics ER 2, est accessible à tous via l'API Gemini et Google AI Studio.
Ce qui coinceSur quatre des cinq tâches à cinq doigts, Google publie lui-même des taux de réussite de 32 % à 44 %.
Le billet officiel de Google DeepMind, daté du 30 juillet 2026 et signé Carolina Parada, ouvre sur une démonstration de l'humanoïde Apollo 2 d'Apptronik.
Le billet officiel de Google DeepMind, daté du 30 juillet 2026 et signé Carolina Parada, ouvre sur une démonstration de l'humanoïde Apollo 2 d'Apptronik.

Trois modèles, et un seul est vraiment disponible

C'est le point que les reprises de presse escamotent le plus souvent. Gemini Robotics 2 n'est pas un produit, c'est une pile à trois étages, et ces trois étages n'ont pas du tout le même statut commercial.

ModèleRôleDisponibilité au 31 juillet 2026
Gemini Robotics ER 2Le cerveau. Modèle vision-langage de raisonnement incarné : il comprend la consigne, observe la pièce, planifie les étapes et appelle des outilsOuvert aux développeurs via l'API Gemini et Google AI Studio (identifiant `gemini-robotics-er-2-preview`). Aperçu privé sur Gemini Enterprise Agent Platform
Gemini Robotics 2Les muscles. Modèle vision-langage-action qui traduit l'image et la consigne en commandes moteur, sur humanoïde complet ou robot bi-brasPartenaires en accès anticipé uniquement
Gemini Robotics On-Device 2Les muscles, en local. Même rôle, mais exécuté sur le robot, sans réseau ni latence internetPartenaires en accès anticipé uniquement

Autrement dit : un développeur peut, dès aujourd'hui, brancher le raisonnement de Gemini sur ses propres caméras et sa propre API robot. Il ne peut pas récupérer le modèle qui fait bouger l'Apollo 2 de la vidéo. Google l'assume, et le message publié le jour même côté Google AI Studio le dit sans détour.

𝕏Logan Kilpatrick (@OfficialLoganK) · 30 juillet 2026 · traduit de l'anglais
Gemini Robotics ER 2 est disponible dans l'API Gemini et Google AI Studio. Les démos de ce modèle en action sont vraiment cool : ) regardez en particulier la collaboration multi-robots, ça a été mon moment wahou.
Voir le post sur X

Ce que les chiffres de Google disent vraiment

Le billet de DeepMind publie trois graphiques de taux de réussite, obtenus avec un seul et même point de contrôle du modèle sur trois corps de robot différents. Voici ce qu'ils contiennent, tel que Google les annonce.

TâcheRobot et préhenseurTaux de réussite annoncé par Google
Insertion préciseFranka F3 Duo, pince Robotiq89,6 %
Rangement d'outils variésFranka F3 Duo, pince Robotiq78,9 %
Attraper sur une étagèreApollo 2, mains Inspire76,3 %
Attraper sur une tableApollo 2, mains Inspire68,4 %
Attraper au solApollo 2, mains Inspire45,7 %
Dévisser une ampouleApollo 2, mains SharpaWave92 %
Nouer un sac poubelleApollo 2, mains SharpaWave44 %
Fermer un sachet zipApollo 2, mains SharpaWave40 %
Visser une ampouleApollo 2, mains SharpaWave36 %
Ramasser avec pelle et balayetteApollo 2, mains SharpaWave32 %

La lecture est nette. Avec une pince à deux doigts, on est dans les eaux d'un équipement industriel utilisable. Avec une main à cinq doigts, on est encore dans la recherche : un robot qui réussit une opération de balayage une fois sur trois n'est pas un robot qu'on laisse faire le ménage. Google ne s'en cache d'ailleurs pas, et l'écrit dans la légende de son propre graphique.

Si Gemini Robotics 2 atteint un taux de réussite moyen à élevé sur les tâches de corps entier et de dextérité à la pince, la manipulation dextre multi-doigts reste difficile.
Google DeepMind, légende du graphique de résultats

Le contraste entre le 92 % du dévissage d'ampoule et le 36 % du vissage dit tout de la nature du problème : une même paire de mains, un même objet, et un écart de 56 points selon le sens du geste. La difficulté n'est pas de comprendre la consigne, elle est d'exécuter un mouvement fin sous contrainte physique.

Le vrai progrès est ailleurs : le robot sait où il en est

Le saut le plus concret de cette génération concerne ER 2, et il porte sur le temps. Le modèle traite désormais des flux vidéo continus venus des caméras du robot, au lieu d'images fixes. Il peut donc suivre l'avancement d'une tâche pendant qu'elle se déroule, repérer un échec en cours de route et reprendre l'étape ratée plutôt que de tout relancer depuis le début.

Google mesure cette capacité sur deux épreuves maison. La première, la classification d'avancement, consiste à ranger chaque image de la vidéo dans l'une des cinq tranches d'achèvement (0 à 20 %, 20 à 40 % et ainsi de suite). La seconde, le repérage d'instant, consiste à trouver l'image exacte où survient l'événement critique, par exemple le moment où il faut arrêter de verser le café.

Les mesures annoncées par Google DeepMind
57,4 %
de précision sur la classification d'avancement d'une tâche
91,3 %
de précision sur le repérage de l'instant clé, à 0,96 seconde près en moyenne
moins de 200
exemples pour adapter le modèle embarqué à un robot bi-bras inédit
22
degrés de liberté sur la main SharpaWave à cinq doigts de l'Apollo 2

Ce 57,4 % mérite qu'on s'y arrête, car plusieurs reprises l'ont arrondi à « près de 60 % ». Sur une échelle à cinq tranches, le hasard donnerait 20 %. Le modèle fait donc bien mieux que le hasard, et mieux que la génération précédente selon Google, mais il se trompe encore de tranche dans plus de quatre cas sur dix. C'est suffisant pour déclencher une reprise d'étape, ce n'est pas suffisant pour piloter une chaîne de production sans surveillance.

Côté matériel, ER 2 s'intègre à la Gemini Live API, avec un point de terminaison en flux bidirectionnel pensé pour la latence. C'est ce qui permet à Google d'orchestrer les API du Spot de Boston Dynamics dans une démonstration où le robot va chercher un paquet de pop-corn, avec le code publié sur GitHub. La collaboration multi-robots, elle, est illustrée par l'Apollo 2 d'Apptronik et le Franka F3 Duo qui se répartissent une tâche sans se gêner.

Sécurité : un nouveau benchmark, publié mais sous conditions

C'est le volet le mieux construit de l'annonce. Google introduit ASIMOV-Agentic, un banc d'essai dédié à l'orchestration sûre et à la gestion de l'incertitude. Il évalue notamment trois choses : la capacité de l'agent de raisonnement à refuser un appel d'outil dangereux venu du modèle d'action, sa capacité à juger si une tâche est physiquement réalisable, et sa capacité à demander l'aide d'un humain quand il n'est pas sûr.

DeepMind présente ER 2 comme son modèle de robotique le plus sûr à ce jour sur ses épreuves de respect des consignes de sécurité et de proximité humaine : le modèle arrête l'humanoïde quand une personne s'approche trop, et ne reprend le travail qu'une fois la zone dégagée. Un rapport technique dédié à la sécurité accompagne le tout.

!
Le benchmark est public, l'accès ne l'est pas tout à fait

ASIMOV-Agentic est bien déposé sur Hugging Face (`google/asimov_agentic`) avec ses jeux de données et ses quatre scripts d'évaluation. Mais le dépôt est sous conditions : il faut se connecter et accepter de partager ses coordonnées pour accéder aux fichiers. Point notable en revanche, le harnais d'évaluation fourni par Google prévoit explicitement de tester des modèles concurrents, y compris ceux d'OpenAI et d'Anthropic.

Le fil des versions
Mars 2025Gemini Robotics, première famille de modèles robotiques bâtie sur Gemini 2.0.
Septembre 2025Gemini Robotics 1.5 introduit le transfert de mouvement entre corps de robot.
Avril 2026Gemini Robotics-ER 1.6 renforce le raisonnement incarné.
30 juillet 2026Gemini Robotics 2 ajoute le corps entier, la dextérité à cinq doigts et la collaboration multi-robots.
𝕏Demis Hassabis (@demishassabis) · 30 juillet 2026 · traduit de l'anglais
Gemini Robotics 2 est là. Avec notre nouvelle suite de modèles, les robots peuvent désormais raisonner sur chacun de leurs mouvements pour gérer des tâches qui n'étaient pas possibles avant, comme nouer des nœuds délicats, et même faire équipe pour résoudre des flux de travail complexes. Bravo à l'équipe robotique pour cette belle étape !
Voir le post sur X

Pour un lecteur français, la comparaison la plus parlante reste Robostral Navigate, le modèle de navigation robotique de Mistral publié le 7 juillet. Les deux approches ne visent pas la même couche : Mistral fait avancer un robot vers un lieu à partir d'une seule caméra, Google fait manipuler des objets à un humanoïde complet. Le point commun est le même verrou, la fiabilité du geste, que ni l'un ni l'autre ne prétend avoir levé.

Astuce

Si vous voulez tester la brique disponible sans robot, ER 2 s'utilise comme n'importe quel modèle de l'API Gemini : une image ou une vidéo, une question spatiale, et vous jugez la qualité du raisonnement incarné. C'est le seul moyen honnête de se faire un avis avant que les modèles d'action ne s'ouvrent.

Questions fréquentes

Gemini Robotics 2 est-il disponible pour tout le monde ?

Non. Seul Gemini Robotics ER 2, le modèle de raisonnement, est ouvert via l'API Gemini et Google AI Studio. Les deux modèles d'action restent réservés à des partenaires en accès anticipé.

Quelle différence entre Gemini Robotics 2 et Gemini Robotics ER 2 ?

ER 2 est un modèle vision-langage qui raisonne, planifie et suit l'avancement. Gemini Robotics 2 est un modèle vision-langage-action qui produit les commandes moteur. Le premier pilote le second.

Faut-il écrire Gemini Robotics 2 ou 2.0 ?

Le billet officiel de Google DeepMind écrit « Gemini Robotics 2 » partout, sans décimale. La forme « 2.0 » vient de titres de presse.

Sur quels robots ces modèles fonctionnent-ils ?

Les démonstrations montrent l'Apollo 2 d'Apptronik et le Franka F3 Duo. Google cite Apptronik, Boston Dynamics et Agile Robots comme partenaires, et son modèle embarqué a été adapté aux plateformes Dexmate, SO101 et Trossen.

Est-ce lié à l'application Gemini que j'utilise ?

Non. Gemini grand public reste un assistant conversationnel, adossé à la gamme de modèles Gemini et comparable à ChatGPT. Gemini Robotics 2 est une famille de modèles distincte, destinée aux constructeurs de robots.