Pendant plusieurs années, l’intelligence artificielle générative a surtout été perçue comme un logiciel.
Elle écrivait.
Elle résumait.
Elle traduisait.
Elle répondait à des questions.
Elle créait des images.
Son univers était essentiellement numérique.
Cette frontière commence à disparaître.
Les mêmes principes utilisés pour comprendre un texte, une image ou une consigne sont désormais appliqués à des systèmes capables d’observer leur environnement et d’agir physiquement sur lui.
Un robot peut recevoir une instruction formulée en langage naturel.
Identifier les objets qui l’entourent.
Décomposer une tâche en plusieurs étapes.
Déplacer un bras.
Saisir un objet.
Vérifier si l’action a réussi.
Puis recommencer autrement si nécessaire.
L’intelligence artificielle ne se contente alors plus de produire une réponse.
Elle produit une action.
C’est ce passage du monde numérique au monde physique qui constitue l’une des mutations technologiques les plus importantes actuellement à l’œuvre.
Le robot industriel existe depuis longtemps
L’idée d’un robot travaillant dans une usine n’a évidemment rien de nouveau.
L’industrie automobile utilise des bras robotisés depuis plusieurs décennies.
Ils soudent.
Ils peignent.
Ils déplacent des pièces.
Ils répètent des gestes avec une précision et une cadence difficiles à maintenir pour un opérateur humain.
La robotisation industrielle est déjà massive.
Selon l’International Federation of Robotics, environ 5 millions de robots industriels étaient en fonctionnement dans les usines mondiales en 2025, après plus de 600 000 nouvelles installations au cours de cette seule année. IFR International Federation of Robotics
Ce qui change aujourd’hui n’est donc pas l’existence du robot.
C’est sa capacité à s’adapter.
Le robot industriel traditionnel est extrêmement efficace dans un environnement prévu pour lui.
Une pièce arrive à un endroit déterminé.
Le robot effectue un mouvement programmé.
La géométrie est connue.
Le processus est répétitif.
Lorsque l’environnement change, le système doit souvent être reprogrammé.
L’ambition actuelle est différente : permettre à la machine de comprendre suffisamment son environnement pour modifier elle-même son comportement.
De la programmation à l’instruction
Cette évolution peut être résumée par une différence simple.
Un robot traditionnel reçoit une suite d’ordres techniques.
Un robot utilisant des modèles d’intelligence artificielle peut recevoir un objectif.
« Range les objets présents sur cette table. »
Cette instruction paraît triviale pour un humain.
Pour une machine, elle suppose de résoudre plusieurs problèmes.
Il faut détecter les objets.
Comprendre lesquels peuvent être déplacés.
Identifier l’endroit où ils doivent aller.
Déterminer comment les saisir.
Planifier les mouvements.
Éviter les obstacles.
Contrôler la force appliquée.
Vérifier le résultat.
Et gérer les situations imprévues.
La difficulté n’est donc pas seulement de faire bouger un bras robotique.
Elle consiste à relier perception, raisonnement et action.
Les modèles multimodaux fournissent une partie de cette intelligence
Les modèles récents savent traiter simultanément plusieurs types d’informations.
Texte.
Images.
Vidéo.
Son.
Dans un robot, ces capacités peuvent être utilisées pour interpréter les informations provenant de caméras et de capteurs.
Le modèle ne voit pas seulement une matrice de pixels.
Il peut identifier qu’un objet est une tasse, qu’elle se trouve sur une table, qu’un autre objet bloque le passage ou qu’une personne vient d’entrer dans la zone de travail.
Cette compréhension n’est pas parfaite.
Elle peut produire des erreurs.
Mais elle permet de passer d’un système qui reconnaît essentiellement une configuration préprogrammée à un système capable de traiter des situations plus variées.
Google DeepMind distingue par exemple aujourd’hui deux fonctions complémentaires dans ses modèles de robotique : un modèle de raisonnement incarné, chargé de comprendre la situation et de planifier les étapes, et un modèle « vision-language-action » qui transforme perception et instructions en commandes motrices. Google DeepMind
Cette séparation illustre bien la nouvelle architecture du robot.
Une partie du système décide quoi faire.
Une autre traduit cette décision en mouvements physiques.
Agir est plus difficile que répondre
Une erreur produite par un chatbot peut être gênante.
Une erreur produite par une machine de plusieurs dizaines de kilogrammes peut être dangereuse.
Le passage dans le monde physique change donc profondément la nature du problème.
Un modèle de langage peut proposer une réponse imparfaite.
Un robot qui saisit le mauvais objet peut casser un équipement.
Un véhicule qui interprète mal une scène peut provoquer un accident.
Une machine industrielle qui choisit une mauvaise trajectoire peut blesser quelqu’un.
La fiabilité devient donc une exigence beaucoup plus forte.
Il ne suffit pas que le système produise souvent une bonne réponse.
Il faut également déterminer ce qu’il doit faire lorsqu’il ne sait pas.
S’arrêter.
Demander confirmation.
Passer la main à un opérateur.
Choisir une procédure plus conservatrice.
L’intelligence artificielle physique ne peut donc pas être pensée uniquement en termes de performances du modèle.
Elle doit être intégrée à une architecture de sécurité.
Le monde réel est beaucoup moins propre qu’un jeu de données
Un autre problème apparaît immédiatement : le monde physique est imprévisible.
La lumière change.
Un objet est déplacé.
Une caméra est partiellement masquée.
Une personne intervient.
Une pièce est légèrement différente.
Le sol glisse.
Une boîte est plus lourde que prévu.
Un objet se déforme lorsqu’il est saisi.
Une porte résiste.
Un modèle peut comprendre correctement la scène tout en échouant parce que la réalité physique ne correspond pas exactement à ce qu’il avait anticipé.
C’est l’une des raisons pour lesquelles la robotique générale progresse plus lentement que certaines applications purement numériques.
Il ne suffit pas de reconnaître un objet.
Il faut interagir correctement avec lui.
La manipulation reste un problème particulièrement difficile
Les humains utilisent leurs mains avec une facilité qui masque la complexité de la tâche.
Saisir une bouteille sans la faire tomber.
Attraper un tissu.
Tourner une clé.
Insérer une fiche.
Nouer un cordon.
Déplacer un objet fragile.
Ces actions demandent une combinaison extrêmement fine de vision, de toucher, de contrôle moteur et d’adaptation instantanée.
Les robots industriels traditionnels contournent largement ce problème en utilisant des environnements standardisés.
Les objets arrivent toujours dans des positions connues.
Des préhenseurs sont conçus pour une pièce précise.
Les trajectoires sont préparées à l’avance.
Un robot généraliste doit au contraire fonctionner dans un environnement beaucoup moins structuré.
Les progrès récents cherchent précisément à améliorer cette capacité de manipulation et de contrôle de l’ensemble du corps. Google DeepMind affirme par exemple que Gemini Robotics 2 peut contrôler des robots humanoïdes de la tête aux pieds, effectuer des tâches nécessitant davantage de dextérité et enchaîner des séquences d’actions plus longues. Il s’agit toutefois de résultats présentés par le développeur du système, et non de la démonstration que de tels robots peuvent déjà remplacer de manière générale les solutions industrielles existantes. Google DeepMind
Le robot humanoïde attire l’attention, mais il n’est pas la seule forme possible
L’humanoïde occupe une place particulière dans l’imaginaire technologique.
Deux bras.
Deux jambes.
Une tête.
Une silhouette humaine.
Cette forme possède un avantage conceptuel : notre environnement a été construit pour nous.
Les portes sont à notre hauteur.
Les escaliers correspondent à nos jambes.
Les outils sont conçus pour nos mains.
Les rayonnages, véhicules, machines et postes de travail supposent généralement un utilisateur humain.
Un robot de forme humaine pourrait donc théoriquement utiliser une infrastructure existante sans qu’il soit nécessaire de tout reconstruire autour de lui.
Mais cette polyvalence a un coût.
Marcher sur deux jambes est plus complexe que rouler.
Une main polyvalente est plus difficile à concevoir qu’une pince industrielle dédiée.
Maintenir l’équilibre augmente les risques de chute.
Un robot spécialisé peut donc être beaucoup plus efficace qu’un humanoïde pour une tâche donnée.
La question pertinente n’est donc pas de savoir si le robot du futur sera humanoïde.
Elle est de savoir quelle forme est la plus adaptée à la tâche.
La robotique spécialisée conservera probablement une place majeure
Dans un entrepôt, un robot mobile sur roues peut être préférable à un humanoïde.
Pour souder une carrosserie, un bras industriel fixé au sol est extrêmement efficace.
Pour inspecter une conduite, une petite machine conçue pour se déplacer dans un espace étroit peut être plus pertinente.
Pour travailler dans les airs, un drone possède un avantage évident.
Pour explorer un environnement dangereux, une machine à quatre pattes peut être préférable.
L’intelligence artificielle peut ainsi transformer de très nombreux types de machines sans leur donner une apparence humaine.
Le véritable changement est moins la forme du robot que le niveau d’autonomie qu’il peut acquérir.
Le modèle peut désormais fonctionner directement dans la machine
Cette évolution rejoint celle des petits modèles et de l’IA locale.
Un robot ne peut pas toujours dépendre d’une connexion permanente à un centre de données distant.
Les communications peuvent être lentes.
Instables.
Indisponibles.
Certaines informations peuvent être sensibles.
Et certaines décisions doivent être prises en quelques millisecondes.
Une partie de l’intelligence doit donc pouvoir fonctionner directement sur l’équipement.
Google DeepMind a ainsi développé une version de son modèle robotique destinée à fonctionner localement sur le matériel du robot, avec comme entrées le texte, les images et les informations internes sur la position de la machine, et comme sortie des actions physiques. Google DeepMind
Cette tendance dépasse largement la robotique.
Voitures.
Drones.
Caméras.
Machines industrielles.
Équipements médicaux.
Objets connectés.
De plus en plus de systèmes peuvent intégrer une capacité d’analyse directement à proximité des capteurs.
Le cloud reste cependant utile
L’opposition entre intelligence locale et cloud serait artificielle.
Un robot peut utiliser plusieurs niveaux de calcul.
Les réflexes les plus rapides peuvent être traités localement.
Une caméra peut détecter immédiatement un obstacle.
Un système embarqué peut contrôler les moteurs.
Un modèle local peut interpréter une instruction.
Des opérations moins urgentes peuvent être confiées à une infrastructure distante.
Mise à jour des modèles.
Analyse de données historiques.
Planification complexe.
Entraînement.
Coordination entre plusieurs équipements.
La robotique rejoint donc l’architecture hybride déjà observable dans le reste de l’intelligence artificielle.
Une partie de l’intelligence est embarquée.
Une autre reste centralisée.
Le passage à l’action transforme aussi la notion d’agent
Le terme « agent » est aujourd’hui largement utilisé pour désigner un système d’IA capable d’enchaîner plusieurs opérations.
Dans le monde logiciel, un agent peut rechercher une information, appeler une API, modifier un fichier ou déclencher une transaction.
Dans le monde physique, les mêmes principes prennent une autre dimension.
L’outil n’est plus une API.
C’est un bras.
Une roue.
Une pince.
Une caméra.
Une porte.
Une machine.
Un robot peut ainsi être considéré comme une forme d’agent dont les outils sont physiques.
Il observe.
Planifie.
Agit.
Vérifie.
Réessaie.
Cette continuité entre agent logiciel et robot est importante.
Elle montre que la robotique contemporaine n’est pas une évolution totalement séparée de l’IA générative.
Elle en constitue en partie le prolongement vers le monde physique.
Mais le réel impose une boucle permanente de vérification
Dans un logiciel, une tâche peut parfois être planifiée puis exécutée étape après étape.
Dans un environnement physique, cette logique est insuffisante.
Après chaque action, le système doit vérifier ce qui s’est réellement passé.
Le robot voulait saisir une boîte.
L’a-t-il réellement saisie ?
La boîte a-t-elle glissé ?
Un objet est-il tombé ?
Une personne s’est-elle placée devant lui ?
La tâche est-elle terminée ?
Les systèmes récents mettent donc de plus en plus l’accent sur la capacité à suivre l’évolution d’une tâche et à détecter les échecs.
Google DeepMind indique ainsi que ses modèles robotiques récents sont conçus pour exécuter des tâches en plusieurs étapes, contrôler leur progression et tenter une correction lorsque l’une des étapes échoue. Google DeepMind
Cette capacité est fondamentale.
L’autonomie n’est pas seulement la capacité à agir sans intervention humaine.
C’est aussi la capacité à reconnaître que l’action n’a pas produit le résultat attendu.
Plusieurs robots peuvent également coopérer
Une autre étape consiste à ne plus considérer chaque machine isolément.
Dans un entrepôt ou une usine, plusieurs robots peuvent être présents.
Ils peuvent avoir des capacités différentes.
Un robot mobile transporte.
Un bras manipule.
Un autre système inspecte.
Une architecture intelligente peut alors répartir les tâches entre eux.
Les travaux actuels sur la robotique explorent déjà cette coordination multi-robots. Gemini Robotics 2, par exemple, est présenté comme capable d’organiser une coopération entre différentes machines pour réaliser une tâche commune. Google DeepMind
À terme, l’unité pertinente pourrait donc ne plus être le robot.
Ce pourrait être l’ensemble du système robotisé.
La donnée devient le carburant du monde physique
Les grands modèles de langage ont bénéficié d’une quantité considérable de textes disponibles sous forme numérique.
La robotique rencontre un problème différent.
Il existe beaucoup moins de données décrivant précisément comment un robot doit déplacer son bras pour ouvrir un tiroir, saisir un objet ou manipuler une pièce inhabituelle.
Chaque corps robotique possède en outre ses propres dimensions.
Ses articulations.
Ses capteurs.
Ses limites mécaniques.
Produire les données nécessaires à l’apprentissage devient donc une question centrale.
Les démonstrations humaines peuvent être enregistrées.
Les robots peuvent être téléopérés.
Les interactions réelles peuvent fournir des exemples.
Des environnements simulés permettent également de générer des situations à grande échelle.
Le défi consiste ensuite à transférer ce qui a été appris vers la machine réelle.
La simulation permet de faire des erreurs sans conséquences
Un robot physique est coûteux.
Il s’use.
Il peut casser.
Son fonctionnement prend du temps réel.
Il est donc impossible d’apprendre uniquement en multipliant les erreurs dans le monde physique.
La simulation offre une autre voie.
Un environnement virtuel peut reproduire une usine, un entrepôt ou une pièce.
Le robot virtuel peut répéter une tâche des milliers de fois.
Les conditions peuvent être modifiées.
Position des objets.
Éclairage.
Frottements.
Poids.
Obstacles.
Le système peut ainsi apprendre dans un monde simulé avant de transférer une partie de cette expérience vers le monde réel.
Mais le passage de la simulation à la réalité reste difficile.
Aucune simulation ne reproduit parfaitement toutes les propriétés physiques du monde réel.
Le modèle doit donc conserver une capacité d’adaptation lorsqu’il quitte son environnement virtuel.
La robotisation progresse déjà sans attendre le robot généraliste
Il serait donc trompeur de réduire l’avenir de la robotique à la question :
« Quand aurons-nous des humanoïdes capables de tout faire ? »
L’automatisation physique progresse déjà à grande échelle avec des machines beaucoup plus spécialisées.
Les chiffres de l’IFR montrent qu’en 2025, le parc mondial de robots industriels a franchi le seuil des cinq millions d’unités. Les nouvelles installations ont dépassé 600 000 machines sur l’année. IFR International Federation of Robotics
La nouveauté est que ces équipements pourraient progressivement intégrer davantage de perception et de capacité d’adaptation.
Un robot n’a pas besoin d’être généraliste pour bénéficier de l’IA.
Même une machine dédiée peut devenir plus flexible.
Les démonstrations spectaculaires ne doivent pas être confondues avec une capacité industrielle
La robotique est particulièrement favorable aux vidéos impressionnantes.
Un humanoïde marche.
Court.
Danse.
Manipule un objet.
Effectue une série de mouvements complexes.
Mais une démonstration ne dit pas nécessairement comment le système fonctionnerait huit heures par jour dans une usine.
Il faut poser d’autres questions.
Quel est son taux d’échec ?
Combien d’interventions humaines sont nécessaires ?
Quelle est sa vitesse réelle ?
Combien coûte-t-il ?
Quelle est son autonomie énergétique ?
Combien de temps faut-il pour le réparer ?
Peut-il répéter la tâche plusieurs milliers de fois ?
Comment réagit-il à une situation nouvelle ?
Ces critères distinguent une prouesse technique d’un outil industriel.
Une enquête de Reuters publiée en août 2026 sur l’industrie chinoise des humanoïdes décrit précisément ce décalage : malgré des progrès rapides du matériel et des investissements importants, beaucoup de machines restent encore trop lentes, peu adaptables ou dépendantes de séquences fortement préparées pour concurrencer les robots industriels spécialisés dans de nombreux usages réels. Reuters
L’autonomie est donc une question de degré
Il est tentant de classer une machine comme autonome ou non autonome.
La réalité est plus graduelle.
Un robot peut être entièrement téléopéré.
Il peut automatiser seulement certains mouvements.
Il peut suivre une procédure tout en demandant l’aide d’un humain lorsqu’un événement inhabituel survient.
Il peut choisir entre plusieurs stratégies prédéfinies.
Il peut planifier une partie de la tâche.
Il peut apprendre de nouveaux gestes.
Chaque niveau modifie la répartition du travail entre l’humain et la machine.
Dans de nombreux contextes, l’objectif ne sera d’ailleurs pas de supprimer l’humain.
Il sera de déplacer son rôle.
L’opérateur pourra superviser plusieurs machines au lieu d’en contrôler une directement.
Il pourra intervenir seulement dans les situations ambiguës.
Il pourra enseigner une nouvelle tâche plutôt que programmer chaque mouvement.
Le travail humain sera probablement transformé avant d’être remplacé
Les débats sur la robotique se concentrent souvent sur le nombre d’emplois qui pourraient disparaître.
Mais la première transformation peut être beaucoup plus progressive.
Certaines tâches sont automatisées.
D’autres deviennent de la supervision.
De nouveaux métiers apparaissent autour de l’intégration, de la maintenance, de la sécurité ou de l’entraînement des systèmes.
Une même profession peut conserver son nom tout en changeant profondément.
L’impact dépendra également des secteurs.
Une usine très standardisée est plus facile à automatiser qu’un chantier désordonné.
Un entrepôt structuré offre un environnement plus prévisible qu’un domicile.
Une tâche répétitive avec des objets rigides est plus simple qu’une activité nécessitant manipulation fine et interaction humaine.
Il est donc difficile de parler de « remplacement par les robots » comme d’un processus uniforme.
La sécurité devient une propriété du système entier
Lorsque l’intelligence artificielle contrôle une machine, plusieurs formes de sécurité se rejoignent.
Sécurité mécanique.
Cybersécurité.
Fiabilité logicielle.
Qualité des capteurs.
Contrôle des accès.
Mise à jour des modèles.
Protection des communications.
Gestion des erreurs.
Un robot compromis informatiquement peut devenir un risque physique.
Un modèle défaillant peut produire une décision dangereuse.
Un capteur trompé peut entraîner une mauvaise interprétation.
Une mise à jour peut modifier le comportement de la machine.
La sécurité ne peut donc pas être ajoutée uniquement autour du modèle d’IA.
Elle doit couvrir toute la chaîne, du capteur jusqu’au moteur.
L’intelligence physique pose aussi la question de la responsabilité
Lorsque la machine se contente d’exécuter exactement un programme, l’analyse d’un incident est déjà parfois complexe.
Elle le devient davantage lorsque le système possède une capacité d’adaptation.
Pourquoi le robot a-t-il choisi cette trajectoire ?
Quelle information a-t-il mal interprétée ?
Le modèle a-t-il pris une décision incorrecte ?
Un capteur était-il défectueux ?
Le logiciel de contrôle a-t-il mal exécuté une décision correcte ?
L’intervention humaine était-elle attendue ?
Cette chaîne de responsabilité devra être pensée en même temps que l’autonomie elle-même.
Plus une machine dispose de liberté pour choisir ses actions, plus il devient important de pouvoir déterminer ce qui s’est produit et pourquoi.
La frontière entre machine et logiciel devient moins nette
Le développement de l’intelligence artificielle physique modifie finalement la manière de penser les objets eux-mêmes.
Un robot n’est plus uniquement une machine.
Il devient une plateforme logicielle.
Ses capacités peuvent évoluer sans modification mécanique majeure.
Un nouveau modèle peut améliorer la perception.
Une mise à jour peut ajouter une nouvelle tâche.
Un nouvel algorithme peut permettre d’exploiter différemment les mêmes capteurs.
L’intelligence devient ainsi une couche indépendante du corps qui l’exécute.
Google DeepMind travaille par exemple à transférer certaines capacités entre différentes morphologies robotiques, afin qu’une compétence apprise ne soit pas nécessairement liée à une seule machine. Google DeepMind
Si cette approche progresse, l’évolution d’un robot pourra ressembler davantage à celle d’un ordinateur ou d’un smartphone : le matériel constitue la plateforme, tandis qu’une partie croissante de ses capacités provient du logiciel.
Quand l’IA quitte l’écran, elle change de nature
L’intelligence artificielle que nous utilisons aujourd’hui est largement confinée à un environnement dans lequel ses erreurs restent numériques.
Un texte incorrect peut être supprimé.
Une image peut être régénérée.
Une réponse peut être ignorée.
Dans le monde physique, une décision possède des conséquences matérielles.
C’est pourquoi l’arrivée de l’IA dans les robots, les véhicules et les machines ne constitue pas simplement une nouvelle application de l’intelligence artificielle générative.
Elle impose de nouvelles exigences.
Comprendre l’espace.
Prendre en compte le temps.
Manipuler des objets.
Réagir à l’imprévu.
Contrôler son propre corps.
Évaluer le résultat de ses actions.
Respecter des contraintes de sécurité.
Et parfois savoir s’arrêter.
Les progrès récents montrent que cette transition a commencé.
Des modèles savent déjà associer vision, langage, raisonnement et action.
Certains peuvent fonctionner localement sur les robots.
La coordination de tâches complexes et de plusieurs machines est désormais un domaine actif de développement. Google DeepMind
Mais cela ne signifie pas que le robot généraliste capable de remplacer un humain dans n’importe quel environnement est arrivé.
Entre une démonstration réussie et une machine fiable, économique, sûre et capable de fonctionner quotidiennement pendant des années, l’écart reste considérable.
La véritable transformation pourrait d’ailleurs être moins spectaculaire.
Elle pourrait prendre la forme de millions de machines spécialisées devenant progressivement plus intelligentes, plus adaptables et plus faciles à commander.
Dans cette perspective, le changement essentiel ne sera pas l’apparition soudaine d’un robot universel.
Ce sera la diffusion progressive de l’intelligence dans les objets capables d’agir.
L’IA ne sera alors plus seulement un système avec lequel nous communiquons. Elle deviendra une composante des machines qui transforment directement le monde physique.
Commentaires 0
Aucun commentaire pour le moment.