Physical Intelligence π0

2024-10-31 · Éditeur : Physical Intelligence · Domaine : Robotique

Physical Intelligence présente π0, un modèle vision-langage-action qui greffe une tête d'action par flow matching sur un VLM pré-entraîné pour piloter des robots très différents : bras simples, bimanuels et manipulateurs mobiles.

Ce qui change

  • Un seul modèle généraliste pilote plusieurs types de robots.
  • Le flow matching produit des actions continues et fluides, adaptées à la dextérité.
  • Le modèle hérite des connaissances du web via un VLM pré-entraîné.
  • Il plie du linge, débarrasse une table et monte des cartons.

### Ce qui change Le 31 octobre 2024, la jeune entreprise californienne Physical Intelligence publie π0 (« pi-zéro »), son premier modèle de fondation pour robots. C'est un modèle vision-langage-action (VLA) : il reçoit des images et une consigne en langage naturel, puis produit directement les commandes motrices du robot. ### Caractéristiques - **Architecture** : une tête d'action par *flow matching* (appariement de flux) greffée sur un modèle vision-langage pré-entraîné, pour hériter des connaissances sémantiques issues du web. - **Robots** : bras simples, systèmes à deux bras et manipulateurs mobiles, avec un seul modèle. - **Tâches démontrées** : pliage de linge, débarrassage de table, montage de cartons. - **Usages** : exécution zéro-shot après pré-entraînement, suivi d'instructions, apprentissage de nouvelles compétences par ajustement fin. - **Publication** : article arXiv 2410.24164, accepté à RSS 2025. Code et poids ouverts plus tard, le 4 février 2025, dans le dépôt openpi (Apache 2.0). ### Pourquoi c'est important π0 est l'un des premiers modèles à montrer qu'une même politique peut enchaîner des tâches longues et dextres sur des robots différents. Il installe le schéma que reprendront beaucoup d'acteurs en 2025 : un VLM comme « cerveau » sémantique, plus un expert d'action rapide. ### À retenir π0 marque le point de départ de la course aux « cerveaux » de robots généralistes. Physical Intelligence l'améliorera ensuite avec π0-FAST, π0.5, π*0.6 puis π0.7.

Liens

Tags : VLA, Modèle de fondation, Manipulation, Flow matching, Physical Intelligence