Physical Intelligence π*0.6 et Recap

2025-11-18 · Éditeur : Physical Intelligence · Domaine : Robotique

Physical Intelligence présente π*0.6 et la méthode Recap, qui permet à un VLA de s'améliorer par apprentissage par renforcement à partir de ses propres déploiements et des corrections d'opérateurs humains.

Ce qui change

  • Recap : apprentissage par renforcement via des politiques conditionnées par l'avantage.
  • Mélange démonstrations, données autonomes et corrections téléopérées.
  • Plie du linge chez des particuliers, monte des cartons, prépare des expressos.
  • Débit plus que doublé et échecs environ divisés par deux sur les tâches les plus dures, selon les auteurs.

### Ce qui change Le 18 novembre 2025, Physical Intelligence publie sur arXiv les travaux sur π*0.6 (« pi-étoile 0.6 ») et la méthode Recap (*RL with Experience and Corrections via Advantage-conditioned Policies*). La question posée : comment un modèle vision-langage-action peut-il continuer à progresser une fois déployé dans le monde réel ? ### Caractéristiques - **Méthode Recap** : un apprentissage par renforcement adapté aux VLA grâce à des politiques conditionnées par l'« avantage » (l'écart entre le résultat d'une action et le résultat attendu). - **Données hétérogènes** : démonstrations, données collectées en autonomie et interventions d'experts en téléopération pendant l'exécution. - **π*0.6** : un VLA généraliste pré-entraîné par apprentissage par renforcement hors ligne, puis spécialisé par collecte de données sur le robot. - **Tâches** : pliage de linge dans de vraies maisons, montage fiable de cartons, préparation d'expressos avec une machine professionnelle. - **Résultats** : sur certaines des tâches les plus difficiles, le débit fait plus que doubler et le taux d'échec est à peu près divisé par deux (résultats publiés par les auteurs). ### Pourquoi c'est important L'imitation seule plafonne. Recap montre qu'un robot peut apprendre de sa propre expérience et des corrections humaines, ce qui ouvre la voie à des robots qui s'améliorent en production. ### À retenir Physical Intelligence ajoute l'apprentissage par l'expérience à sa lignée de modèles ; π0.7 suivra en avril 2026.

Liens

Tags : VLA, Apprentissage par renforcement, Physical Intelligence, Déploiement réel