Meta V-JEPA 2
2025-06-11 · Éditeur : Meta · Domaine : Robotique
Meta publie V-JEPA 2, un modèle du monde vidéo auto-supervisé pré-entraîné sur plus d'un million d'heures de vidéos, dont la variante V-JEPA 2-AC planifie des gestes de robot sans données collectées dans l'environnement cible.
Ce qui change
- Pré-entraînement auto-supervisé sur plus d'un million d'heures de vidéos internet.
- V-JEPA 2-AC est post-entraîné avec moins de 62 heures de vidéos de robots.
- Prise et dépose d'objets en zéro-shot sur des bras Franka, dans deux laboratoires.
- Code et modèles publiés, majoritairement sous licence MIT.
### Ce qui change Le 11 juin 2025, Meta publie V-JEPA 2, un modèle vidéo fondé sur l'architecture JEPA (*joint-embedding predictive architecture*) défendue par Yann LeCun. Le modèle apprend à comprendre et à prédire le monde en observant des vidéos, sans annotation, puis s'adapte à la planification de gestes robotiques avec très peu de données. ### Caractéristiques - **Pré-entraînement** : auto-supervisé, sur un jeu de vidéos et d'images comprenant plus d'un million d'heures de vidéos internet. - **Compréhension** : 77,3 % de précision top-1 sur Something-Something v2 et 39,7 de rappel à 5 sur Epic-Kitchens-100 pour l'anticipation d'actions (scores publiés par les auteurs). - **Robotique** : la variante V-JEPA 2-AC, conditionnée par les actions, est post-entraînée avec moins de 62 heures de vidéos de robots non annotées issues du jeu de données DROID. - **Démonstration** : prise et dépose d'objets en zéro-shot sur des bras Franka dans deux laboratoires, par planification vers une image objectif, sans données collectées sur place ni récompense. - **Ouverture** : code et poids publiés, majoritairement sous licence MIT. ### Pourquoi c'est important V-JEPA 2 défend une alternative aux modèles génératifs : prédire dans un espace de représentations plutôt que pixel par pixel. Il montre qu'un modèle du monde appris sur le web peut piloter un robot avec très peu de données propres au robot. ### À retenir Meta entre dans la course des modèles du monde pour la robotique avec une approche ouverte et auto-supervisée ; V-JEPA 2.1 suivra en mars 2026.
Liens
Tags : Modèle du monde, Apprentissage auto-supervisé, Meta, Open Source