ByteDance Research GR-2
2024-10-08 · Éditeur : ByteDance Research · Domaine : Robotique
ByteDance Research présente GR-2, un agent robotique pré-entraîné sur 38 millions de clips vidéo du web pour apprendre la dynamique du monde, puis ajusté pour générer à la fois la vidéo et les actions.
Ce qui change
- Pré-entraînement sur 38 millions de clips vidéo et plus de 50 milliards de jetons.
- Le modèle prédit conjointement la vidéo future et les actions du robot.
- 97,7 % de réussite moyenne sur plus de 100 tâches, selon les auteurs.
- Les performances progressent avec la taille du modèle.
### Ce qui change Le 8 octobre 2024, ByteDance Research, la branche de recherche du groupe chinois propriétaire de TikTok, publie GR-2, un modèle vidéo-langage-action génératif pour la manipulation robotique. L'idée : apprendre d'abord comment le monde évolue en regardant d'immenses volumes de vidéos internet, avant d'apprendre à agir. ### Caractéristiques - **Pré-entraînement** : 38 millions de clips vidéo et plus de 50 milliards de jetons issus du web. - **Ajustement** : entraînement sur des trajectoires de robots pour générer à la fois la vidéo future et les actions. - **Résultats** : 97,7 % de réussite moyenne sur plus de 100 tâches (scores publiés par les auteurs), avec une bonne généralisation à des décors, environnements, objets et tâches inédits. - **Passage à l'échelle** : les auteurs observent que les performances augmentent avec la taille du modèle. ### Pourquoi c'est important GR-2 illustre une voie concurrente du VLA classique : plutôt que de partir d'un modèle vision-langage, il s'appuie sur la génération vidéo pour acquérir une intuition physique. Cette approche prépare les « modèles monde-action » qui se multiplieront en 2025 et 2026. ### À retenir ByteDance s'impose dès 2024 comme un acteur sérieux des modèles robotiques ; GR-3 suivra en juillet 2025.
Liens
Tags : VLA, Vidéo générative, Manipulation, ByteDance