ByteDance Seed GR-3 et ByteMini
2025-07-21 · Éditeur : ByteDance Seed · Domaine : Robotique
ByteDance Seed publie GR-3, un grand modèle vision-langage-action qui généralise à des objets et consignes inédits, et ByteMini, un robot mobile à deux bras conçu pour l'exécuter.
Ce qui change
- GR-3 est un VLA à grande échelle, co-entraîné sur des données vision-langage du web.
- Ajustement efficace avec des trajectoires humaines collectées en réalité virtuelle.
- ByteMini : robot mobile bimanuel conçu pour GR-3.
- GR-3 dépasse π0 sur de nombreuses tâches difficiles, selon les auteurs.
### Ce qui change Le 21 juillet 2025, l'équipe Seed de ByteDance publie le rapport technique de GR-3, successeur de GR-2. Il s'agit cette fois d'un grand modèle vision-langage-action (VLA), accompagné d'un robot maison, ByteMini. ### Caractéristiques - **Généralisation** : objets, environnements et consignes inédits, y compris des instructions faisant appel à des concepts abstraits. - **Recette d'entraînement** : co-entraînement avec des données vision-langage à l'échelle du web, ajustement fin efficace à partir de trajectoires humaines collectées avec des casques de réalité virtuelle, et apprentissage par imitation sur des trajectoires de robots. - **Tâches** : tâches longues et dextres, manipulation à deux bras et déplacements. - **ByteMini** : un robot mobile bimanuel conçu pour la flexibilité et la fiabilité, qui exécute GR-3. - **Résultats** : GR-3 surpasse π0 sur un large éventail de tâches difficiles en conditions réelles (résultats publiés par les auteurs). ### Pourquoi c'est important ByteDance passe du modèle de recherche au couple modèle-robot, comme Figure ou 1X. L'usage de la réalité virtuelle pour collecter des démonstrations humaines peu coûteuses est un levier pour réduire la dépendance à la téléopération. ### À retenir GR-3 confirme la montée en puissance des grands groupes technologiques chinois dans les modèles robotiques généralistes.
Liens
Tags : VLA, Manipulation mobile, Bimanuel, ByteDance