Stanford OpenVLA
2024-06-13 · Éditeur : Stanford, UC Berkeley et Toyota Research Institute · Domaine : Robotique
OpenVLA, modèle vision-langage-action de 7 milliards de paramètres entraîné sur 970 000 démonstrations réelles, devient la référence ouverte des VLA, publiée sous licence MIT.
Ce qui change
- 7 milliards de paramètres, bâtis sur Llama 2 et les encodeurs DINOv2 et SigLIP.
- Entraînement sur 970 000 démonstrations robotiques réelles.
- +16,5 points de réussite face à RT-2-X (55 Md), selon les auteurs.
- Code et poids ouverts sous licence MIT.
### Ce qui change Le 13 juin 2024, une équipe menée par Stanford et l'université de Californie à Berkeley, avec le Toyota Research Institute, publie OpenVLA. Jusque-là, les modèles vision-langage-action (VLA) les plus avancés, comme RT-2, restaient fermés. OpenVLA met à disposition un VLA complet, avec ses poids et une méthode d'ajustement fin. ### Caractéristiques - **Taille** : 7 milliards de paramètres. - **Architecture** : le modèle de langage Llama 2, associé à un encodeur visuel qui fusionne les représentations de DINOv2 et de SigLIP. - **Données** : 970 000 démonstrations de robots réels. - **Résultats** : 16,5 points de réussite absolue de plus que RT-2-X (55 milliards de paramètres) sur 29 tâches, avec 7 fois moins de paramètres (scores publiés par les auteurs). - **Licence** : code et poids sous licence MIT. ### Pourquoi c'est important OpenVLA démocratise le schéma VLA : un modèle vision-langage pré-entraîné sur le web, prolongé par un apprentissage sur des actions de robots. Il devient un point de comparaison obligé pour les travaux qui suivent, dont π0 et SmolVLA. ### À retenir Avec OpenVLA, n'importe quel laboratoire peut ajuster un VLA de 7 milliards de paramètres à son robot, là où ces modèles étaient jusqu'alors réservés à quelques grands groupes.
Liens
Tags : VLA, Open Source, Manipulation, Llama 2