Meta V-JEPA 2 (1,2B params)
Le 11 juin 2025, Meta (FAIR) dévoile V-JEPA 2, un world model vidéo de 1,2 milliard de paramètres, conçu pour comprendre le monde physique, anticiper ce qui va se passer, et planifier des actions — y compris sur bras robotiques en zero-shot.
Le fait
V-JEPA 2 prolonge l’architecture JEPA (Joint Embedding Predictive Architecture) de Yann LeCun : prédire dans un espace de représentations plutôt que pixel par pixel. Le préentraînement auto-supervisé s’appuie sur plus d’1 million d’heures de vidéo web (mix VM22M : YouTube, HowTo100M, Kinetics, SSv2, ImageNet). L’encodeur scale jusqu’à ~1B (ViT-g) ; Meta annonce le modèle à 1,2B params. Sur motion understanding : 77,3 % top-1 sur Something-Something v2 ; anticipation d’actions humaines SOTA sur Epic-Kitchens-100 (39,7 recall-at-5, +44 % relatif vs précédent). Aligné à un LLM ~8B, il bat plusieurs benchmarks VidQA (PerceptionTest 84,0, TempCompass 76,9).
Variante V-JEPA 2-AC : post-training action-conditionné avec moins de 62 heures de vidéos robot non labellisées (dataset Droid). Déployé zero-shot sur bras Franka dans deux labs distincts : reach, grasp, pick-and-place avec objectifs image — sans données collectées sur site ni reward tâche-spécifique. Code et checkpoints ouverts (GitHub facebookresearch/vjepa2) ; trois nouveaux benchmarks de raisonnement physique vidéo.
Contexte
Après V-JEPA (2024), Meta pousse l’hypothèse « apprendre le monde surtout par observation ». Contrairement aux VLA purement imitation (comportement cloné) ou aux generateurs vidéo coûteux pour le planning, JEPA ignore le bruit imprévisible et modélise la dynamique latente. Le duo prétrain web-scale + petit volume d’interaction robot vise l’AMI (advanced machine intelligence) : agents qui « pensent avant d’agir ».
Pourquoi ça compte
Signal fort pour la robotique incarnée (embodied) : un world model latent planifie plus vite qu’un modèle génératif type Cosmos (~16 s/action vs ~4 min dans les tests Meta), avec de meilleurs taux de succès prehensile. Pour les labs et intégrateurs, l’ouverture commerciale/research des poids change la donne face aux stacks fermées. Limites assumées : sensibilité à la caméra, horizons longs, objectifs encore image (pas langage natif pour le contrôle).
Lecture Neurone21
V-JEPA 2 place Meta dans la course physical AI aux côtés de DeepMind (Gemini Robotics) et NVIDIA (GR00T / Cosmos) — avec une doctrine distincte : SSL vidéo + planning latent. À suivre : adoption hors labs FAIR, alignement langage→actions, et capacité européenne à réutiliser les checkpoints pour cellules usine / entrepôts sans reconstruire 1M d’heures de data.
Sources : Meta AI Blog – V-JEPA 2 world model (11/06/2025) · About Meta – Our New Model Helps AI Think Before it Acts · arXiv:2506.09985 – V-JEPA 2 · The Robot Report – Meta V-JEPA 2 · GitHub facebookresearch/vjepa2