Apple EgoDex dataset
Le 16 mai 2025, des chercheurs Apple Machine Learning Research mettent en ligne sur arXiv (2505.11709) EgoDex : dataset égocentrique à grande échelle pour apprendre la manipulation dextre à partir de vidéo humaine — code et données sur GitHub (apple/ml-egodex).
Le fait
EgoDex totalise 829 heures de vidéo 1080p / 30 Hz (~90 millions de frames), ~338 000 démonstrations et 194 tâches tabletop (nouer des lacets, plier du linge, manipuler objets du quotidien). Chaque frame est appariée à un tracking 3D tête / haut du corps / mains et doigts (68 articulations, transforms SE(3)), plus intrinsèques caméra, confidences et descriptions en langage naturel. Collecte via Apple Vision Pro (visionOS 2) et ARKit : passthrough haute résolution, FOV large, SLAM on-device, mains nues sans gants ni mocap externe. Volume disque ~2 To (MP4 + HDF5). Le papier évalue aussi des politiques d’imitation learning pour la prédiction de trajectoires de mains, avec métriques et benchmarks dédiés — les auteurs rapportent de meilleurs résultats avec des modèles encoder-decoder en flow matching et un fort gain du goal-conditioning visuel.
Contexte
L’imitation learning pour la dextérité souffre d’un déficit structurel de données : pas d’équivalent « Internet-scale » comme pour le texte ou la vision 2D. Ego4D et proches manquent d’annotations natives de pose de main et se concentrent peu sur la manipulation d’objets. Les datasets robot téléop (DROID, BridgeData V2…) restent coûteux et étroits en diversité comportementale. EgoDex parie sur la vidéo humaine égocentrique comme source passivement scalable, avec une annotation 3D « native » au moment de l’enregistrement — différenciateur clé face aux pipelines de pose estimée a posteriori.
Pourquoi ça compte
Pour la robotique et les foundation models embodiment, EgoDex abaisse la barrière d’entrée : des labos sans parc de téléop peuvent entraîner des politiques de trajectoire main / doigt à partir d’un corpus public massif. Apple positionne ainsi Vision Pro non seulement comme device grand public, mais comme capteur de démonstration pour la Physical AI. Licence orientée recherche : utile pour benchmarks et pré-entraînement, pas un feu vert produit.
Lecture Neurone21
EgoDex complète le puzzle 2025 de la donnée robotique : NVIDIA pousse la synthèse (DreamGen / Cosmos), Apple libère du réel humain dense annoté 3D. Les stacks européens (imitation, VLA, transfer human→robot) ont désormais un corpus de référence pour mesurer le sim-to-real et le hand-to-gripper. Point de vigilance : le gap embodiment (main humaine → pince / main robot) reste le vrai sujet — le dataset accélère l’amont, pas la calibration finale usine.
Sources : arXiv:2505.11709 · Apple ML Research – EgoDex · GitHub apple/ml-egodex