Neurone21
← Actualités

Physical Intelligence π0.5

Modeles IA

Physical Intelligence π0.5

Le 22 avril 2025, Physical Intelligence présente π0.5 (pi-zero-point-five), évolution de π0 : un VLA (vision-language-action) pensé pour la généralisation open-world, pas seulement la dextérité en labo.

Le fait

π0.5 co-entraîne un même modèle sur un mélange hétérogène : données multi-robots (bases mobiles + bras statiques, cross-embodiment), prédictions sémantiques haut niveau, détections d’objets, consignes verbales, et données web multimodales (captioning, VQA, localisation). À l’inférence, le modèle produit d’abord une sous-tâche textuelle (« ramasser l’oreiller »), puis un action chunk continu (~50 pas / 1 s) via un action expert en flow matching — une chaîne de pensée haute/basse niveau dans un seul réseau. Résultats clés : tâches long-horizon (10–15 min) type ranger une cuisine ou une chambre dans des maisons hors distribution ; ablations montrant que le web data booste surtout l’OOD objets, et que les données d’autres robots (ME/CE) portent le succès global.

Contexte

Les VLA récents (π0, OpenVLA, etc.) impressionnent souvent dans des scènes proches de l’entraînement. π0.5 cible l’échec historique : « même skill, nouvel environnement ». Physical Intelligence insiste : ~97,6 % des exemples de la première phase ne viennent pas des manipulateurs mobiles domestiques utilisés au test, mais d’autres sources — preuve que le transfert croisé est le levier. Architecture héritée de π0 (backbone type PaliGemma + expert actions ~300 M), enrichie d’une hiérarchie Hi Robot et d’une isolation du savoir (tokens d’actions discrets / stop-gradient selon analyses ultérieures). Paper : arXiv 2504.16054.

Pourquoi ça compte

C’est l’un des premiers signaux publics où un système end-to-end apprend à décomposer et exécuter des routines ménagères longues dans un foyer inconnu. Le message méthodologique est clair : la généralisation physique n’est pas qu’une affaire de plus de démos du même robot — il faut un curriculum web + multi-embodiments + labels sémantiques. Pour l’industrie, cela rapproche le scénario « déployer hors de l’usine calibrée » sans recollecte massive sur site.

Lecture Neurone21

Repère avril 2025 sur la course Physical AI : π0.5 pousse la barre « maison jamais vue », pendant que d’autres (ex. DYNA-1) poussent la barre « 24 h commercial ». À surveiller : taux de succès réels hors vidéos curated, ouverture des checkpoints (famille openpi / LeRobot), coût data vs gains OOD, et passage du ménage démo aux verticales B2B (hôtellerie, healthcare, retail). Pour l’Europe : le co-training web+robots devient un standard de design à exiger dans les appels à projets robotique.

Sources : Physical Intelligence — blog « π0.5: a VLA with Open-World Generalization » (22/04/2025) ; arXiv 2504.16054 ; pi.website.