Neurone21
← Actualités

VERSES : multi-agents sans pré-entraînement, Habitat battu

Modeles IA

Le fait

En juillet–août 2025, l’équipe VERSES (ligne Friston / active inference) publie et met en avant une architecture robotique hiérarchique qui surpasse les baselines reinforcement learning sur le Habitat Benchmark de Meta (manipulation mobile longue horizon), sans pré-entraînement offline massif. Sur trois tâches domestiques — TidyHouse, PrepareGroceries, SetTable — le système atteint en moyenne 66,5 % de succès contre 54,7 % pour la meilleure baseline multi-skill (MM), avec des scores par tâche de l’ordre de 72,5 %, 77 % et 50 %.

Contexte

Le Habitat Benchmark (Habitat 2.0) exige navigation + manipulation d’objets articulés (tiroirs, réfrigérateur), transport et placement dans des intérieurs encombrés. Les baselines RL classiques consomment des milliers d’épisodes et des centaines de millions de steps par skill. L’approche VERSES compose un agent d’inférence active haut niveau (sélection de skills discrets) avec un contrôleur corps entier continu ; les skills se recomposent en ligne et se réparent après échec, sans retrain. Le papier de référence — Mobile Manipulation with Active Inference for Long-Horizon Rearrangement Tasks (arXiv:2507.17338) — formalise ce stack multi-agents dans un même corps robotique.

Pourquoi ça compte

Le signal n’est pas seulement un score : c’est un contre-modèle à la course aux données et au compute. Moins de collectes, moins de fine-tuning, plus d’adaptation temps réel — un argument fort pour la robotique d’entreprise (entrepôt, logistique légère, assistance) où chaque environnement est unique. Cela relance aussi le débat « modèles génératifs massifs vs. agents bayésiens / active inference » pour le contrôle embarqué.

Lecture Neurone21

Neurone21 lit ici un basculement de paradigme : l’intelligence n’est plus seulement prédire le prochain token, mais minimiser la surprise en agissant. Pour l’Europe et les intégrateurs, l’enjeu est double — suivre ces architectures sobres en données, et ne pas laisser le narratif « scale only » occulter des stacks plus souverains et auditables. Reste à sortir du privilège simulation (cartes, états d’objets) vers le monde réel ; le benchmark Habitat n’est qu’une première preuve de scalabilité.

Sources : arXiv:2507.17338 ; analyses VERSES / active inference (Habitat Benchmark Meta) ; openreview / alphaXiv — juillet–août 2025.