Neurone21
← Actualités

ShengShu Vidar : entraînement multi-vues pour robots

Modeles IA

Le fait

Début août 2025, ShengShu Technology (Pékin, fondée en mars 2023) annonce VidarVideo Diffusion for Action Reasoning —, un modèle d’IA physique multi-vues qui combine un volume réduit de démonstrations réelles et des simulations génératives à grande échelle. Branché sur le moteur vidéo Vidu, Vidar extrapole des séquences d’actions robotiques généralisées à partir de seulement ~20 minutes de données d’entraînement physique — soit, selon la société, entre 1/80 et 1/1 200 du volume exigé par des modèles de référence comme RDT et π0.5. Objectif : réduire coût, temps et dépendance hardware du training d’humanoïdes et bras manipulateurs, sans sacrifier la richesse des cas limites du monde réel.

Contexte

Le goulot historique de la robotique incarnée reste la data : collecter des trajectoires via interactions physiques est cher, lent et difficile à scaler ; le full-simu manque souvent de variabilité. Vidar tranche en hybride. Architecture en deux étages : (1) amont, Vidu apprend la perception sur vidéo générale + vidéo incarnée ; (2) aval, le module AnyPos (task-agnostic) convertit cette compréhension visuelle en commandes moteur. Découplage perception / contrôle → transfert plus rapide d’une plateforme à l’autre. Pyramide de données à trois niveaux (vidéo générique massive → vidéo incarnée → exemples robot-spécifiques) et backbone U-ViT (diffusion + transformers) pour cohérence multi-angles et temporalité longue. Vidu a déjà dépassé 10 M d’utilisateurs en trois mois et 300 M+ de vidéos générées — Vidar en étend la compréhension visuelle vers l’action physique.

Pourquoi ça compte

Vidar attaque le triangle coût / échelle / réalisme qui freine les humanoïdes grand public et industriels. Manipulation bi-bras, prédiction vidéo multi-vues, fine-tuning à la voix naturelle : la promesse est un « cerveau numérique » déployable hors labo. Pour les constructeurs, cela ouvre une voie AI-native (moins de flottes de collecte, plus de simu grounded). Limites à garder : les ratios 1/80–1/1 200 sont revendiqués par ShengShu ; la preuve en déploiement multi-OEM et hors démo reste à confirmer. Le signal août 2025 s’inscrit dans la course physical AI où Tesla mise sur la vision, Waymo sur le lidar, et où la Chine pousse fondations multimodales + robotique.

Lecture Neurone21

Thèse Neurone21 : la data physique rare devient levier dès qu’elle est multipliée par des priors vidéo fondation. Pour décideurs FR/EU : (1) surveiller Vidar / AnyPos comme candidat de pipeline low-shot pour flottes AMR et humanoïdes ; (2) ne pas sous-estimer l’avance MaaS/SaaS chinoise sur la vidéo générative appliquée au corps ; (3) croiser avec fondations ouvertes (π0, Open X-Embodiment) et exigences de traçabilité des datasets synthétiques. À suivre : benchmarks publics vs RDT/π0.5, transferts sim-to-real documentés, et partenariats hardware hors écosystème ShengShu.

Sources : The Robot Report — ShengShu Vidar (08/08/2025) · Gizmochina — 20 min de data → robot entraîné · Fox News — Vidar accélère le training humanoïde · arXiv — Vidar: Embodied Video Diffusion Model (2507.12898).