NVIDIA ouvre Cosmos 3, le modèle de monde qui génère la vidéo et le son
NVIDIA a publié le 1er juin Cosmos 3, présenté comme le premier modèle de monde entièrement ouvert capable de comprendre et de générer nativement texte, images, vidéo et son ambiant, ainsi que des trajectoires d'action. Le vaisseau amiral, Cosmos3-Super, articule deux tours pour soixante-quatre milliards de paramètres au total — un raisonneur de trente-deux milliards et un générateur de trente-deux milliards — sur une architecture de mélange de transformeurs. Sa promesse tient en un mot, la précision physique : les scènes générées respectent la gravité, les collisions et la continuité du mouvement, là où les modèles vidéo habituels hallucinent la matière. Pensé d'abord pour la robotique et les véhicules autonomes, il est diffusé en poids ouverts sous licence OpenMDW sur Hugging Face, donc inspectable et exécutable hors de tout service propriétaire. Pour un créatif, l'intérêt n'est pas le robot mais le moteur : un générateur qui tient la cohérence physique d'un plan ouvre la voie à une vidéo générative enfin crédible dans la durée.
Un modèle de monde n'est pas un modèle vidéo de plus : il prétend comprendre comment les choses tombent, se heurtent et persistent, et c'est précisément ce que la génération créative ne sait pas faire. Que NVIDIA le publie en poids ouverts plutôt qu'en service fermé met cette physique à portée d'un atelier, pas seulement d'un laboratoire de robotique. Reste que la cohérence physique d'un plan n'a jamais été, à elle seule, une intention de mise en scène.