L'évaluation vidéo par l'objectif atteint
Les bancs d'essai de génération vidéo mesurent la fidélité au texte, la cohérence temporelle et la qualité perçue, mais aucun ne demande si la séquence produite accomplit réellement ce qui était demandé. L'équipe de FrameX-AI introduit la génération vidéo par accomplissement sémantique de tâche, formulation orientée résultat où la réussite exige deux choses à la fois : l'obtention de l'issue visée et l'ancrage sémantique, c'est-à-dire la correspondance de haut niveau entre l'image de référence et le résultat obtenu. Le protocole porte sur le seul résultat final et n'exige ni la présentation complète des étapes intermédiaires, ni la cohérence d'apparence habituellement réclamée vis-à-vis de l'image de référence. Le jeu SemComp-Data couvre six domaines, chaque instance associant une image de référence, une consigne détaillée, une consigne brève et un extrait vidéo centré sur l'issue, produits par une chaîne de curation en quatre étapes. SemComp-Bench interroge ensuite un modèle vision-langage par questions binaires structurées et rapporte deux scores séparés — OA pour l'accomplissement, GR pour la fiabilité de génération — dont les mesures montrent que les modèles actuels peinent encore à tenir les deux ensemble.
Voilà une critique de fond déguisée en banc d'essai. Depuis trois ans, la génération vidéo est jugée sur sa capacité à convaincre, presque jamais sur sa capacité à aboutir — or un plan peut être parfaitement crédible et rater complètement la commande, ce que tout monteur reconnaît dans ses rushes. Séparer l'accomplissement de la fiabilité est la bonne intuition : ce sont deux échecs de nature différente, et ils ne se corrigent pas au même endroit de la chaîne. Reste que confier l'arbitrage à un modèle vision-langage déplace le problème d'un cran plutôt qu'il ne le résout.