La vidéo ouverte en 4K HDR chez Lightricks
Lightricks a publié le 11 août LTX-2.5, un modèle de fondation audio-vidéo en poids ouverts de 22 milliards de paramètres, transformeur de diffusion à double flux asymétrique qui génère image et son conjointement. Sa fonction la plus remarquée, le multishot natif, enchaîne plan large, plan moyen et gros plan en une seule génération, en tenant personnage, décor, lumière et voix d'une coupe à l'autre. La durée du clip se prédit désormais d'après l'action décrite, et la sortie vise la 4K HDR native, avec un mode Diffusion Fidelity Rendering qui produit des EXR de qualité cinéma pour les pipelines de production réels. Le dépôt Hugging Face aligne checkpoint complet et variante distillée — un clip de dix secondes en six à huit secondes sur les superchips NVIDIA — plus quantisations int8 et NVFP4, VAE vidéo et audio séparés et upscalers latents 2x. ComfyUI prend le tout en charge dès le premier jour, gabarits officiels texte-vers-vidéo, image-vers-vidéo et première/dernière image compris.
La cohérence entre plans était le mur devant tous les modèles vidéo ouverts — chaque cut réinventait le personnage. Le multishot natif attaque ce mur de l'intérieur du modèle plutôt que par bricolage de références externes, et c'est la bonne échelle du problème. La durée automatique, elle, déplace une décision de montage dans la boîte noire : commode pour l'esquisse, discutable dès que le rythme est une intention. Et l'EXR cinéma dit clairement à qui ce modèle s'adresse — pas aux flux sociaux, aux plateaux.