L'édition d'image en 4K
Les modèles d'édition d'image par diffusion plafonnent aujourd'hui sous le millier de pixels de côté, parce que le coût de l'attention croît avec le carré du nombre de jetons et que la mémoire suit. Le contournement habituel — éditer en basse définition puis agrandir séparément — produit deux défauts documentés par l'équipe de EditBridge : la divergence d'information, où l'agrandissement invente des détails qui contredisent la source, et la dégradation de texture, qui donne des surfaces trop lissées ou trop accentuées. La proposition renverse la logique : au lieu de régénérer depuis du bruit, le modèle traite le passage de la version basse définition éditée vers sa contrepartie haute définition comme une traduction de données à données, explicitement conditionnée par l'image source d'origine. Pour que ce conditionnement reste abordable, une attention creuse par blocs réutilise les correspondances sémantiques établies lors de la première passe et limite les échanges entre les deux images aux régions spatialement alignées. Les mesures annoncent une accélération de 3,6 à 8,4 fois en 2K et une édition 4K bouclée en 61 secondes, seuil à partir duquel la retouche générative cesse d'être un aller-retour de laboratoire pour devenir une étape de production — celle que réclame par exemple la préparation haute définition d'une pochette d'album destinée à l'impression.
Le point de bascule n'est pas la résolution affichée mais la fidélité à la source. Depuis deux ans, tout agrandissement génératif se paie en détails inventés que personne n'a demandés, et un studio qui livre un fichier d'impression ne peut pas plaider la surprise. Conditionner la montée en définition sur l'original plutôt que sur une hallucination cohérente, c'est ramener l'outil du côté de la retouche et non de la réinterprétation. Reste que 61 secondes en 4K décrivent un banc d'essai, pas une station de travail : la question du matériel nécessaire n'est pas tranchée dans l'article.