FLUX 3 Image et la mise en page par coordonnées
Black Forest Labs met en ligne FLUX 3 Image, un modèle d'image et d'édition qui place chaque élément d'une scène selon des coordonnées sur une grille de 0 à 1000. Chaque élément reçoit un identifiant, une description et une boîte au format [y_min, x_min, y_max, x_max], et le modèle accepte jusqu'à dix images de référence citées directement dans le prompt. La sortie atteint environ 16,8 mégapixels, soit près de 5 456 × 3 072 pixels, générés en natif et sans agrandissement séparé qui risquerait d'abîmer le texte ou les détails fins. Les retouches par région laissent, selon l'éditeur, les pixels extérieurs à la boîte strictement identiques, un point qui compte pour la mise en page d'une pochette de disque, où le titre doit rester à sa place d'un essai à l'autre. L'accès se fait par un terrain de jeu et une API avec une remise de 50 % jusqu'au 8 octobre, une licence commerciale de poids existe pour l'auto-hébergement, et une version à poids ouverts est annoncée sous quelques semaines, sans date précise.
Désigner un objet par une boîte et un identifiant, plutôt que par une phrase, ramène la génération d'image vers la composition : on dit où, avant de dire quoi. Pour un graphiste habitué à la grille, la logique est familière, et c'est peut-être la première fois qu'un modèle parle sa langue de repères et de marges.
La promesse d'un reste de l'image inchangé au bit près est celle du fichier livrable, pas de la démonstration. Elle reste une affirmation de l'éditeur, et la version à poids ouverts, si elle arrive, permettra de la vérifier sur sa propre machine.