Le texte au pixel près chez Qwen-Image
Alibaba a mis en ligne le 9 août les versions Pro et Standard de Qwen-Image-3.0 sur Qwen Cloud, sortant le modèle de la phase d'accès sur invitation ouverte fin juillet. Le générateur accepte des prompts jusqu'à 4 500 tokens — 4,5 fois la génération précédente — et s'en sert pour composer en une seule passe des mises en page complètes : unes de journaux, copies d'examen avec notation mathématique, planches de bande dessinée, grilles de neuf infographies. L'éditeur revendique un texte lisible dès dix pixels, des formules LaTeX multi-lignes et douze langues rendues nativement dans plus de vingt polices — une maîtrise du lettrage qui rejoint les exigences de la composition typographique d'une pochette d'album. Les démonstrations empilent quatre interfaces imbriquées dans une seule image et restaurent une peinture à l'encre de Chine abîmée en respectant le geste du pinceau d'origine. Rupture assumée avec les deux premières générations, publiées en poids ouverts avec évaluations : Qwen-Image-3.0 arrive sans benchmarks, sans rapport technique et sans poids — un produit fermé, plus une publication de recherche.
Le texte dans l'image a longtemps été le test qui faisait rire — six doigts, lettres fondues. Le voici devenu argument commercial : dix pixels lisibles, c'est le corps d'une mention légale sur un packaging ou d'un crédit au dos d'un disque. Reste l'objection de fond : une page générée est une image plate, non éditable — un beau brouillon, pas un document de production. La vraie information est ailleurs : le champion chinois des poids ouverts vient de refermer sa gamme image, sans un chiffre publié.