IA Bulletin — 10 juin 2026

Reve 2.0 et l'image composée par calques /
Grok Imagine 1.5, l'image animée avec son /
Les modèles créatifs dans le framework d'Apple

Reve 2.0 génère l'image en partant du calque plutôt que du prompt, et bouscule GPT Image 2 sur l'arène texte-image

Le studio Reve a présenté le 3 juin Reve 2.0, un modèle d'image en 4K natif qui ne se contente pas d'améliorer le rendu : il propose une autre manière de travailler. Là où la plupart des générateurs fonctionnent comme des machines à sous — un prompt, un tirage, un nouveau tirage quand la composition rate —, Reve 2.0 planifie d'abord la mise en page, expose une structure modifiable, puis rend l'image finale. L'intérêt n'est pas seulement esthétique : il devient possible de déplacer un objet, réduire un bloc de texte ou changer un fond sans casser le reste, ce que recherche aussi le design de pochette de disque, où chaque élément ne tient que relié à la composition d'ensemble. Selon les premières mesures indépendantes, le modèle s'est classé en haut de l'arène texte-image d'Artificial Analysis, juste derrière GPT Image 2 et devant plusieurs modèles majeurs. Le signal est clair : la génération d'image quitte le terrain du « prompt-loterie » pour celui des systèmes d'édition, où la valeur se mesure désormais à la contrôlabilité autant qu'à la beauté du premier jet.

Note éditoriale

La bascule du prompt vers le calque déplace le métier plus qu'elle ne le remplace : tant que l'image restait un tirage opaque, l'œil demeurait spectateur ; dès qu'elle expose une structure, le geste de composition redevient une décision. Pour un directeur artistique, c'est moins une menace qu'un retour du contrôle — à condition de savoir ce qu'on veut placer, et pourquoi.

Sources : Digg — Reve launches Reve 2.0 — WaveSpeed — Reve 2.0, the layout-first 4K image model — Reve — Documentation API

Grok Imagine Video 1.5 anime une image fixe et y greffe le son dans la même passe

xAI a ouvert en préversion Grok Imagine Video 1.5 (modèle grok-imagine-video-1.5-preview), un système qui transforme une image fixe en clip vidéo tout en restant fidèle au visuel de départ. Le prompt ne décrit plus une scène à inventer mais le mouvement : trajectoire de caméra, rythme, atmosphère et design sonore, le tout rendu jusqu'en 720p. La vraie nouveauté tient à l'audio synchronisé généré dans la même passe — bruitages, ambiances, son calé sur l'image — là où les clips muets imposaient ensuite un montage son manuel. xAI met en avant un usage proche du storyboard : cadrer des images-clés, les animer une à une, puis enchaîner les plans pour composer une séquence plus longue. Encore en préversion, le modèle dérive parfois sur les clips longs et réclame un langage de préservation explicite — garder le visage, le logo, la composition — pour ne pas trahir l'image source.

Note éditoriale

Animer plutôt qu'inventer : en partant d'une image déjà choisie, le modèle déplace l'enjeu vers la continuité. Pour qui soigne son identité visuelle, c'est rassurant — le point de départ reste maîtrisé — et exigeant, car la moindre dérive d'un trait ou d'un logo se voit aussitôt à l'écran.

Sources : xAI — Grok Imagine 1.5 Preview — WaveSpeed — Grok Imagine Video 1.5, image-to-video with native audio — fal — Grok Imagine Video 1.5 Image-to-Video API

Au WWDC, Apple ouvre ses modèles génératifs aux apps : images en entrée, compétences sur mesure, une seule API Swift

Au-delà de l'Image Playground photoréaliste montré la veille, Apple a consacré une large part de son WWDC 2026 aux développeurs, avec une refonte du Foundation Models framework. Les apps peuvent désormais passer des images en entrée aux côtés du texte, ajouter leurs propres compétences IA, et atteindre les modèles sur l'appareil comme côté serveur via une seule API Swift unifiée. Les App Intents branchent en plus les fonctions d'une app directement sur Siri, qui peut déclencher une action en la demandant plutôt qu'en ouvrant l'app. Les bêtas développeur sont disponibles dès maintenant, une bêta publique suivra le mois prochain et la sortie grand public est calée pour l'automne. En faisant de la génération multimodale un service système offert aux apps, Apple cherche moins à impressionner qu'à rendre ces gestes banals — au risque de diluer ce qui distingue un outil créatif d'un réglage par défaut.

Note éditoriale

Quand le moteur génératif devient une brique système distribuée à toutes les apps, la rareté ne tient plus à l'accès à la technologie mais à ce qu'on en fait. Pour un créatif, la ligne de partage se déplace : non plus « qui dispose du modèle », mais qui sait lui imposer un parti pris plutôt qu'un automatisme.

Sources : Engadget — Everything announced at Apple's WWDC 2026 keynote — Creative Bloq — Apple catches up on AI at WWDC 2026 — Analytics Insight — WWDC 2026 live updates
Dernières nouvelles du pavillon — Studio Takuya
Dernières nouvelles du pavillon — Studio Takuya