IA Bulletin — 8 août 2026

FLUX 3 Video en disponibilité générale /
Le retrait groupé des générateurs d'images /
La transcription d'OpenAI au prix du marché

FLUX 3 Video en disponibilité générale

Black Forest Labs a ouvert le 4 août la disponibilité générale de FLUX 3 Video sur sa propre API et chez des partenaires sélectionnés, douze jours après l'annonce en accès restreint que ce bulletin relevait fin juillet. Le générateur produit des clips jusqu'à 20 secondes en 720p natif — 1080p par upscaling — avec un audio généré en même temps que l'image, dialogues compris, plutôt que plaqué après coup. Trois modes de requête se partagent un même endpoint : texte vers vidéo, image vers vidéo à keyframes multiples, et continuation à partir de quatre secondes de vidéo et d'audio existants. La sortie multi-plans et multi-angles en une seule génération, la synchronisation labiale sur environ quatorze langues et un mode brouillon pour prévisualiser avant rendu complet composent une panoplie inhabituellement fournie pour une première GA. Sur OpenRouter, le tarif de base s'établit à 0,17 $ la seconde, soit 3,40 $ le clip de vingt secondes avant toute reprise — le coût réel d'un plan utilisable restant un multiple de ce chiffre.

Note éditoriale

La fonctionnalité qui change la donne n'est pas la durée mais la continuation : repartir de quatre secondes de vidéo et d'audio existants, c'est la différence entre générer des plans et construire une séquence. Ajouter le multi-plans dans une seule passe et le mode brouillon, et le vocabulaire du montage — maquette, raccord, dérushage — entre dans l'API. Reste l'arithmétique : à 3,40 $ le clip complet, multiplié par le taux de rebut habituel, la minute utile se chiffre vite en dizaines de dollars.

Sources : XenoSpectrum — FLUX 3 Video Now Generally Available — Digital Applied — FLUX 3 Video Goes GA: 20-Second Clips, Native Audio

Le retrait groupé des générateurs d'images

La page de dépréciations de l'API Gemini fixe au 17 août l'arrêt des trois endpoints de génération Imagen 4 — standard, ultra et fast — ainsi que des anciens modèles image Gemini 3, avec gemini-3.1-flash-image en remplacement recommandé. La migration n'a rien d'un changement de nom : la méthode dédiée de génération d'images disparaît au profit de l'appel de contenu générique, avec plusieurs ruptures d'API à absorber en une dizaine de jours. Chez OpenAI, le GPT officiel DALL·E sera retiré de ChatGPT le 30 août selon une notice publiée le 31 juillet — ChatGPT Images continue, seul le GPT dédié s'éteint. Le même calendrier sort o3 de ChatGPT le 26 août au terme d'un sursis de quatre-vingt-dix jours, sans changement côté API. Trois retraits datés dans un même mois : les studios qui règlent la conception graphique d'un album sur un endpoint précis apprennent à traiter chaque modèle comme un consommable à date de péremption.

Note éditoriale

Un modèle retiré emporte son rendu avec lui : grain, palette, manières de dessiner une main — tout ce qui faisait qu'une série d'images se tenait. Une identité visuelle construite sur un générateur précis hérite donc de sa date de péremption, ce qu'aucune direction artistique sérieuse ne peut ignorer. La parade est archivistique autant que technique : conserver les sorties en haute définition, documenter prompts et réglages, et considérer toute recette liée à un endpoint comme provisoire.

Sources : Google AI for Developers — Gemini API deprecations — Digital Applied — AI Model Releases: August 2026 Tracker

La transcription d'OpenAI au prix du marché

Un modèle de reconnaissance vocale d'OpenAI baptisé GPT Transcribe est apparu le 5 août sur OpenRouter, sans billet de lancement ni grille tarifaire du côté de l'éditeur. La fiche couvre trois usages : audio enregistré, transcription de fichiers en streaming et tours de parole validés en Realtime, avec contexte libre, indices de vocabulaire et indices multilingues pour les termes spécialisés. Le tarif affiché — 0,0045 $ la minute, soit 0,27 $ l'heure d'audio — appartient à la place de marché, pas nécessairement à OpenAI. Le statut de l'objet est celui d'un simple listing : le modèle se laisse appeler dès aujourd'hui, mais aucune page éditeur ne confirme prix, carte de modèle ou conditions d'usage. Pour les musiciens et vidéastes, la transcription à ce tarif couvre interviews, sous-titrage et archivage de sessions — en acceptant qu'un service sans annonce officielle puisse changer sans préavis.

Note éditoriale

La semaine impose une taxonomie utile : annoncé, listé, livré — trois statuts que la presse recouvre du même verbe « sortir ». Un prix sur la place de marché d'un tiers n'engage pas l'éditeur, pas plus qu'une démonstration de laboratoire ne promet un produit. La discipline de studio qui en découle tient en une ligne : ne câbler un flux de production que sur ce qui est daté, tarifé et documenté à la source.

Sources : OpenRouter — GPT Transcribe, API Pricing & Providers — Digital Applied — GPT Transcribe vs Whisper, Deepgram and Scribe v2
Shadow Influence — Studio Takuya
Shadow Influence — Studio Takuya