Takuya Studio — IA Bulletin

Sora, la fin d'une API /
Topaz Labs chez Adobe /
La voix en série chez Google

Semaine des retraits et des rachats. OpenAI éteint l'ensemble de son API Sora 2 sans successeur désigné, cinq mois après avoir fermé l'application grand public, pendant qu'Adobe finalise le rachat de Topaz Labs et promet d'intégrer sa technologie de restauration Neurostream à Firefly et Photoshop. Google occupe le reste du terrain à la voix : Gemini Live Avatar synchronise les lèvres dans 97 langues, puis Gemini 3.8 Flash TTS et Flash-Lite TTS ajoutent plus de 2 000 voix et 100 langues supplémentaires, deux annonces en trois jours qui font de la voix générée une gamme de produits plutôt qu'une prouesse isolée. Entre les deux, une semaine chargée en droit d'auteur — Suno v6 rejeté par ses propres abonnés pour un corpus licencié aux aigus disparus, cinquante tonnes de livres japonais exportés vers un acheteur américain non identifié — et en outils : Qwen-Image-2.1 en RGBA natif, Midjourney et son aperçu de style en direct, Runway et son routeur multimodèle. Sept éditions, du 21 au 27 septembre 2026.

21 septembre 2026
Le RGBA natif de Qwen-Image-2.1 / Le rejet de Suno v6 par ses abonnés / La segmentation au forfait chez Meta
Qwen-Image-2.1 · modèle ouvert 7 milliards, RGBA natif à 2048 pixels, licence Apache 2.0 abandonnée — Suno v6 · les abonnés historiques dénoncent des rendus étouffés depuis le passage au corpus licencié — Meta SAM 3.1 · segmentation et suivi vidéo en API, 2,50 dollars les mille images, seize objets par passe
Alibaba publie Qwen-Image-2.1, modèle image à poids ouverts de 7 milliards de paramètres qui sort des visuels détourés en RGBA directement en fin de génération et produit nativement en 2048 × 2048, mais quitte la licence Apache 2.0 pour une licence recherche réservée aux usages non commerciaux. Les abonnés de longue date de Suno rejettent les modèles v6, premiers entraînés sur corpus licencié après les accords Warner, BMG et Believe, et décrivent des rendus étouffés dont le haut du spectre a disparu, sans possibilité de revenir aux modèles précédents définitivement retirés. Meta met SAM 3.1 derrière une API hébergée facturée 2,50 dollars les mille images, avec masque au pixel près, suivi vidéo préservant l'identité et jusqu'à seize objets traités en une seule passe.
22 septembre 2026
La mémoire de procédures de Designer-RSI / Le monde jouable à neuf millièmes de dollar / Les avatars de tournée d'Unit1
Designer-RSI · un modèle gelé pilote un logiciel de design par 230 outils, mémoire de procédures portée de 76 à 139 compétences — Zing-0.5 · monde jouable de 5 milliards de paramètres au clavier et au texte, 24 images par seconde — Unit1 · 20 millions de dollars levés pour faire tourner des avatars hyperréalistes de musiciens
Quatre chercheurs publient Designer-RSI, un cadre où un modèle frontière laissé gelé pilote un logiciel de design professionnel via plus de 230 outils pendant qu'une mémoire externe de procédures en langage naturel passe de 76 à 139 compétences, faisant grimper la réussite d'exécution sur GenEval2 de 72,7 % à 99,3 % sans aucune mise à jour de poids ni étiquette humaine. SeedLeap.ai dépose Zing-0.5, modèle de monde autorégressif de 5 milliards de paramètres où l'on navigue au clavier tout en injectant des consignes textuelles qui infléchissent les événements, à 832 × 480 et 24 images par seconde pour environ 0,009 dollar la minute de flux, poids et code publiés. Unit1 lève près de 15 millions de livres auprès de Balderton Capital pour monter des concerts où des instrumentistes vivants jouent aux côtés d'avatars hyperréalistes d'artistes retirés ou décédés, avec un pilote déjà mené sur une performance de KT Tunstall vieille de vingt ans.
23 septembre 2026
La parité maison de Hy Image 3.5 / Le refus de Zelda Williams / Cinq mille heures de jeu annotées
Hy Image 3.5 Preview · parité revendiquée avec Seedream 5.0 Pro sur la foi d'un sondage interne — Robin Williams · sa fille dénonce une fausse vidéo privée devenue virale — GameHorizon Suite · 5 000 heures de jeu AAA annotées et 47 modèles évalués
Tencent publie Hy Image 3.5 Preview et l'intègre au chatbot Yuanbao ainsi qu'à ses outils de montage et de design, en revendiquant la parité avec Seedream 5.0 Pro de ByteDance et une légère avance sur Nano Banana Pro et Qwen-Image-3.0 Pro — sur la foi d'un test mené auprès de centaines de designers maison, sans aucun banc d'essai externe, le modèle restant gratuit sur l'agent Miora jusqu'au 7 octobre. Zelda Williams dénonce sur X une fausse vidéo privée de son père Robin Williams devenue virale, réclame que les morts cessent d'être traités en marionnettes et réactive une demande déjà formulée en octobre 2025, restée sans effet faute du moindre recours technique ou juridique. L'ARC Lab de Tencent publie GameHorizon Suite, un corpus de cinq mille heures tirées de vingt et un titres AAA captées par cent joueurs experts, un annotateur multi-horizons automatique et un banc d'essai reproductible éprouvé sur quarante-sept modèles et plus d'un million d'appels d'évaluation.
24 septembre 2026
Deux mille voix sur étagère / Le prix plancher de la synthèse vocale / L'atelier conversationnel de YouTube
Gemini 3.8 Flash TTS · deux mille voix, cent langues, clonage à partir de trente secondes — Qwen-Audio 3.1 · cinq modèles et des tarifs audio en baisse jusqu'à 95 % — Made on YouTube · montage conversationnel, vignettes générées et doublage en direct
Google publie Gemini 3.8 Flash TTS et sa déclinaison Flash-Lite, plus de deux mille voix de production sur cent langues et dialectes, une réplication de voix qui se contente de trente secondes d'échantillon assorties d'une vérification de consentement, une direction de jeu ligne à ligne et un filigrane SynthID doublé de métadonnées C2PA sur chaque sortie. Alibaba met en ligne Qwen-Audio-3.1, cinq modèles dont TTS-Next qui produit voix, effets et lit sonore en une passe et ASR-Next qui horodate les locuteurs et lit l'émotion, avec des baisses de prix allant jusqu'à 95 % dont ni la date d'effet ni les conditions ne sont précisées. YouTube déroule à Made on YouTube un montage conversationnel sur les Shorts, des vignettes générées au style de la chaîne servies en trois variantes à des audiences différentes, un test A/B sur trois montages et un doublage automatique en direct annoncé pour le début de l'année prochaine.
25 septembre 2026
Sora, code 410 / Un visage pour quatre-vingt-dix-sept langues / Cinquante tonnes de livres japonais
Sora 2 · l'API vidéo d'OpenAI retirée le 24 septembre, sans modèle de remplacement — Gemini 3.8 Live Avatar · visages générés en quasi temps réel, lèvres synchrones dans 97 langues — Nippon TV · cinquante tonnes de livres d'occasion exportés vers les États-Unis, soupçon de numérisation destructive
OpenAI retire de son API l'ensemble des modèles Sora 2, notifié dès le 24 mars et sans successeur désigné, cinq mois après la fermeture de l'application grand public, laissant les chaînes de production vidéo se replier sur Veo, Kling ou des modèles ouverts dépourvus de piste sonore native. Google rend disponible dans Gemini Enterprise Gemini 3.8 Live avec Live Avatar, des personnages générés en quasi temps réel qui synchronisent les lèvres dans 97 langues, créables à partir d'une image de référence sur liste blanche et filigranés SynthID. Une enquête de Nippon TV relève plus de cinquante tonnes de livres japonais d'occasion — philosophie, droit, documents d'Edo — exportés vers un acheteur américain non identifié, soupçonnés d'alimenter la numérisation destructive au service de l'entraînement des modèles, sous l'ombre de l'article 30-4 de la loi japonaise sur le droit d'auteur.
26 septembre 2026
Topaz Labs, désormais chez Adobe / Le style prévisualisé de Midjourney / Runway et son routeur de modèles
Adobe · rachat de Topaz Labs finalisé le 23 septembre, Neurostream promis à Firefly et Photoshop — Midjourney · aperçu de style en direct, retouches ciblées sans perte, tuiles sans couture en V8.1/V8.2 — Runway · plugin natif dans DaVinci Resolve, routeur multimodèle étendu à Cursor et Grok
Adobe a finalisé le 23 septembre le rachat de Topaz Labs et prévoit d'intégrer sa technologie Neurostream de restauration d'image et de vidéo à Firefly et Photoshop, Topaz restant une marque autonome. Midjourney ajoute un aperçu de style en direct, une retouche ciblée sans perte de qualité cumulée et des tuiles sans couture sur les versions V8.1 et V8.2. Runway installe un plugin natif dans DaVinci Resolve et étend son routeur multimodèle à Cursor et à Grok, pendant que son propre modèle Gen 4.5 recule dans les classements.
27 septembre 2026
La voix sur mesure de Gemini 3.8 / Le MIDI conversationnel de Suno Studio / Les cent vingt images par seconde de Runway
Google · Gemini 3.8 Flash TTS et Flash-Lite TTS, 2 000 voix et 100+ langues — Suno Studio · transcription MIDI ameliorée, stems générés par chat depuis un clip MIDI — Runway · Enhance Frame Rate, retiming jusqu'à 120 fps sur toute vidéo
Google lance Gemini 3.8 Flash TTS et Flash-Lite TTS, ses modèles vocaux les plus expressifs, avec plus de 2 000 voix et une couverture de plus de 100 langues. Suno Studio améliore sa transcription MIDI et permet de générer des stems audio à partir d'un simple clip MIDI directement depuis sa barre de discussion. Runway ajoute Enhance Frame Rate, un modèle de retiming capable de convertir n'importe quelle vidéo jusqu'à 120 images par seconde.