IA Bulletin — 27 août 2026

La livraison HDR chez Runway /
Les cinquante gigas sur douze /
Le rehaussement vidéo borné en mémoire /
Le serveur MCP hébergé d'ElevenLabs

La livraison HDR chez Runway

Runway a ouvert le 20 août son API à la livraison en haute plage dynamique, avec un modèle dédié nommé Ruby qui convertit n'importe quelle vidéo SDR — importée ou générée par un autre moteur — en HDR10 dix bits, en HLG signalé BT.2020, en mezzanine ProRes ou en séquence OpenEXR demi-flottante. La conversion est présentée comme conservative : les pixels et l'audio de la source sont préservés, la luminance est étendue dans la réserve HDR par un étalonnage borné, et rien n'est recalculé. Le même jour, Gen-4.5 en texte-vers-vidéo et image-vers-vidéo a gagné des formats de sortie de post-production — masters douze bits sans perte, séquences PNG seize bits bit-exactes, EXR en lumière linéaire BT.2020 native pour les compositeurs — tandis qu'Aleph 2.0 se limite au SDR dix bits et doit être chaîné vers /v1/video_to_hdr pour sortir en HDR. Les entrées de Ruby sont plafonnées à quarante secondes et à 4096 pixels de côté, et les vidéos déjà taguées HDR sont refusées. La facturation suit la charge : vingt crédits par seconde, quarante au-delà de quatre mégapixels, et cinq crédits par seconde seulement pour le ProRes et les séquences PNG.

Note éditoriale

Le vocabulaire de cette mise à jour n'est pas celui d'un générateur de vidéo, c'est celui d'une salle d'étalonnage : mezzanine, BT.2020, PQ, EXR demi-flottant, métadonnées mesurées. Depuis trois ans, les moteurs génératifs livraient un MP4 huit bits et laissaient au monteur le soin d'inventer la suite. Une sortie EXR linéaire compositable change la nature de l'objet produit — il cesse d'être une image finie pour redevenir de la matière.

Reste que l'ordre des opérations mérite attention. Ruby étend un signal SDR vers le HDR sans rien re-rendre : ce n'est pas du HDR natif, c'est une extension bornée d'une plage déjà décidée. Le vrai HDR de la mise à jour est ailleurs, dans les rendus Gen-4.5 gradés directement en BT.2020. Confondre les deux revient à confondre une restauration et un tournage.

Sources : Runway Dev — API Changelog & Updates — Releasebot — Runway AI release notes — Runway — Product updates & changelog

Les cinquante gigas sur douze

Une publication communautaire du 25 août fait tourner SenseNova-U1.5-8B-MoT, modèle « n'importe quoi vers n'importe quoi » de cinquante gigaoctets en bf16, sur une carte de douze gigaoctets dans ComfyUI, en 2048 × 2048. La méthode, baptisée ConvRot, produit deux fichiers : une version INT8 de 17,6 Go donnée pour maximale fidélité, et une version hybride de 13,8 Go dont les couches zéro à dix-sept restent en INT8 tandis que les couches suivantes passent en W4A8 réel. L'auteur documente le point intéressant : le modèle tolère la quantification agressive dans ses couches tardives mais s'effondre si l'on touche aux premières, où se joue la cohérence de l'invite — la frontière a été trouvée empiriquement, par dichotomie. Mesurée à graine identique contre l'original, la version INT8 affiche 0,43 % d'écart pixel et l'hybride reste visuellement indiscernable malgré 7 % d'erreur relative sur ses couches quatre bits. Le modèle gère l'édition d'image et la référence multiple, ce qui le rend directement utilisable pour la mise en page d'une pochette de disque sans quitter sa propre machine.

Note éditoriale

La quantification passe pour une affaire d'ingénieurs et c'est en réalité une politique d'accès. Chaque fois qu'un modèle de cinquante gigaoctets descend sur une carte à mille euros, la frontière entre ceux qui peuvent faire tourner l'outil chez eux et ceux qui doivent le louer au mois se déplace d'un cran. Le travail est fait par des individus, publié en Apache, documenté avec ses limites — c'est-à-dire tout l'inverse d'une feuille de route commerciale.

La trouvaille sur les premières couches mérite d'être retenue au-delà du cas particulier. Elle dit que la compréhension de l'invite se loge à l'entrée du réseau, là où la moindre approximation détruit le sens, tandis que la fabrication de la texture supporte le calcul grossier. Les modèles n'ont pas une qualité uniforme : ils ont des endroits fragiles et des endroits élastiques, et savoir lesquels vaut mieux qu'un chiffre de référence.

Sources : ComfyUI Wiki — SenseNova-U1.5 ConvRot for ComfyUI — Hugging Face — ComfyUI-ConvRot-SenseNova-U1.5-8B-MoT-T8 — ComfyUI Wiki — SenseNova-U1.5 official 4K nodes

Le rehaussement vidéo borné en mémoire

Le nœud ComfyUI MMH3 Ultimate Upscale, publié le 25 août, rééchantillonne une vidéo MiniMax H3 déjà débruitée en combinant découpe temporelle et pavage spatial, de sorte que le pic de mémoire reste borné à une seule tuile quelle que soit la durée ou la définition visée. Le problème qu'il résout est structurel : H3 empaquette vingt-quatre canaux vidéo et trente-deux canaux audio dans un même tenseur imbriqué, que les nœuds de rehaussement ordinaires ne savent pas lire et qui sature la mémoire dès quatre mégapixels. Un testeur de la communauté rapporte que le pipeline d'origine tombait immédiatement à cette résolution, là où le nœud pavé atteint 2550 × 1920 sur dix-huit secondes avec la même machine. La couture est traitée avec soin : les bandes de recouvrement déjà assemblées sont préremplies puis verrouillées par un masque de bruit, si bien que le rééchantillonnage ne peut modifier que l'intérieur libre de chaque tuile. La piste audio, elle, traverse toutes les étapes sans être touchée — un détail qui décide de l'usage réel de l'outil.

Note éditoriale

L'écosystème ouvert produit rarement des modèles et souvent des solutions de contournement, et ce sont ces dernières qui font tourner les ateliers. Rien n'est inventé ici : on découpe, on traite, on recolle, en veillant à ce que les jointures ne se voient pas. C'est de la menuiserie appliquée au latent, et cela rend faisable ce qu'une carte graphique de studio refusait la veille.

Deux réserves de méthode. Le rehaussement travaille dans l'espace latent, donc il réinvente autant qu'il restaure : une tuile qui remonte en définition peut inventer un détail que la prise ne contenait pas. Et l'auteur signale lui-même que la variante LTX-2.5 est expérimentale et l'audio encore instable — un outil de production ne se juge pas sur sa démonstration, mais sur ce qu'il fait à la trentième passe.

Sources : ComfyUI Wiki — MMH3 Ultimate Upscale, tiled H3 video upscaling — GitHub — bbaudio-2025 / Comfyui-MMH3-UltimateUpscale — ComfyUI Wiki — News et sorties open source

Le serveur MCP hébergé d'ElevenLabs

ElevenLabs a déprécié le 22 août son serveur MCP local et le lecteur associé, au profit d'un serveur hébergé joignable à une adresse unique et authentifié par OAuth au compte ElevenLabs. Les deux dépôts sont archivés et cessent de recevoir des mises à jour : plus d'installation locale, plus de clé d'API à déposer dans un fichier de configuration, une connexion depuis Claude, Cursor ou tout autre client compatible. La bascule prolonge la mise à jour du 17 août, qui avait ouvert des API Flows asynchrones pour la génération d'image, de vidéo et de parole, avec états d'avancement et notification par webhook. Le même train de nouveautés a introduit des ressources média réutilisables : une génération peut désormais prendre en entrée un fichier déposé dans l'espace de travail ou le résultat d'une génération précédente, ce qui permet de chaîner les travaux sans réémettre les données. La maison passe ainsi d'un fournisseur de voix à un ordonnanceur de tâches multimédia adressable par des assistants.

Note éditoriale

Une clé d'API sur sa propre machine et un jeton OAuth chez l'éditeur ne racontent pas la même histoire. Le serveur local était une pièce que l'on possédait, auditable, débranchable, faillible aussi ; l'hébergé est plus simple à installer et déplace la journalisation, la disponibilité et la révocation du côté du fournisseur. L'argument du confort est réel, la contrepartie l'est également, et elle n'apparaît que le jour où le service décide autrement.

Le mouvement de fond compte davantage que la ligne de changelog. Les ateliers ne cliquent plus dans des interfaces, ils exposent des outils que des assistants appellent — et la question n'est plus quel modèle produit le meilleur son, mais qui tient les tuyaux entre les modèles. Un studio qui dépend d'une chaîne dont il ne possède aucun maillon a construit un atelier qu'il loue au mois.

Sources : ElevenLabs — Changelog du 22 août 2026 — ElevenLabs — Changelog du 17 août 2026 — Releasebot — Eleven Labs release notes
Wanna Hold Your Hand — Studio Takuya
Wanna Hold Your Hand — Studio Takuya