IA Bulletin — 4 août 2026

Les poids ouverts de MiniMax H3 /
Le personnage en planche multi-vues /
L'agentivité en débat à NeurIPS

MiniMax ouvre les poids de H3 avec des nœuds ComfyUI natifs

MiniMax a mis en ligne lundi les poids ouverts de H3, le modèle vidéo omni-modal de 33,1 milliards de paramètres qui motorise la gamme Hailuo, publiés sur Hugging Face sous licence communautaire. Le support ComfyUI natif a été fusionné le même jour, avec quatre nouveaux nœuds, six workflows officiels et une génération conjointe de la vidéo et de l'audio stéréo dans la même passe de débruitage. La publication couvre deux déclinaisons de H3-Base : FL2VA pour le texte-vers-vidéo avec conditionnement par première et dernière image, et Ref2VA qui accepte jusqu'à neuf images, trois vidéos et trois pistes audio de référence. Les clips sortent en 768p à 24 images par seconde, de 4 à 15 secondes, avec un son stéréo 32 kHz ; la montée en 2K et l'orchestrateur multimodal H3-Context-IR restent côté API. Des checkpoints INT8 élagués d'environ 40 %, ramenés à 19,5 Go, mettent le modèle à portée des GPU locaux.

Note éditoriale

L'ouverture est réelle mais découpée au scalpel : le générateur est libre, l'orchestrateur qui transforme un contexte multimodal en représentation exploitable reste une API. Le geste dessine le nouveau standard du secteur — offrir le moteur, garder la direction. Reste qu'un modèle vidéo-audio de ce calibre, chargeable dans des nœuds ComfyUI officiels le jour de sa sortie, aurait été impensable il y a un an.

Sources : ComfyUI Wiki — MiniMax H3 Open Weights Land With Native ComfyUI Support — Hugging Face — MiniMaxAI/MiniMax-H3

CharacterSheet convertit une image de personnage en planche multi-vues

Alissonerdx publie CharacterSheet, une collection de LoRA d'édition d'image qui convertissent une image de personnage unique en planche de référence multi-vues, identité, vêtements et proportions préservés. Trois variantes sont disponibles : TripleView et QuadView pour FLUX.2 Klein 9B, et QuadView pour Krea 2 Turbo, cette dernière ajoutant un gros plan du visage aux vues de face, de profil et de dos. L'entraînement repose sur environ 300 planches de personnages, centré sur l'humain ; l'anime, les créatures et les styles cartoon fonctionnent avec une consistance moindre. Chaque modèle embarque un workflow JSON prêt à charger dans ComfyUI, sans nœud personnalisé, avec des réglages de départ à 8 ou 10 pas et CFG 1. Le turnaround, standard historique de l'animation, devient une primitive de pipeline, du character design jusqu'à l'identité graphique d'une pochette de disque construite autour d'une figure récurrente.

Note éditoriale

La cohérence d'un personnage entre les vues reste le verrou principal des workflows de personnage — celui que les générateurs contournent d'habitude à coups de tirages successifs. Que trois cents exemples suffisent à installer cette discipline dans un LoRA en dit long sur ce que les modèles de base savent déjà sans qu'on le leur demande proprement. Les mains, les asymétries et les accessoires complexes restent le juge de paix.

Sources : ComfyUI Wiki — CharacterSheet: Multi-View LoRAs for FLUX.2 Klein 9B and Krea 2 — Hugging Face — Alissonerdx/CharacterSheet

NeurIPS clôt les soumissions de son track Creative AI sur l'agentivité

Le track Creative AI de NeurIPS 2026 a clos ses soumissions lundi soir, pour une quatrième édition placée sous le thème de l'agentivité. Artistes, designers et chercheurs étaient invités à interroger où commence et où finit l'agentivité créative quand elle se distribue entre artiste, modèle, plateforme et public. Les œuvres — art visuel, musique, spectacle vivant, film, architecture, installations — se soumettent au format vidéo de trois minutes, les papiers de recherche en deux à six pages. Le track devient non archivé cette année : posters présentés hors des actes officiels, œuvres diffusées sur grands écrans lors de la conférence à Sydney, décisions attendues le 18 septembre. Parmi les questions posées figurent la responsabilité quand l'agentivité se répartit entre artistes, modèles et datasets, et le devenir du goût quand les systèmes savent prédire la préférence esthétique.

Note éditoriale

Le choix du thème dit l'époque : la fascination pour la capacité technique cède la place à la question de savoir qui décide. La friction, la lenteur et le refus, listés noir sur blanc dans l'appel comme matériaux de travail, valent programme critique — les artistes se retrouvent en première ligne pour auditer ce que les systèmes font au jugement. Une conférence de machine learning qui s'offre ce vocabulaire mérite d'être lue attentivement.

Sources : NeurIPS — Call For Creative AI 2026: Agency
24 Megamix — Studio Takuya
24 Megamix — Studio Takuya