L'AI Toolkit ouvre l'entraînement de LoRA pour MiniMax H3
L'AI Toolkit d'Ostris a intégré lundi le support de l'entraînement text-to-video et image-to-video pour MiniMax H3, dans la foulée immédiate de la publication des poids ouverts du modèle. La nouvelle extension embarque le pipeline complet : transformer à jetons compactés, VAE vidéo-audio, encodeur de texte et utilitaires de quantization NVFP4. Les deux déclinaisons du modèle, FL2VA et Ref2VA, sont couvertes, avec la gestion des paires image-vidéo nécessaire à l'entraînement I2V. Le débruitage conjoint de la vidéo et de l'audio stéréo, signature de H3, est préservé pendant l'entraînement — les LoRA héritent donc aussi du comportement sonore du modèle. Grâce au gradient checkpointing du VAE et à la quantization, la personnalisation d'un modèle vidéo de 33,1 milliards de paramètres se lance en GUI ou en ligne de commande sur un GPU grand public.
Le cycle se compte désormais en heures : poids ouverts le lundi matin, nœuds ComfyUI le même jour, entraînement LoRA le soir. Or c'est bien la personnalisation, pas la simple inférence, qui fait qu'un modèle s'installe durablement dans les ateliers — l'histoire de Stable Diffusion puis de FLUX l'a démontré. La question ouverte reste le coût réel en heures de calcul d'un LoRA vidéo-audio propre, que les premiers retours de terrain diront.