Thinking Machines dévoile l'« interaction model », l'IA qui écoute, regarde et parle en même temps
Thinking Machines Lab, le laboratoire fondé par l'ancienne directrice technique d'OpenAI Mira Murati, a présenté en juin son tout premier modèle, baptisé interaction model. Là où un assistant vocal attend la fin de la phrase pour répondre, ce système full-duplex traite l'audio, la vidéo et le texte par tranches de deux cents millisecondes — des « micro-tours » — pour écouter, regarder, réfléchir et parler simultanément. Sa latence de prise de parole tombe à quatre dixièmes de seconde, soit le tempo d'une conversation humaine, et il devance les modèles temps réel d'OpenAI et de Google sur les interruptions et les bruits de fond. L'architecture sépare une partie « présence », toujours à l'écoute et consciente du temps qui passe, d'une partie d'arrière-plan qui mène les raisonnements longs et les appels d'outils. Pour qui pense l'installation interactive ou la performance, c'est moins un chatbot de plus qu'un partenaire scénique capable de tenir le rythme du direct.
Le temps réel n'est pas un gadget de démonstration : c'est la différence entre un outil qu'on interroge et une présence avec laquelle on joue. Tant que la machine attendait la fin de la phrase, elle restait un guichet ; qu'elle écoute en parlant la rapproche du musicien qui répond à un autre sur scène. Reste à savoir quoi dire à quelqu'un qui ne se tait jamais — une latence basse ne garantit pas la justesse de l'écoute.