Pendant longtemps, les intelligences artificielles étaient spécialisées dans une tâche précise.
Certaines étaient conçues pour comprendre du texte, d’autres pour reconnaître des images, générer de la voix ou analyser des vidéos.
Cette séparation est progressivement en train de disparaître.
Une nouvelle génération de systèmes d’intelligence
artificielle est désormais capable de comprendre plusieurs types de contenus à la fois : texte, image, son, vidéo et parfois même documents ou données structurées.
On parle alors de modèles multimodaux.
Une IA qui comprend plusieurs formats
Un modèle multimodal peut analyser une photographie tout en comprenant la question qui l’accompagne.
Il peut par exemple recevoir une image, lire le texte présent dessus, interpréter la situation représentée et répondre à une demande formulée en langage naturel.
Cette capacité change considérablement la relation entre l’utilisateur et l’intelligence artificielle.
Il n’est plus nécessaire de transformer toutes les informations en texte avant de les transmettre à la machine.
L’image, la voix et la vidéo deviennent directement des moyens de communiquer avec l’IA.
De la conversation à l’interaction
Avec les modèles multimodaux, l’utilisation de l’IA devient plus naturelle.
Un utilisateur peut montrer une photographie et demander ce qu’elle représente. Il peut fournir un document et demander une synthèse. Il peut parler à une IA, lui montrer un objet avec la caméra ou encore lui demander d’analyser une vidéo.
L’ordinateur ne reçoit donc plus uniquement des commandes écrites.
Il peut désormais observer, écouter et interpréter plusieurs formes d’informations simultanément.
Une évolution importante pour les entreprises
Cette technologie intéresse particulièrement les entreprises.
Dans le service client, une IA pourrait analyser simultanément les messages d’un client, les documents associés et certaines images.
Dans l’industrie, elle pourrait contribuer à analyser des images provenant de caméras et à détecter certaines anomalies.
Dans le commerce, elle pourrait aider à analyser des catalogues, des photographies de produits et les demandes des consommateurs.
Les applications potentielles sont donc extrêmement nombreuses.
La vidéo devient également une source de données
La vidéo représente une évolution particulièrement importante.
Une vidéo contient des images, des mouvements, des sons, des dialogues et parfois du texte.
Une IA capable de comprendre ces différentes informations peut aller beaucoup plus loin qu’un simple système de transcription.
Elle pourrait, par exemple, rechercher un événement précis dans une longue vidéo, résumer une réunion enregistrée ou identifier les différentes étapes d’une démonstration.
La vidéo pourrait ainsi devenir une nouvelle forme de donnée directement exploitable par l’intelligence artificielle.
Une IA plus proche de notre façon de communiquer
L’être humain communique rarement avec un seul type d’information.
Nous parlons, regardons des images, lisons des documents, observons notre environnement et utilisons simultanément plusieurs sens pour comprendre une situation.
Les modèles multimodaux cherchent justement à rapprocher l’IA de cette réalité.
Au lieu de demander à l’utilisateur de s’adapter à la machine, la machine commence progressivement à s’adapter aux différentes façons dont nous communiquons.
Des limites qui restent importantes
Cette évolution ne signifie cependant pas que les modèles multimodaux comprennent tout parfaitement.
Ils peuvent encore commettre des erreurs, mal interpréter une image, confondre certains éléments ou produire une réponse incorrecte.
Plus les informations deviennent complexes, plus la vérification humaine reste importante.
La multimodalité apporte donc de nouvelles capacités, mais elle ne supprime pas la nécessité de garder un regard critique sur les réponses fournies par l’IA.
Vers une IA capable de tout comprendre ?
Le développement des modèles multimodaux marque une étape importante dans l’évolution de l’intelligence artificielle.
Texte, image, voix et vidéo commencent à être réunis dans une même expérience.
Demain, nous pourrions ainsi utiliser une seule IA pour analyser un document, écouter une conversation, regarder une vidéo, comprendre une photographie et répondre oralement à nos questions.
L’intelligence artificielle devient progressivement moins spécialisée et beaucoup plus polyvalente.
Après les IA capables de comprendre le texte, puis celles capables de générer des images, la prochaine étape est peut-être justement celle d’une IA capable de comprendre notre monde à travers plusieurs formes d’informations en même temps.
Et cette évolution pourrait bien faire des modèles multimodaux le nouveau standard des outils d’intelligence artificielle.
.

