Qu'est-ce que le multimodal ?

Mis à jour le

Une modalité, c'est quoi ?

En intelligence artificielle, une modalité désigne un type de donnée : le texte, les images, l'audio ou la vidéo sont chacun une modalité distincte. Imaginez les sens humains : la vue traite des images, l'ouïe traite du son, la lecture traite du texte. Un modèle d'IA classique n'en « comprend » généralement qu'un seul — le texte, dans la plupart des cas.

Les modalités les plus courantes en IA sont les suivantes :

Modalité Ce que l'IA peut en faire Exemple d'usage
Texte Lire, rédiger, résumer, traduire, coder Rédiger un email, répondre à une question, générer du code
Image Analyser, décrire, générer Décrire une photo, extraire du texte d'un document scanné, créer une illustration
Audio / Son Transcrire, identifier, générer de la musique Retranscrire une réunion, composer une musique d'ambiance
Vidéo Analyser, générer Créer une courte animation à partir d'un texte descriptif

Ce que permet une IA multimodale

Un modèle multimodal est capable de traiter plusieurs modalités en même temps, dans la même requête. C'est ce qui change tout : vous n'êtes plus contraint de décrire une image par écrit pour que l'IA la comprenne. Vous pouvez lui envoyer l'image directement et poser votre question à son sujet.

Concrètement, cela ouvre des usages qui étaient impossibles avec un modèle purement textuel :

  • Envoyer une photo d'un reçu et demander à l'IA de l'intégrer dans un tableau de dépenses.
  • Joindre un PDF (contrat, rapport, notice) et demander un résumé ou des explications.
  • Partager une capture d'écran d'un message d'erreur et obtenir une explication.
  • Générer une image à partir d'une description textuelle.
  • Créer une musique ou une vidéo en décrivant ce que vous souhaitez.

Il est important de noter que tous les modèles ne sont pas multimodaux. Certains ne traitent que du texte : ils peuvent répondre à vos questions avec précision, mais sont incapables d'analyser une image ou de générer un son. Les capacités multimodales sont propres aux modèles les plus récents, entraînés spécifiquement sur plusieurs types de données. C'est pourquoi un outil comme Modik associe différents modèles selon la tâche demandée — voir la page sur les modèles de langage pour en comprendre le fonctionnement.

Le multimodal dans Modik

Modik est conçu pour exploiter les capacités multimodales des meilleurs modèles disponibles. Selon votre formule, vous avez accès à tout ou partie des modalités suivantes :

  • Chat et analyse de documents : dans l'interface de chat, vous pouvez joindre une image ou un PDF à votre message. L'IA analyse le contenu et vous répond en tenant compte de ce qu'elle y lit ou y voit. Cette fonctionnalité est disponible avec toutes les formules. Pour savoir comment l'utiliser, consultez la page Utiliser le chat.
  • Génération d'images : à partir d'un texte descriptif (un prompt), Modik génère une illustration. Disponible avec toutes les formules. En savoir plus : comment fonctionne la génération d'images.
  • Vidéos et musique : disponibles dans toutes les formules, dès Modik M1. Vous décrivez ce que vous souhaitez obtenir, et Modik génère le contenu correspondant.
  • Voix off : à partir d'un texte, Modik génère une voix off exportée en MP3. Ce module est réservé aux formules M5, M10 et M20. En savoir plus : générer une voix off.

Pour chaque génération d'image, de vidéo ou de musique, le coût en tokens est estimé et affiché avant que vous ne lanciez la création. Vous gardez ainsi le contrôle de votre réservoir à chaque étape.

Comment l'IA analyse-t-elle une image ?

Quand vous envoyez une image à un modèle multimodal, il ne la « voit » pas au sens humain du terme. Il l'analyse de façon statistique : il reconnaît des formes, des textes, des objets, des couleurs et des relations visuelles, à partir de milliards d'exemples qu'il a traités lors de son entraînement.

En pratique, cela lui permet de décrire le contenu d'une photo avec précision, d'extraire du texte d'un document scanné ou de répondre à des questions spécifiques sur une image. Ses réponses restent toutefois probabilistes : comme pour le texte, il peut se tromper, interpréter de façon erronée ou manquer des détails subtils. Relisez toujours les informations extraites d'un document important avant de les réutiliser.

Questions fréquentes

Puis-je envoyer une image ou un PDF à l'IA dans Modik ?

Oui. Dans l'interface de chat, vous pouvez joindre une image ou un PDF directement à votre message. L'IA analyse le contenu du fichier et vous répond en tenant compte de ce qu'elle y a lu. Veillez à poser votre question clairement pour orienter l'analyse.

Quelle différence entre « multimodal » et « multimédia » ?

Le multimédia désigne simplement la présence de plusieurs types de contenus (texte, image, son) dans un document ou une application. Le multimodal va plus loin : il décrit la capacité d'un modèle d'IA à comprendre et à raisonner sur ces différents types de contenus de façon simultanée, dans la même requête.

Tous les modèles d'IA sont-ils multimodaux ?

Non. Beaucoup de modèles ne traitent que du texte. Les capacités multimodales (compréhension d'images, génération d'images, traitement audio…) sont propres à certains modèles récents. C'est pourquoi Modik sélectionne automatiquement le modèle adapté selon le type de tâche que vous lancez.

L'IA peut-elle « voir » une image comme un humain le ferait ?

Pas tout à fait. L'IA ne perçoit pas les images comme les yeux humains : elle les analyse de façon statistique, en reconnaissant des formes, des textes, des objets et des relations visuelles à partir de très nombreux exemples appris lors de son entraînement. Elle peut décrire une image, en extraire du texte ou répondre à des questions précises, mais son « regard » reste probabiliste, non sensoriel.

Quelles modalités sont disponibles selon ma formule Modik ?

Les modules chat, images, vidéos, musique, transcription audio et réseaux sociaux sont inclus dès Modik M1. Le module voix off est réservé aux formules M5, M10 et M20. Les formules supérieures offrent plus de tokens et débloquent des modules avancés comme la voix off. Les coûts en tokens sont estimés et affichés avant chaque génération.

Une question sur Modik ? Le plus simple est encore d'essayer.

Ouvrir Modik