Larssen Consulting
Modèles de langage

Multimodal

Un modèle multimodal est un modèle d’IA capable de traiter plusieurs types de contenus dans une même demande, par exemple du texte, des images, du son ou de la vidéo, au lieu de se limiter au texte.

  • Lecture : 3 minutes
  • Mis à jour le 8 octobre 2026
  • 6 sources

En clair

Un modèle limité au texte est comme un collègue joignable uniquement par écrit : pour lui parler d’un schéma, il faut le lui décrire. Un modèle multimodal est un collègue à qui l’on peut montrer le schéma, faire écouter un enregistrement ou transmettre un formulaire scanné. Il regarde, écoute, et répond en tenant compte de l’ensemble de ce qu’on lui a remis.

« Modalité » désigne simplement un type de contenu : le texte en est une, l’image une autre, le son une troisième. Tous les modèles ne couvrent pas les mêmes, et il faut distinguer ce qu’un modèle accepte en entrée de ce qu’il sait produire. Certains lisent des images mais ne répondent qu’en texte ; d’autres génèrent aussi des images ou de la voix.

Un exemple

Un réseau de magasins reçoit chaque jour des photos de rayons prises par ses équipes. Un modèle multimodal compare chaque photo au plan d’implantation, signale les produits manquants ou mal placés et rédige un compte rendu par magasin.

Autre cas fréquent : la saisie de factures ou de bons de livraison scannés, où le modèle lit le document, tableaux compris, et en extrait les champs utiles. Une vérification reste nécessaire sur les montants.

Niveau technique

Comment ça marche

Le principe est de tout ramener à une suite d’éléments comparables aux tokens du texte. Une image est découpée en petits carrés, chacun converti en vecteur et traité comme un mot : c’est l’idée du Vision Transformer, publié en 2020 1. Le son et la vidéo sont découpés de façon analogue. Ces éléments rejoignent ceux du texte, et le même réseau traite l’ensemble.

Encore faut-il relier le texte et l’image. En 2021, le modèle CLIP a montré qu’on pouvait apprendre des représentations visuelles en associant 400 millions d’images à leur légende 2. Les grands modèles de langage ont suivi : le rapport technique de GPT-4, en 2023, décrit un modèle acceptant texte et images 3, et la famille Gemini, présentée la même année, traite texte, image, audio et vidéo 4.

Ces contenus consomment la fenêtre de contexte. Dans la documentation de Gemini, une petite image compte pour 258 tokens, une seconde de son pour 32 tokens et une seconde de vidéo pour 263 tokens 5 : une heure de vidéo pèse bien plus lourd qu’un long rapport. Les capacités évoluent à chaque génération ; la documentation du modèle fait foi sur les formats acceptés et leurs limites.

Ce que ça change pour une entreprise

Une grande partie de l’information d’une entreprise n’est pas du texte propre : documents scannés, photos de terrain, captures d’écran, plans, appels enregistrés, réunions filmées. Le multimodal permet de les traiter sans chaîne spécialisée pour chaque format, et souvent avec le même modèle que pour le texte.

Les limites sont à tester sur vos propres documents. Les images de mauvaise qualité, pivotées ou très petites, les tableaux denses et la localisation précise d’un élément restent des sources d’erreur 6, et le modèle peut décrire avec assurance un détail qu’il a mal lu. Images, son et vidéo coûtent des tokens, parfois beaucoup. Enfin, photos et enregistrements contiennent souvent des données personnelles, ce qui appelle une vérification juridique.

Idées reçues

  • « Multimodal veut dire que l’IA voit comme nous. »

    Elle convertit l’image en nombres et en tire des régularités. Elle peut réussir une lecture difficile et échouer sur un détail évident.

  • « Un modèle multimodal sait tout produire. »

    Entrées et sorties sont deux questions distinctes. Un modèle peut lire des images sans en générer.

  • « Il suffit d’envoyer la vidéo entière. »

    La vidéo et le son occupent beaucoup de place dans le contexte. Sélectionner les passages utiles reste souvent nécessaire.

Sources

  1. Dosovitskiy et al., « An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale », 2020
  2. Radford et al., « Learning Transferable Visual Models From Natural Language Supervision », 2021
  3. OpenAI, « GPT-4 Technical Report », 2023
  4. Gemini Team (Google), « Gemini: A Family of Highly Capable Multimodal Models », 2023
  5. Google, documentation de l’API Gemini, « Understand and count tokens »
  6. Anthropic, documentation Claude, « Vision »

Voir aussi