En clair
Sur une carte, deux villes voisines ont des coordonnées voisines. Un embedding applique cette idée au sens : chaque texte reçoit des coordonnées, et deux textes qui parlent de la même chose se retrouvent côte à côte, même s’ils n’ont aucun mot en commun. « Résilier mon abonnement » et « je veux arrêter mon contrat » sont voisins sur cette carte.
La différence avec une carte routière tient au nombre de dimensions : non pas deux, mais des centaines ou des milliers, ce qui permet de coder des nuances de sujet, de ton ou de langue. Personne ne lit ces nombres. On s’en sert pour mesurer des distances : chercher les documents les plus proches d’une question, regrouper des avis clients par thème, repérer des doublons.
Un exemple
Un assureur dispose de 40 000 fiches internes. Avec une recherche par mots-clés, un conseiller qui tape « dégât des eaux chez le voisin » ne trouve pas la fiche intitulée « responsabilité civile en cas de sinistre causé à un tiers ».
L’entreprise calcule un embedding pour chaque fiche et le range dans une base vectorielle. À chaque question, le système calcule l’embedding de la question et remonte les fiches les plus proches par le sens. C’est la première moitié d’un système de RAG.
Comment ça marche
L’idée s’est imposée en 2013 avec word2vec, qui apprend un vecteur par mot à partir de très grands corpus. Ses auteurs rappellent que ces vecteurs capturent des régularités de sens : le vecteur de « roi », moins celui d’« homme », plus celui de « femme », donne un résultat proche du vecteur de « reine » 1.
- DécouperLes documents sont divisés en passages de taille raisonnable.
- EncoderUn modèle convertit chaque passage en vecteur.
- StockerLes vecteurs sont rangés dans une base vectorielle.
- ComparerLa question, convertie à son tour, est rapprochée des vecteurs voisins.
Les trois premières étapes se font une fois par document ; la dernière à chaque recherche.
Les modèles actuels produisent un vecteur pour une phrase ou un passage entier. Sentence-BERT, en 2019, a adapté un Transformer pour obtenir des embeddings de phrases comparables par similarité cosinus, c’est-à-dire par l’angle entre deux vecteurs ; trouver la paire la plus proche parmi 10 000 phrases passait d’environ 65 heures à environ 5 secondes 2.
Les dimensions vont de quelques centaines à quelques milliers : un modèle récent de Google produit par défaut des vecteurs de 3 072 dimensions, que l’on peut réduire, et accepte du texte, des images, du son et de la vidéo 4. Pour comparer les modèles, la référence est le banc d’essai MTEB, qui couvrait à son lancement en 2022 huit types de tâches et 112 langues ; ses auteurs concluaient qu’aucune méthode ne dominait partout 3.
Deux précautions. Des embeddings issus de modèles différents ne sont pas comparables entre eux : changer de modèle oblige à tout recalculer. Et la proximité mesure une ressemblance de sens, pas la vérité ni l’actualité : une fiche périmée peut être très proche de la question.
Ce que ça change pour une entreprise
Les embeddings rendent exploitable ce que les mots-clés manquent : recherche dans une base documentaire, routage de demandes, détection de doublons, recommandation, regroupement de verbatims. Ils sont aussi la brique de recherche de la plupart des systèmes de RAG, qui fournissent à un modèle de langage les passages utiles avant qu’il ne réponde.
Les coûts sont dans la mise en œuvre : préparation et découpage des documents, stockage et mise à jour des vecteurs, recalcul complet en cas de changement de modèle. La qualité dépend de la langue et du vocabulaire métier ; testez sur vos propres requêtes. La recherche par le sens ne remplace pas toujours les mots-clés : pour une référence produit ou un nom propre, la correspondance exacte reste plus sûre.
Idées reçues
- « Un embedding stocke le texte. »
Il en garde une empreinte numérique orientée vers le sens. On conserve le texte d’origine à côté pour pouvoir l’afficher.
- « Deux textes proches disent la même chose. »
Proches signifie « de sujet voisin ». Deux textes sur le même thème peuvent être voisins tout en affirmant des choses opposées.
- « Embedding et token, c’est pareil. »
Le token est un morceau de texte ; l’embedding est le vecteur qui représente un token, une phrase ou un document.
Sources
- Mikolov et al., « Efficient Estimation of Word Representations in Vector Space », 2013
- Reimers et Gurevych, « Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks », 2019
- Muennighoff et al., « MTEB: Massive Text Embedding Benchmark », 2022
- Google, documentation de l’API Gemini, « Embeddings »