Aller au contenu

Qu'est-ce qu'un embedding ? Vecteurs et similarité sémantique

Un embedding est une représentation numérique dense (un vecteur) d'un texte, d'une image ou d'une entité, placée dans un espace où la proximité reflète une similarité sémantique. Popularisés par Word2Vec (Mikolov et al.) puis généralisés par des encodeurs type BERT, les embeddings alimentent la recherche sémantique, le clustering et le RAG. Ils ne « comprennent » pas seuls : ils mesurent des distances utiles.

En une phrase

Un embedding transforme un contenu en vecteur pour comparer le sens, pas seulement les mots.

À retenir

  • Textes proches en sens ont des vecteurs proches (cosine / produit scalaire).
  • Base de la recherche sémantique et du RAG avec les LLM.
  • La qualité dépend du modèle d'encodeur et du domaine.
  • Il faut stocker et indexer les vecteurs (base vectorielle) pour scaler.

Fiche du terme

Embedding
Plongement vectoriel · Vector embedding · Représentation dense
Terme anglais
Embedding
Domaine
Intelligence artificielle
Catégorie
Représentation / NLP
Niveau
Intermédiaire

Que signifie exactement « embedding » ?

Word2Vec a montré que des vecteurs appris sur co-occurrences capturent des analogies. BERT et les encodeurs modernes produisent des embeddings contextualisés : le même mot change selon la phrase.

En pratique PME : on découpe des documents, on calcule un vecteur par chunk, on indexe, puis on récupère les chunks proches d'une question avant de les passer à un LLM.

Attention aux pièges : similarité ≠ vérité ; des documents hors sujet mais lexicalement proches peuvent remonter si le découpage est mauvais.

Comment met-on en œuvre des embeddings ?

  1. 01

    Préparer le corpus

    Nettoyer, découper (chunking), métadonnées (source, date).

  2. 02

    Choisir l'encodeur

    Modèle multilingue si FR/EN/ES ; tester sur vos requêtes.

  3. 03

    Indexer

    Base vectorielle + filtres métadonnées.

  4. 04

    Évaluer la retrieval

    Precision@k sur questions métier réelles.

Exemple concret d'embedding

Un distributeur industriel indexe 4 000 fiches techniques. Un client demande « joint résistant vapeur alimentaire ». La recherche lexicale rate le synonyme « gasket steam food-grade » ; la recherche par embeddings remonte la bonne fiche. Le commercial gagne plusieurs minutes par appel.

À quoi servent les embeddings ?

Recherche sémantique

Docs, tickets, catalogue.

RAG

Contexte pertinent pour un LLM.

Déduplication / clustering

Regrouper tickets ou produits proches.

Recommandation

Contenus ou items similaires.

Avantages et limites des embeddings

  • Robustesse aux synonymes
  • Fondation du RAG
  • Scalable avec index ANN
  • Réutilisable multi-cas d'usage
  • Coût d'indexation et de réindexation
  • Qualité liée au modèle et au chunking
  • Similarité ≠ exactitude factuelle
  • Données sensibles dans l'index à protéger

Quelle différence entre embedding et mot-clé (BM25) ?

EmbeddingRecherche lexicale (BM25)
SignalProximité sémantique vectorielleRecouvrement de termes
SynonymesSouvent mieux gérésFaibles sans synonymes explicites
Exact matchParfois moins précis (SKU, codes)Excellent sur identifiants
PratiqueSouvent hybride (vecteur + lexique)Simple et prévisible

Pourquoi les embeddings comptent pour une PME québécoise ?

Vos connaissances sont enfouies dans des PDF et tickets. Les embeddings les rendent trouvables par intention, pas seulement par mot exact — condition pour un assistant documentaire crédible.

Questions fréquentes

Faut-il réindexer souvent ?

Oui quand le corpus change ; automatisez le pipeline pour les nouveaux docs.

Quelle dimension de vecteur ?

Celle du modèle choisi ; plus grand n'est pas toujours mieux pour votre domaine.

Multilingue ?

Utilisez un encodeur multilingue et testez FR↔EN sur vos paires réelles.

Où stocker ?

Base vectorielle gérée ou pgvector ; chiffrement et contrôles d'accès comme pour toute DB sensible.

Termes associés

Sources et références

Vous voulez une recherche qui comprend l'intention ? Nous mettons en place embeddings, index et évaluation sur votre corpus.

Mettre en place la recherche sémantique
Glossaire