Recherche sémantique
Docs, tickets, catalogue.
Un embedding est une représentation numérique dense (un vecteur) d'un texte, d'une image ou d'une entité, placée dans un espace où la proximité reflète une similarité sémantique. Popularisés par Word2Vec (Mikolov et al.) puis généralisés par des encodeurs type BERT, les embeddings alimentent la recherche sémantique, le clustering et le RAG. Ils ne « comprennent » pas seuls : ils mesurent des distances utiles.
En une phrase
Un embedding transforme un contenu en vecteur pour comparer le sens, pas seulement les mots.
À retenir
Fiche du terme
Word2Vec a montré que des vecteurs appris sur co-occurrences capturent des analogies. BERT et les encodeurs modernes produisent des embeddings contextualisés : le même mot change selon la phrase.
En pratique PME : on découpe des documents, on calcule un vecteur par chunk, on indexe, puis on récupère les chunks proches d'une question avant de les passer à un LLM.
Attention aux pièges : similarité ≠ vérité ; des documents hors sujet mais lexicalement proches peuvent remonter si le découpage est mauvais.
Nettoyer, découper (chunking), métadonnées (source, date).
Modèle multilingue si FR/EN/ES ; tester sur vos requêtes.
Base vectorielle + filtres métadonnées.
Precision@k sur questions métier réelles.
Un distributeur industriel indexe 4 000 fiches techniques. Un client demande « joint résistant vapeur alimentaire ». La recherche lexicale rate le synonyme « gasket steam food-grade » ; la recherche par embeddings remonte la bonne fiche. Le commercial gagne plusieurs minutes par appel.
Docs, tickets, catalogue.
Contexte pertinent pour un LLM.
Regrouper tickets ou produits proches.
Contenus ou items similaires.
| Embedding | Recherche lexicale (BM25) | |
|---|---|---|
| Signal | Proximité sémantique vectorielle | Recouvrement de termes |
| Synonymes | Souvent mieux gérés | Faibles sans synonymes explicites |
| Exact match | Parfois moins précis (SKU, codes) | Excellent sur identifiants |
| Pratique | Souvent hybride (vecteur + lexique) | Simple et prévisible |
Vos connaissances sont enfouies dans des PDF et tickets. Les embeddings les rendent trouvables par intention, pas seulement par mot exact — condition pour un assistant documentaire crédible.
Oui quand le corpus change ; automatisez le pipeline pour les nouveaux docs.
Celle du modèle choisi ; plus grand n'est pas toujours mieux pour votre domaine.
Utilisez un encodeur multilingue et testez FR↔EN sur vos paires réelles.
Base vectorielle gérée ou pgvector ; chiffrement et contrôles d'accès comme pour toute DB sensible.
Vous voulez une recherche qui comprend l'intention ? Nous mettons en place embeddings, index et évaluation sur votre corpus.
Mettre en place la recherche sémantique