Comprendre le texte
Intentions, sentiment, topics.
Un modèle de langage estime la probabilité de suites de mots ou de tokens dans une langue. En apprenant sur de grands corpus, il prédit le prochain élément et peut ainsi compléter, classer ou générer du texte. Les architectures modernes s'appuient souvent sur les transformers (Vaswani et al., 2017). Ce n'est pas une base de connaissances garantie : c'est un modèle statistique du langage.
En une phrase
Un modèle de langage prédit la suite la plus probable d'un texte.
À retenir
Fiche du terme
Historiquement n-grammes et réseaux récurrents ; aujourd'hui attention et transformers dominent. Le papier « Attention Is All You Need » a ouvert la voie aux modèles massifs.
Un LM peut être entraîné pour une tâche (sentiment) ou de façon auto-supervisée puis adapté. La taille et les données déterminent capacités et coûts.
Pour une PME, « utiliser un modèle de langage » signifie souvent appeler une API ou un modèle open-weights — avec une couche métier (prompts, RAG, validation) autour.
Classification, extraction, génération, résumé — métrique claire.
Petit modèle local vs API LLM selon sensibilité et volume.
RAG, schémas JSON, listes de refus.
Jeux de tests métier, revue humaine, monitoring drift.
Un cabinet comptable montréalais utilise un modèle pour classer les e-mails clients (urgent / facture / question générale) avant routage. Le modèle ne décide jamais un montant fiscal : un humain valide. La précision mesurée sur 500 messages historiques guide le seuil d'automatisation.
Intentions, sentiment, topics.
E-mails, résumés, reformulations.
Champs structurés depuis documents.
Avec embeddings dérivés du modèle.
| Modèle de langage | Grand modèle de langage (LLM) | |
|---|---|---|
| Échelle | Peut être petit / spécialisé | Très grande échelle, généraliste |
| Capacités few-shot | Variables / limitées | Souvent fortes hors fine-tuning |
| Coût | Souvent plus bas | Plus élevé (API ou GPU) |
| Contrôle | Plus simple à borner parfois | Puissant mais plus difficile à maîtriser |
Ils accélèrent le traitement du texte (support, documents, marketing) à condition d'être encadrés. Le ROI vient des minutes gagnées et des erreurs évitées — pas de la démo générative.
Il modélise des patterns statistiques ; le « comprendre » humain est une métaphore utile mais trompeuse.
Rarement au début. Prompting, RAG ou fine-tuning léger suffisent souvent.
Non. Pour les faits métier, utilisez des sources vérifiables (RAG, API).
Testez sur vos formulations locales ; ajoutez glossaire et exemples dans le prompt ou la base RAG.
Vous voulez automatiser du texte sans perdre le contrôle métier ? Nous choisissons l'échelle de modèle et les garde-fous adaptés.
Encadrer votre usage LM