Ir al contenido

¿Qué es un embedding? Vectores y similitud semántica

Un embedding es una representación numérica densa (un vector) de un texto, imagen o entidad, situada en un espacio donde la cercanía refleja similitud semántica. Popularizados por Word2Vec y generalizados por encodeurs tipo BERT, alimentan la búsqueda semántica, el clustering y el RAG. No «entienden» solos: miden distancias útiles.

En una frase

Un embedding convierte contenido en un vector para comparar el sentido, no solo las palabras.

Para recordar

  • Textos cercanos en sentido tienen vectores cercanos.
  • Base de la búsqueda semántica y del RAG con LLM.
  • La calidad depende del modelo encoder y del dominio.
  • Hay que almacenar e indexar vectores para escalar.

Ficha del término

Embedding
Incrustación vectorial · Vector embedding · Representación densa
Término en inglés
Embedding
Dominio
Inteligencia artificial
Categoría
Representación / NLP
Nivel
Intermedio

¿Qué significa exactamente «embedding»?

Word2Vec mostró que vectores aprendidos de coocurrencias capturan analogías. BERT produce embeddings contextualizados.

En la práctica pyme: se trocean documentos, se calcula un vector por chunk, se indexa y se recuperan chunks cercanos a una pregunta antes del LLM.

Trampa: similitud ≠ verdad; el mal chunking degrada los resultados.

¿Cómo se implementan los embeddings?

  1. 01

    Preparar el corpus

    Limpiar, trocear (chunking), metadatos.

  2. 02

    Elegir el encoder

    Modelo multilingüe si FR/EN/ES; probar con sus consultas.

  3. 03

    Indexar

    Base vectorial + filtros de metadatos.

  4. 04

    Evaluar la retrieval

    Precision@k sobre preguntas reales de negocio.

Ejemplo concreto de embedding

Un distribuidor industrial indexa 4 000 fichas técnicas. Un cliente pide una junta resistente al vapor de grado alimentario. La búsqueda léxica falla con sinónimos; la de embeddings encuentra la ficha correcta.

¿Para qué sirven los embeddings?

Búsqueda semántica

Docs, tickets, catálogo.

RAG

Contexto pertinente para un LLM.

Deduplicación / clustering

Agrupar tickets o productos cercanos.

Recomendación

Contenidos o ítems similares.

Ventajas y límites de los embeddings

  • Robustez ante sinónimos
  • Base del RAG
  • Escalable con índices ANN
  • Reutilizable en varios casos
  • Coste de indexación y reindexación
  • Calidad ligada al modelo y al chunking
  • Similitud ≠ exactitud factual
  • Datos sensibles en el índice a proteger

¿En qué se diferencia un embedding de BM25?

EmbeddingBúsqueda léxica (BM25)
SeñalProximidad semántica vectorialSolapamiento de términos
SinónimosA menudo mejorDébil sin sinónimos explícitos
Exact matchA veces peor (SKU, códigos)Excelente en identificadores
PrácticaA menudo híbridaSimple y predecible

Por qué los embeddings importan para una pyme quebequense

Su conocimiento está enterrado en PDF y tickets. Los embeddings lo hacen encontrable por intención, no solo por palabra exacta: condición para un asistente documental creíble.

Preguntas frecuentes

¿Hay que reindexar a menudo?

Sí cuando cambia el corpus; automatice el pipeline.

¿Qué dimensión de vector?

La del modelo elegido; más grande no siempre es mejor.

¿Multilingüe?

Use un encoder multilingüe y pruebe FR↔EN con pares reales.

¿Dónde almacenar?

Base vectorial gestionada o pgvector; cifre y controle el acceso.

Términos relacionados

Fuentes y referencias

¿Quiere una búsqueda que entienda la intención? Implantamos embeddings, índice y evaluación sobre su corpus.

Implantar búsqueda semántica
Glosario