Qué son los embeddings en inteligencia artificial

Qué son los embeddings en inteligencia artificial

Los embeddings son representaciones numéricas densas de texto, imágenes, audio u otros objetos. Cada elemento se convierte en un vector; los objetos semánticamente parecidos tienden a quedar próximos en ese espacio.

Gracias a esa propiedad, una aplicación puede buscar documentos por significado, recomendar productos similares, agrupar contenidos y recuperar contexto para un sistema RAG.

Qué es un vector de embedding

Un vector es una lista ordenada de números:

[0.018, -0.442, 0.107, ...]

La dimensión depende del modelo. Cada número individual no suele tener una interpretación humana directa; el patrón completo codifica características útiles aprendidas durante el entrenamiento.

Dos frases como “cancelar mi suscripción” y “dar de baja el servicio” pueden quedar cerca aunque compartan pocas palabras.

Cómo se crean

Un modelo recibe el contenido y produce un vector:

contenido → modelo de embeddings → vector

Para texto, el modelo procesa tokens y genera una representación del fragmento. Para imágenes o audio, utiliza arquitecturas adaptadas a ese medio. Algunos modelos multimodales colocan diferentes formatos en un espacio compatible.

No calcules embeddings con modelos distintos y compares sus vectores como si pertenecieran al mismo espacio.

Similitud entre vectores

Similitud coseno

Mide el ángulo:

coseno(a, b) = (a · b) / (||a|| ||b||)

Un valor mayor suele indicar más similitud, según el modelo y la normalización.

Distancia euclidiana

Mide la distancia recta entre puntos. Puede ser adecuada si el modelo y el índice fueron diseñados para esa métrica.

Producto punto

Es rápido y frecuente en recuperación. Con vectores normalizados se relaciona estrechamente con coseno.

Usa la métrica recomendada por el modelo. No establezcas un umbral universal sin validar tu dominio.

Ejemplo de búsqueda semántica

  1. Divide el corpus en fragmentos.
  2. Genera un embedding para cada fragmento.
  3. Guarda vector, texto y metadatos.
  4. Genera el embedding de la consulta.
  5. Busca vecinos cercanos.
  6. Devuelve o reordena los candidatos.

Consulta: “¿Cómo puedo devolver un pedido?”

El sistema puede recuperar una política titulada “Reembolsos y cambios” aunque la palabra “devolver” no aparezca.

Embeddings vs búsqueda por palabras

Enfoque Fortalezas Limitaciones
Palabras clave Exactitud literal, códigos, nombres No capta sinónimos bien
Embeddings Significado y similitud Puede fallar con detalles exactos
Híbrido Combina ambos Más complejidad

Para catálogos y documentos empresariales, un enfoque híbrido suele equilibrar códigos exactos y lenguaje natural.

Bases de datos vectoriales

Un índice vectorial organiza embeddings para buscar vecinos aproximados sin comparar uno por uno. Puede ser:

  • una extensión de una base relacional;
  • un motor de búsqueda con vectores;
  • una base vectorial dedicada;
  • una biblioteca local.

Además del vector, guarda:

  • identificador;
  • contenido o referencia;
  • fuente;
  • fecha;
  • idioma;
  • permisos;
  • versión;
  • etiquetas.

Los metadatos permiten filtrar antes o durante la búsqueda.

Chunking y contexto

La unidad que conviertes en embedding importa:

  • Documento completo: demasiados temas mezclados.
  • Frase aislada: puede perder contexto.
  • Sección coherente: suele equilibrar precisión y contexto.

Prueba tamaño, solapamiento y límites semánticos. Las tablas, preguntas frecuentes y código pueden requerir reglas específicas.

Casos de uso

Búsqueda semántica

Encuentra contenido por intención y significado.

Recomendaciones

Busca productos, artículos o usuarios cercanos en el espacio.

Clustering

Agrupa contenido sin etiquetas. Técnicas como K-means pueden operar sobre embeddings, aunque la alta dimensionalidad requiere evaluación.

Clasificación

Usa los vectores como características para un clasificador.

Detección de duplicados

Identifica textos casi equivalentes, no solo copias exactas.

RAG

Recupera fragmentos relevantes antes de generar una respuesta.

Ejemplo conceptual en Python

La API exacta depende del proveedor, pero el flujo es:

documentos = [
    "Política de devolución de productos",
    "Guía para restablecer la contraseña",
    "Condiciones de envío internacional",
]

vectores_documentos = modelo.embed(documentos)
vector_consulta = modelo.embed(["Cómo devolver una compra"])[0]

resultados = indice.buscar(
    vector=vector_consulta,
    top_k=5,
    filtros={"idioma": "es"},
)

Guarda la versión del modelo. Si cambias de modelo, normalmente debes volver a vectorizar el corpus.

Evaluar embeddings

No basta con mirar dos ejemplos. Crea un conjunto de consultas con resultados relevantes esperados y mide:

  • recall@k;
  • precision@k;
  • mean reciprocal rank;
  • nDCG;
  • tasa de consultas sin resultado;
  • latencia y costo;
  • rendimiento por idioma, tema y longitud.

Revisa manualmente errores: términos ambiguos, negaciones, números, entidades y documentos parecidos con políticas diferentes.

Límites y riesgos

  • La cercanía semántica no garantiza exactitud factual.
  • Los vectores pueden codificar sesgos.
  • Datos sensibles siguen siendo sensibles.
  • Una actualización documental exige reindexación.
  • El umbral cambia por dominio y modelo.
  • Los embeddings pueden ser vulnerables a extracción o inferencias.
  • La alta similitud no significa causalidad ni identidad.
  • El contenido adversarial puede manipular recuperación.

Aplica permisos antes de devolver resultados, cifra almacenamiento y limita registros de consultas.

Embeddings vs one-hot

One-hot crea un vector disperso donde cada categoría ocupa una posición. No captura similitud por sí mismo. Un embedding es denso y aprendido: categorías relacionadas pueden quedar cercanas.

Aspecto One-hot Embedding
Dimensión Número de categorías Fija por modelo
Densidad Disperso Denso
Similitud semántica No implícita
Interpretación Directa Distribuida

Buenas prácticas

  1. Define qué significa “relevante”.
  2. Usa un modelo apropiado para idioma y dominio.
  3. Normaliza según la métrica.
  4. Guarda modelo y versión.
  5. Incluye metadatos y permisos.
  6. Evalúa con consultas reales.
  7. Combina búsqueda léxica cuando existan códigos.
  8. Reindexa de forma controlada.
  9. Monitorea deriva y contenido obsoleto.
  10. No uses similitud como prueba factual.

Preguntas frecuentes

¿Qué es un embedding en palabras simples?
Es una lista de números que representa características aprendidas de un contenido para comparar similitud.

¿Para qué sirven los embeddings?
Para búsqueda semántica, recomendaciones, clustering, clasificación, deduplicación y recuperación para RAG.

¿Qué significa que dos vectores estén cerca?
Que el modelo considera similares sus representaciones según una métrica. No garantiza que ambos contenidos sean verdaderos o idénticos.

¿Qué es una base de datos vectorial?
Es un sistema que almacena vectores y permite buscar vecinos similares de forma eficiente.

¿Puedo comparar embeddings de modelos diferentes?
En general no. Cada modelo crea su propio espacio y dimensionalidad.

¿Los embeddings contienen el texto original?
No son una copia legible, pero pueden conservar información sensible y deben protegerse como datos derivados.

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

Subir