¿Qué es un Embedding en IA?

Un embedding es un vector de números que representa un token o una palabra dentro de un espacio de muchas dimensiones. Es la forma en que un modelo convierte el lenguaje, que no puede procesar directamente, en números con los que sí puede calcular.
En el proceso de cómo funciona la IA por dentro hay un paso justo después de la tokenización: cada token se transforma en uno de estos vectores. Ese es el embedding. Sin él, el modelo solo tendría números de identificación sin ningún significado asociado.
La idea central es simple y potente: colocar cada palabra en un espacio de forma que las palabras con significados o usos parecidos queden cerca unas de otras. La cercanía en ese espacio codifica relaciones de significado.
De la palabra al vector
Sección titulada «De la palabra al vector»Cada token del vocabulario tiene asignado un vector. El modelo guarda una tabla enorme, la matriz de embeddings, con una fila por cada token. Cuando llega un token, el modelo busca su fila y saca su vector.
Al principio esos vectores son aleatorios. Durante el entrenamiento, el modelo va ajustando los números de cada vector para que reflejen cómo se usa cada palabra en los datos. Palabras que aparecen en contextos parecidos acaban con vectores parecidos.
Un embedding no es una definición ni un significado escrito. Es una posición en un espacio, aprendida a partir de millones de ejemplos de uso.
Qué es un espacio de muchas dimensiones
Sección titulada «Qué es un espacio de muchas dimensiones»Un vector de embedding no tiene dos o tres números, sino cientos o miles. Cada número es una coordenada en una dimensión distinta.
No podemos visualizar un espacio de mil dimensiones, pero la matemática funciona igual que en dos o tres: cada palabra es un punto, y se puede medir la distancia entre dos puntos. Cuantas más dimensiones, más matices de uso puede capturar el vector, porque hay más ejes independientes donde situar cada palabra.
Cercanía es significado
Sección titulada «Cercanía es significado»En este espacio, la distancia entre dos vectores indica cuánto se parecen dos palabras en su uso. La medida habitual es la similitud del coseno, que compara la dirección de los dos vectores en lugar de su longitud.
El paper Efficient Estimation of Word Representations in Vector Space de Mikolov et al., que introdujo el método conocido como word2vec, demostró que estos vectores capturan relaciones sintácticas y semánticas entre palabras y permiten medir su similitud de forma eficiente. GloVe, descrito por Pennington, Socher y Manning en la Universidad de Stanford, llegó a un tipo de representación equivalente por otra vía: a partir de las estadísticas de co-ocurrencia de las palabras en un corpus, es decir, con qué frecuencia aparecen juntas.
La aritmética de significados
Sección titulada «La aritmética de significados»Uno de los resultados más llamativos de los embeddings es que las relaciones entre palabras se pueden expresar como operaciones entre vectores. La documentación de GloVe lo ilustra con un caso claro: la diferencia entre los vectores de “hombre” y “mujer” es aproximadamente la misma que la diferencia entre “rey” y “reina”, o entre “hermano” y “hermana”. El vector ha codificado la idea de género como una dirección constante dentro del espacio.
Esto no significa que el modelo entienda qué es un rey o qué es el género. Significa que, al colocar las palabras según su uso real, esas regularidades del lenguaje quedan reflejadas como regularidades geométricas que se pueden sumar y restar.
Embeddings estáticos y contextuales
Sección titulada «Embeddings estáticos y contextuales»Los primeros métodos, como word2vec y GloVe, asignan un único vector fijo a cada palabra. Son embeddings estáticos. El problema es que una misma palabra puede significar cosas distintas: “banco” puede ser un asiento, una entidad financiera o la orilla de un río. Con un solo vector, las tres acepciones se mezclan en un mismo punto.
Los embeddings contextuales resuelven esto. El paper Deep contextualized word representations de Peters et al., que introdujo ELMo, propuso representaciones que cambian según el contexto en que aparece la palabra, precisamente para modelar la polisemia. El paper BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding de Devlin et al. generalizó esta idea sobre el Transformer. En un modelo así, “banco” recibe un vector distinto en “me senté en el banco” que en “saqué dinero del banco”, porque el mecanismo de atención tiene en cuenta las palabras de alrededor antes de fijar la representación.
Dónde encajan en el modelo
Sección titulada «Dónde encajan en el modelo»El embedding es la puerta de entrada. Una vez que el token se ha convertido en vector, ese vector es lo que recorre el resto del modelo: pasa por los bloques de atención, se enriquece con el contexto, y al final del recorrido el modelo produce los logits que, tras softmax y sampling, deciden el siguiente token.
Dicho de otro modo: el modelo nunca trabaja con palabras. Trabaja con estos vectores de principio a fin.
Para qué se usan
Sección titulada «Para qué se usan»Los embeddings son la base de muchas aplicaciones más allá de generar texto:
Búsqueda semántica: buscar por significado y no solo por palabras exactas. Dos textos con vectores cercanos tratan temas parecidos aunque no compartan las mismas palabras.
RAG: en la generación aumentada por recuperación, tanto los documentos como la pregunta del usuario se convierten en embeddings para encontrar los fragmentos más relevantes por cercanía.
Agrupación y clasificación: agrupar textos parecidos o clasificarlos por tema comparando la posición de sus vectores.
Qué pasa en la práctica
Sección titulada «Qué pasa en la práctica»- Dos frases que dicen lo mismo con palabras distintas tienen embeddings cercanos; por eso la búsqueda semántica encuentra lo que la búsqueda por palabra exacta se pierde.
- La calidad de un embedding depende de los datos con los que se entrenó, y sus sesgos se heredan.
- Cambiar el modelo de embeddings obliga a recalcular todos los vectores guardados, porque cada modelo tiene su propio espacio y sus vectores no son comparables con los de otro.
Error común
Sección titulada «Error común»Creer que un embedding “entiende” el significado de la palabra. No lo entiende. Codifica cómo se usa esa palabra en los datos de entrenamiento, expresado como una posición en un espacio. Que la geometría refleje relaciones de significado es consecuencia de cómo usamos el lenguaje, no de que el modelo comprenda nada.