Embeddings: cómo la IA convierte palabras en coordenadas
Tabla de contenido

Embeddings: cómo la IA convierte palabras en coordenadas

Los embeddings explicados: cómo la IA convierte palabras en números, por qué rey menos hombre más mujer da reina y qué función de estudio hace posible.

Los embeddings explicados en una frase: son una lista de números que le da a una palabra, una oración o un documento una posición en un espacio donde la distancia significa diferencia de significado. Eso es todo. “Perro” se convierte en algo como [0,21, -0,88, 0,04, …] con unos cientos o unos miles de entradas, y “cachorro” queda cerca mientras “álgebra” queda lejos.

Es la idea importante más silenciosa de la IA y también la más enseñable. Tu hijo ya entiende coordenadas por un mapa. Los embeddings son un mapa con cientos de direcciones en lugar de dos. Y cuando Gemini en Google Classroom, en funcionamiento desde el 10 de agosto de 2026, construye tarjetas de estudio a partir de los materiales que subió el maestro y no de internet, los embeddings son la forma en que encuentra el pasaje correcto.

Puntos clave

  • Un embedding convierte texto en un vector: una lista de números de largo fijo. Los significados parecidos reciben vectores cercanos, y ese es todo el punto.
  • El artículo word2vec de Mikolov et al. (2013) mostró que estos vectores capturan relaciones lo bastante bien para hacer aritmética con significado, aprendiendo “vectores de palabras de alta calidad de un conjunto de 1.600 millones de palabras” en menos de un día.
  • La similitud se mide por distancia o ángulo entre vectores, no por letras compartidas. “Auto” y “automóvil” quedan cerca; “auto” y “autor” no.
  • Los embeddings son el paso de búsqueda en toda función de “conversa con tus documentos”, incluidas las guías de estudio hechas con materiales de clase.
  • El modo de falla que hay que enseñar: los embeddings capturan asociación estadística, así que también capturan los sesgos presentes en el texto de entrenamiento.

Qué es un vector y por qué los números le ganan a las palabras

Empecemos por el problema. Una computadora necesita comparar significado, y las letras no ayudan. “Auto” y “autor” comparten cuatro caracteres y no significan nada parecido. “Auto” y “automóvil” comparten cuatro y significan lo mismo.

Así que el truco es representar cada palabra como un punto en el espacio, ubicado de modo que la posición codifique el significado. En lugar de dos coordenadas como en un mapa, usa varios cientos. Cada dimensión es una dirección aprendida que captura algún aspecto de cómo se usa la palabra, y ninguna tiene nombre humano.

¿Cómo aprende el modelo dónde poner cada palabra? Mirando el contexto. Las palabras que aparecen en entornos parecidos reciben posiciones parecidas. “El ___ ladró” y “el ___ trajo la pelota” tienden a tener “perro” en el hueco, así que “perro” termina cerca de otras palabras que encajan en esos huecos.

El artículo fundacional es Mikolov, Chen, Corrado y Dean, “Efficient Estimation of Word Representations in Vector Space”, de 2013. Introdujo dos arquitecturas, CBOW y Skip-gram, y la razón de su importancia fue la eficiencia: aprendió “vectores de palabras de alta calidad de un conjunto de 1.600 millones de palabras” en menos de un día, lo que puso los embeddings al alcance de cualquiera con una computadora.

El resultado que lo volvió famoso es la aritmética. Como las relaciones quedan codificadas como direcciones en el espacio, puedes sumar y restar vectores. Toma el vector de “rey”, réstale “hombre”, súmale “mujer”, y la palabra más cercana al resultado es “reina”. La dirección de “hombre” a “mujer” resulta ser aproximadamente la misma dirección que de “rey” a “reina”, y que de “tío” a “tía”. Nadie programó eso. Emergió de contar qué palabras aparecen cerca de qué otras palabras.

La razón por la que los embeddings modernos pueden distinguir “banco del río” de “banco del dinero” es el mecanismo de atención presentado en el artículo de Vaswani et al. de 2017. Los sistemas actuales pasaron de vectores de palabra suelta a embeddings contextuales y de oración, donde un párrafo entero recibe un vector. La idea central no cambió: el significado se vuelve posición y la similitud se vuelve distancia.

Dónde se encuentra tu hijo con esto sin saberlo

Toda función que busca en tu propio material usa embeddings. El patrón es siempre el mismo, en tres pasos.

Paso uno: indexar. Corta el material fuente en fragmentos y calcula un embedding para cada uno. Guárdalos.

Paso dos: consultar. Calcula un embedding para la pregunta del estudiante.

Paso tres: recuperar. Encuentra los fragmentos guardados cuyos vectores están más cerca del vector de la pregunta, y pásalos al modelo como contexto. El artículo de Lewis et al. en NeurIPS 2020 formalizó este patrón como generación aumentada por recuperación, emparejando un “índice vectorial denso de Wikipedia” con un generador de texto.

Así es como Gemini en Google Classroom genera tarjetas y cuestionarios de práctica a partir de una tarea específica. El anuncio del 4 de agosto de 2026 dice que la función incorpora “el título relevante, las instrucciones de la tarea y los materiales curriculares como contexto directamente desde Google Classroom”, e incluye sincronización con Gemini Notebook para guías de estudio y resúmenes en audio. Salió en la web el 10 de agosto y en móvil el 17. Ese anclaje, materiales de clase en lugar de todo internet, corre sobre similitud de embeddings.

El resumen más amplio de Google de agosto de 2026 lista el mismo patrón de anclaje en preparación para el SAT y otras herramientas de estudio. Mismo mecanismo, otros lugares que tu hijo ya toca: la lista de “videos relacionados” de una plataforma de aprendizaje, la detección de plagio que atrapa paráfrasis, una barra de búsqueda que encuentra “cómo calculo el área” cuando el documento dice “cómputo de medidas de superficie”, y los filtros de spam que reconocen una estafa escrita con palabras nuevas.

La consecuencia importante para un estudiante: recuperar por significado significa que cortar mal produce respuestas malas. Si el PDF del maestro se parte a mitad de oración, el vector de ese fragmento representa media idea, y el contexto recuperado va a estar sutilmente mal. Cuando una herramienta de estudio da una respuesta incompleta con mucha confianza, esta suele ser la razón.

Qué hacen mal los embeddings

Los embeddings aprenden del texto, así que aprenden lo que el texto contiene, incluidas cosas que nadie quería que aprendieran.

La demostración canónica usó la misma aritmética que volvió famoso a word2vec. Si “rey menos hombre más mujer” da “reina”, entonces las analogías con ocupaciones pueden producir resultados que reflejan estereotipos presentes en el corpus de entrenamiento y no algo sobre el mundo. El mecanismo es neutral. Los datos no.

Dos límites más que vale conocer:

Similitud no es verdad. Dos pasajes pueden estar cerca en el espacio de embeddings y contradecirse, porque tratan del mismo tema. La recuperación encuentra texto relevante, no texto correcto.

La negación es difícil. “El experimento funcionó” y “el experimento no funcionó” quedan cerca en el espacio de embeddings, porque comparten casi todas sus palabras y el tema. Es una debilidad real y persistente, e importa para cualquier caso donde un chico intenta averiguar si una fuente apoya o refuta una afirmación.

Esos dos juntos explican una clase de errores de herramientas de estudio que parecen alucinación y no lo son. El modelo recuperó algo relevante y luego razonó a partir de ahí. La recuperación no estaba mal exactamente; era insuficientemente precisa.

¿Y en América Latina?

Hay un detalle regional que casi nadie menciona y que sí afecta a tu hijo: los embeddings multilingües se entrenan con muchísimo más texto en inglés que en español, y con todavía menos en portugués, quechua, guaraní o náhuatl. La consecuencia práctica es que la recuperación por significado funciona mejor en inglés. Cuando una herramienta de estudio no encuentra el pasaje correcto en un PDF en español, a veces no es un problema de cómo se formuló la pregunta; es que el espacio vectorial está menos afinado para ese idioma.

Hay un segundo efecto, más sutil. El español latinoamericano tiene variación regional fuerte: “computadora” y “ordenador”, “celular” y “móvil”, “colectivo”, “guagua”, “camión” y “bus para el mismo vehículo”. Si el material de clase usa una variante y tu hijo pregunta con otra, la distancia entre vectores es mayor de lo que debería. La solución práctica es simple y vale enseñarla: describe el concepto con más de una palabra (“el autobús, el colectivo”) en lugar de apostar a una sola.

Y un ángulo de oportunidad. Los datos de PISA 2025 de la OCDE muestran que los estudiantes colombianos están entre los que más usan chatbots de IA para aprender en la región. Si esos chicos entienden que la herramienta busca por significado y no por palabra exacta, pueden formular mucho mejor sus consultas. Es una ventaja de cinco minutos de explicación.

Cómo enseñarle esto a tu hijo

Los embeddings son coordenadas. Cualquier niño que haya jugado a la batalla naval o leído un mapa ya tiene el concepto; tú le agregas dimensiones y significado.

De 5 a 8 años: el mapa de palabras en el piso

Despeja un espacio en el piso. Pon un papel que diga “animales” en una esquina y “comida” en la esquina opuesta. Dale tarjetas con palabras (perro, gato, pizza, manzana, caballo, pan, tigre, pastel) y que ponga cada tarjeta más cerca de la esquina que le corresponda. Ahora agrega una tercera etiqueta, “grande”, en una silla, para que la altura sea una dimensión. Pregúntale dónde va “elefante”. Ponle nombre: “Acabas de darle un lugar a cada palabra. Las computadoras hacen esto con cientos de direcciones en lugar de tres, y así saben qué palabras significan cosas parecidas”.

De 9 a 12 años: matemática de palabras en dos dimensiones

Dibuja una cuadrícula x-y en papel milimetrado. Pon “hombre” en (2,2), “mujer” en (2,6), “rey” en (8,2). Pregúntale a tu hijo dónde debería ir “reina”. Casi todos dicen (8,6) de inmediato, porque ven el patrón. Después cuéntale que eso es exactamente lo que pasa en los embeddings reales: la dirección de “hombre” a “mujer” es la misma que de “rey” a “reina”, lo que el equipo de Mikolov publicó en 2013. Prueben unos más (tío/tía, niño/niña) y uno que se rompa (auto/autos contra el/los) y hablen de por qué los casos irregulares son más difíciles.

De 13 en adelante: ordenar por similitud y luego revisar a la máquina

Que tu hijo escriba una oración objetivo y diez oraciones candidatas, algunas del mismo tema con palabras distintas y otras de otro tema con palabras compartidas. Su trabajo: ordenar las diez por similitud de significado con la objetivo, a mano. Después que pegue las once en una herramienta de IA y le pida ordenarlas por similitud semántica. Que compare los dos ordenamientos. Donde no coinciden está la parte interesante, y los casos de negación (“el tratamiento ayudó” contra “el tratamiento no ayudó”) suelen ser donde la máquina se ve peor.

La pregunta que debes hacer: “¿Cómo le explicarías a una computadora que ‘feliz’ y ‘contento’ significan lo mismo, si no puede entender las palabras?”

De palabra a vector: una demostración trabajada

Palabra o frasePosición simplificada en 3 dimensiones (vivo, tamaño, comestible)Vecino más cercano en este espacio de juguetePor qué
perro(0,9, 0,4, 0,0)gatoVivos, chicos a medianos, no comida
gato(0,9, 0,3, 0,0)perroMisma zona
elefante(0,9, 1,0, 0,0)caballoVivo y grande
pizza(0,0, 0,3, 1,0)panNo vivo y comestible
pan(0,0, 0,2, 1,0)pizzaMisma zona
auto(0,0, 0,7, 0,0)camiónNo vivo, grande, no comestible
autor(0,0, 0,0, 0,0)escritorComparte letras con “auto” y nada más

Un embedding real tiene entre 300 y más de 3.000 dimensiones en lugar de 3, y ninguna dimensión tiene una etiqueta legible como “comestible”. Esta tabla es una simplificación didáctica, no un vector real. El punto que sí muestra con precisión: “auto” y “autor” terminan lejos aunque comparten letras, y “pizza” y “pan” terminan juntos aunque no comparten ninguna.

Qué hacer en casa

Enseña la palabra “parecido”, no “igual”

Los embeddings encuentran lo parecido. Eso es distinto de encontrar lo correcto y distinto de encontrar la respuesta. Un niño que dice “la herramienta encontró algo parecido, déjame revisar si está bien” internalizó el modelo correcto de la máquina.

Prueba la trampa de la negación una vez

Que tu hijo le pregunte a una herramienta de estudio si una fuente apoya una afirmación, usando una fuente que la contradice explícitamente. Observa si la herramienta se da cuenta. A menudo recupera el pasaje relevante y maneja bien la negación, pero no siempre, y ver la falla una vez vuelve permanente la lección.

Señala el anclaje

Si la herramienta escolar de tu hijo hace cuestionarios con materiales de clase, dile que la herramienta busca en los documentos del maestro por significado, no por palabra clave. Eso cambia cómo formula preguntas: describir el concepto funciona mejor que adivinar la redacción exacta.

Nota la pregunta del sesgo temprano

“¿De dónde salieron estos números?” lleva directo a “salieron de contar cómo escribe la gente de verdad”, que lleva a por qué aparecen estereotipos en las respuestas. Es una puerta de entrada natural y sin sermón.

Lo que no debes hacer

No le digas a tu hijo que la computadora “entiende” las palabras. Tiene posiciones y calcula distancias. Si eso constituye entendimiento es una pregunta filosófica genuinamente abierta, y la respuesta honesta (“se comporta como si lo hiciera, usando geometría”) es más interesante que cualquiera de los extremos. Nuestra guía sobre cómo funciona ChatGPT está un nivel arriba de esto, y qué es la visión por computadora muestra la misma idea aplicada a imágenes.

Qué observar en los próximos 3 meses

  • Semana 4: tu hijo puede decir que las palabras se vuelven listas de números y que más cerca significa más parecido en significado.
  • Señales de alerta en el mes 2: cree que la IA busca palabras clave. O trata “la herramienta encontró este pasaje” como “la herramienta demostró este punto”.
  • Autoevaluación del mes 3: pídele que prediga cuál de tres formulaciones va a recuperar la sección correcta de un documento. Si razona sobre significado y no sobre coincidencia de palabras, lo entendió.

Preguntas frecuentes

¿Qué es exactamente un embedding?

Una lista de números de largo fijo que representa una palabra, una oración o un documento, ubicada en un espacio donde los vectores cercanos significan contenido parecido. Los tamaños típicos van de unos cientos a unos miles de números, y los números individuales no tienen significado legible para una persona.

¿De verdad funciona “rey menos hombre más mujer igual reina”?

Funciona lo bastante bien para ser una demostración famosa, publicada por Mikolov, Chen, Corrado y Dean en 2013, y no es un truco de salón: las relaciones genuinamente se codifican como direcciones consistentes. No funciona en toda analogía, sobre todo en las irregulares, y los embeddings contextuales modernos se comportan algo distinto de los vectores originales de palabra suelta.

¿En qué se diferencia de una búsqueda por palabra clave?

La búsqueda por palabra clave compara caracteres. La búsqueda por embeddings compara significado, así que puede encontrar “cómputo de medidas de superficie” cuando el estudiante escribió “cómo calculo el área”. La contrapartida es que también puede recuperar algo del tema pero no realmente relevante.

¿Los embeddings tienen sesgo?

Sí, porque se aprenden de texto humano y codifican las asociaciones estadísticas que hay en él, incluidas las estereotipadas. No es un error de la matemática; refleja los datos. Vale saberlo antes de que tu hijo tome un pasaje recuperado como dato neutral.

¿Por qué la herramienta de estudio de mi hijo a veces saca la sección equivocada?

Normalmente por una de tres razones: la fuente se cortó mal, así que un vector representa media idea; la pregunta se formuló de una manera que cae cerca de otro tema; o el pasaje recuperado sí es del tema pero dice lo contrario de lo que se necesita. La negación es un punto débil documentado.


Sobre el autor

Ricky Flores es el fundador de HiWave Makers e ingeniero eléctrico con más de 15 años de experiencia desarrollando tecnología de consumo en Apple, Samsung y Texas Instruments. Escribe sobre cómo los niños aprenden a construir, pensar y crear en un mundo saturado de tecnología. Lee más en hiwavemakers.com.


Fuentes

  1. Mikolov, T., Chen, K., Corrado, G., y Dean, J. (2013). “Efficient Estimation of Word Representations in Vector Space.” arXiv:1301.3781. https://arxiv.org/abs/1301.3781
  2. Google Workspace Updates. (2026, 4 de agosto). “Gemini in Google Classroom is expanding to users of all ages.” https://workspaceupdates.googleblog.com/2026/08/gemini-in-google-classroom-is-expanding-to-users-of-all-ages-with-contextualized-Gemini-starter-prompts-for-students.html
  3. Lewis, P., Perez, E., Piktus, A., et al. (2020). “Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks.” NeurIPS 2020. https://arxiv.org/abs/2005.11401
  4. Vaswani, A., Shazeer, N., Parmar, N., et al. (2017). “Attention Is All You Need.” NeurIPS 2017. https://arxiv.org/abs/1706.03762
  5. Google. (2026, agosto). “Google AI updates, August 2026.” The Keyword. https://blog.google/innovation-and-ai/technology/google-ai-updates-august-2026/
  6. OCDE. (2026, 8 de septiembre). “PISA 2025: Students’ reading and mathematics performance declined sharply across the OECD.” https://www.oecd.org/en/about/news/press-releases/2026/09/pisa-2025-students-reading-and-mathematics-performance-declined-sharply-across-the-oecd.html
  7. Pulzo. (2026, septiembre). “Inteligencia artificial en la educación: estudiantes en Colombia lideran uso de IA, según la OCDE.” https://www.pulzo.com/tecnologia/inteligencia-artificial-en-la-educacion-estudiantes-en-colombia-lideran-uso-de-ia-segun-la-ocde-PP5296043A
Ricky Flores
Escrito por Ricky Flores

Fundador de HiWave Makers e ingeniero eléctrico con más de 15 años trabajando en proyectos con Apple, Samsung, Texas Instruments y otras empresas Fortune 500. Escribe sobre cómo los niños aprenden a construir, pensar y crear en un mundo impulsado por la tecnología.