Ciencia de datos
Embeddings vectoriales: qué miden realmente y cuándo fallan
Un análisis de la geometría interna de los embeddings, sus sesgos estructurales y tres escenarios de fallo predecible.
Más allá de la similitud coseno
Lo que los embeddings capturan y lo que sistemáticamente ignoran.
Un embedding vectorial es una representación numérica de un objeto lingüístico (una palabra, una oración, un documento) en un espacio de alta dimensión. La hipótesis de trabajo es que objetos semánticamente similares quedarán próximos en ese espacio según alguna métrica, habitualmente la similitud coseno. Lo que esta definición operativa oculta es igualmente importante: los embeddings no miden significado en sentido filosófico, sino correlaciones estadísticas dentro del corpus de entrenamiento. Si ese corpus sobrerepresenta ciertos registros lingüísticos, geografías o periodos temporales, el espacio vectorial resultante reflejará esos sesgos de forma estructural, no accidental. Un modelo entrenado principalmente sobre texto periodístico en inglés americano producirá embeddings cuya geometría está implícitamente calibrada para ese contexto. Cuando ese modelo se aplica a textos técnicos en español, a documentos legales o a lenguaje coloquial de redes sociales, la similitud coseno puede seguir produciendo resultados numericamente plausibles, pero la interpretación semántica de esos resultados es mucho más débil de lo que los benchmarks estándar sugieren. Este artículo examina tres mecanismos concretos por los que los embeddings fallan de forma predecible: colapso de sinónimos técnicos en contextos especializados, anisotropía del espacio vectorial y degradación del rendimiento en dominios con vocabulario de baja frecuencia.
Cuándo no debe confiar en su embedding model
Tres condiciones que garantizan resultados degradados, con independencia del modelo utilizado.
El primer escenario de fallo es el dominio especializado con terminología de baja frecuencia. En oncología molecular, derecho tributario o ingeniería de semiconductores, los términos clave aparecen con muy baja frecuencia en los corpus generalistas sobre los que se entrenan la mayoría de los modelos públicos. El espacio vectorial alrededor de estos términos está mal calibrado: los vecinos más próximos según similitud coseno no son los conceptos semánticamente relacionados, sino términos superficialmente similares a nivel de subword. El segundo escenario es la anisotropía severa: en muchos modelos populares, los vectores se distribuyen de forma no uniforme en el espacio, ocupando un cono estrecho en lugar de la esfera completa. Esto hace que la similitud coseno entre cualquier par de vectores sea artificialmente alta, lo que dificulta distinguir pares genuinamente similares de pares no relacionados. El tercer escenario es la aplicación cross-lingual sin alineación explícita: asumir que dos modelos monolingües producen espacios vectoriales comparables sin un paso de alineación es un error que aparece con frecuencia en proyectos de recuperación de información multilingüe. Antes de desplegar un embedding model en producción en cualquiera de estos contextos, el equipo técnico debe realizar evaluaciones específicas de dominio, no solo benchmarks genéricos como MTEB.
