Actualizar o cambiar modelos de embedding en un pipeline de generación aumentada por recuperación (RAG) es más que un simple cambio de configuración. Un informe de campo reciente destaca un problema común pero a menudo pasado por alto: la dimensión del vector de salida del nuevo modelo puede diferir de la del anterior, rompiendo la compatibilidad con los vectores ya almacenados en la base de datos. Incluso después de volver a analizar los documentos, el sistema puede seguir fallando porque los vectores históricos permanecen en el formato antiguo. Este desajuste puede causar errores silenciosos, calidad de recuperación degradada o fallos difíciles de rastrear. La lección para los equipos de ingeniería es clara: antes de cambiar de modelo, audite la dimensión de los datos vectoriales existentes y planifique una estrategia de migración o re-embedding. Esta es una preocupación operativa permanente para cualquiera que construya o mantenga sistemas RAG, especialmente a medida que el panorama de modelos evoluciona rápidamente.
Una advertencia práctica sobre los desajustes de dimensiones vectoriales al migrar modelos de embedding en sistemas RAG, y por qué importa la compatibilidad de los datos históricos.