El rendimiento de los modelos Mixture-of-Experts (MoE) a menudo se atribuye al número de expertos, pero un factor más crítico es la estabilidad del mecanismo de enrutamiento. Este análisis explora cómo el escalado de MoE implica un delicado equilibrio entre capacidad, cómputo, memoria y comunicación. Si bien aumentar el tamaño de FFN en transformadores densos es sencillo, impone una restricción dura: cada token debe pasar por los mismos parámetros. MoE ofrece un camino para romper esta restricción, pero solo si el enrutador puede dirigir los tokens a los expertos correctos de manera consistente. El enrutamiento inestable puede provocar desequilibrio de carga, cómputo desperdiciado y degradación del rendimiento. Para los equipos de ingeniería, esto significa centrarse en el diseño del enrutador y la estabilidad del entrenamiento tanto como en el número de expertos. Estos conocimientos son particularmente relevantes para quienes construyen o ajustan modelos a gran escala donde la eficiencia y la escalabilidad son primordiales. Comprender estas compensaciones puede guiar mejores decisiones arquitectónicas y asignación de recursos.
Un análisis profundo de la arquitectura Mixture-of-Experts, argumentando que la estabilidad del enrutamiento es la clave para la eficiencia de escalado, no solo agregar más expertos.