Este artículo presenta un marco diseñado para probar si las salidas de los modelos de IA se mantienen consistentes cuando se aplican diferentes técnicas de optimización, como cuantización, poda u optimizaciones del compilador. El marco genera casos de prueba, ejecuta inferencia bajo varias configuraciones y compara las salidas para detectar comportamientos no deterministas. Esto es crucial para sistemas de producción donde se requiere reproducibilidad para depuración, auditoría o cumplimiento normativo. El enfoque es sistemático e incluye estrategias para manejar variaciones de punto flotante y diferencias de hardware. Llena un vacío notable en las prácticas actuales de despliegue de ML, donde el determinismo a menudo se asume pero rara vez se verifica.
Un marco novedoso para probar la consistencia de las salidas de modelos de IA a través de diferentes niveles de optimización, abordando un desafío crítico de confiabilidad en el despliegue de ML.