El código de salida 137 de un contenedor a menudo se diagnostica erróneamente como un problema de falta de memoria (OOM), lo que lleva a los equipos a ampliar recursos prematuramente. En este caso real de depuración, un contenedor de producción salía con el código 137, y la primera reacción fue asumir OOM. Sin embargo, un examen más detallado de la semántica del código de salida revela que 137 equivale a 128 más la señal 9 (SIGKILL), que puede ser provocada por diversas condiciones, incluidos los reinicios del host. El autor verificó sistemáticamente los registros del host y descubrió que el servidor subyacente se reiniciaba inesperadamente, matando todos los contenedores. Este caso subraya la importancia de comprender las convenciones de códigos de salida de Linux y verificar los eventos a nivel de host antes de sacar conclusiones precipitadas. Para los equipos de DevOps y SRE, es un recordatorio valioso de correlacionar los códigos de salida de los contenedores con los registros y métricas del sistema para evitar esfuerzos desperdiciados e infraestructura mal configurada.
Un contenedor de producción salía con el código 137, inicialmente atribuido a OOM. El autor desglosa la semántica del código de salida (128+9=SIGKILL) y descubre que el host se reiniciaba, no que el contenedor fuera eliminado por OOM.