2 min de lectura

Un error de mantenimiento de Microsoft corta la conectividad de Azure West US

Un error en el mantenimiento de Microsoft eliminó rutas de Azure en West US, interrumpiendo 27 servicios durante casi cinco horas el 23 de julio.

Imagen: The Register

Un error durante el mantenimiento de fibra de Microsoft cortó el acceso a los recursos de Azure en la región West US durante casi cinco horas el 23 de julio, interrumpiendo 27 servicios y dejando a los clientes imposibilitados de acceder a cargas de trabajo alojadas en las instalaciones en la nube de la compañía en California.

Microsoft inició lo que describió como “mantenimiento rutinario de dispositivos” a las 14:44 UTC (07:44, hora del Pacífico). El trabajo provocó de inmediato una degradación del servicio, lo que llevó a los equipos de redes, de servicios y de respuesta a incidentes a investigar anomalías en el tráfico, el comportamiento del enrutamiento, la pérdida de paquetes y cambios recientes en la configuración.

Cómo el mantenimiento causó la interrupción

El proceso de mantenimiento de Microsoft está diseñado para aislar rutas de red específicas, garantizando al mismo tiempo que al menos una de dos rutas redundantes permanezca operativa. La compañía también realiza comprobaciones de seguridad destinadas a confirmar que el trabajo no afectará a los clientes.

Ese proceso falló por un error en el sistema que convierte las solicitudes de mantenimiento en instrucciones para los dispositivos de red. El fallo incluyó incorrectamente dispositivos adicionales en el evento de mantenimiento, provocando que las rutas IP fueran eliminadas de más dispositivos de los previstos.

Recomendado

Los servidores Rubin de Nvidia recurren a la refrigeración por líquido caliente

«Las rutas fueron eliminadas entre nuestro centro de datos y la red de área extensa, afectando el tráfico que entra o sale de la región.»

Microsoft

Al principio, el incidente se presentó como una gran oscilación de rutas en la red de área extensa (WAN) de Microsoft. Una investigación más profunda mostró que la eliminación de rutas se originó en un centro de datos de West US.

Microsoft identificó una conexión con una actividad reciente de mantenimiento de fibra en algún momento entre las 16:00 UTC y las 17:45 UTC. A las 17:45 UTC, empezó a revertir los cambios. La WAN de la compañía había recuperado la normalidad a las 18:26 UTC, mientras que todos los servicios afectados quedaron totalmente restaurados a las 19:41 UTC.

La interrupción suma a Microsoft a una reciente serie de incidentes en la nube que han involucrado a AWS, Google y Azure, y pone de relieve cómo una operación de mantenimiento destinada a reducir riesgos puede, por sí misma, cortar la conectividad de toda una región.

Marcus Vance

Enterprise Editor

Marcus follows the money. He covers enterprise software, cloud architecture, and the tectonic shifts in Big Tech strategy. He translates dense earnings calls and complex M&A activity into actionable insights about where the industry is actually heading. If a tech giant makes a silent pivot, Marcus is usually the first to notice.

vía The Register

/ Sigue leyendo