• 4 min de lectura
La interrupción de Google Cloud expone riesgos ocultos por dependencia de un único centro
Una interrupción de 15 horas en Google Cloud afectó a tres servicios en europe-west4-a tras una falla de energía y de refrigeración, lo que plantea nuevas dudas sobre la resiliencia de los hiperescala

Imagen: The Register
Una interrupción de 15 horas en Google Cloud la semana pasada dejó fuera de servicio tres servicios en europe-west4-a mientras el resto de la zona y la región permanecieron en línea, lo que subraya lo difícil que puede ser para los clientes evaluar la verdadera resiliencia de la infraestructura de los hiperescalares.
Según el informe de incidentes de Google, Google Cloud VMware Engine (GCVE), NetApp Volumes y Bare Metal Solution (BMS) se vieron afectados por una falla de refrigeración. Google dijo: «El centro de datos que da servicio a europe-west4-a para GCVE, BMS y NetApp ha experimentado una falla de energía, que posteriormente provocó una falla en la refrigeración.»
Ese detalle importa porque muestra que esos tres servicios dependen de un centro de datos concreto. Google también dijo: «Se produjo una falla eléctrica en la red de suministro aguas arriba del centro de datos, lo que interrumpió el equipo de distribución eléctrica y los sistemas de refrigeración.» La compañía aún no ha explicado cómo el problema en la red aguas arriba causó esa interrupción, pero dijo que «redujo proactivamente las cargas de trabajo para proteger los datos de los clientes de cualquier riesgo derivado de operar la infraestructura a altas temperaturas.»

Recomendado
El auge de los centros de datos en el Reino Unido choca con la realidad del agua
The Register dijo que preguntó a Google si el sitio contaba con generadores u otras fuentes de energía de respaldo y, de ser así, por qué aun así hubo que apagar cargas de trabajo. Al momento de redactar este texto, Google no había respondido. La compañía dijo que su análisis del incidente está en curso y prometió una actualización.
Dependencias ocultas de un único centro de datos
La interrupción ha llamado la atención sobre una suposición habitual en la nube: que desplegar en varias zonas y regiones es suficiente para garantizar la resiliencia. Google, como otros hiperescalares, estructura su nube en regiones compuestas por varias zonas y suele aconsejar a los clientes distribuir las cargas de trabajo entre ellas. Pero este incidente sugiere que algunos servicios gestionados aún pueden estar vinculados a un único centro de datos dentro de una zona.
Biswajeet Mahapatra, analista principal de Forrester, dijo a The Register que la transparencia es el verdadero problema.
«El verdadero problema es la transparencia: por lo general se les dice a los clientes que usen múltiples zonas y regiones para la resiliencia, pero rara vez se les proporciona visibilidad sobre si un servicio gestionado concreto depende de un único centro de datos dentro de una zona.» «Como resultado, muchas organizaciones asumen que la abstracción de la nube proporciona más redundancia a nivel de instalaciones de la que puede existir realmente para servicios especializados.»
Mahapatra añadió que la arquitectura en sí misma no es inusual.
«La arquitectura subyacente no es necesariamente inusual. AWS, Azure y Google operan servicios que dependen de hardware dedicado, plataformas de almacenamiento o infraestructura estrechamente acoplada que puede no estar distribuida entre varias instalaciones de la misma manera que los servicios centrales de cómputo y almacenamiento.»
Lo que la interrupción revela sobre el diseño de las regiones
Adrian Wong, Director Analista de Gartner, señaló a The Register la interrupción de Google Cloud en 2023 en europe-west9-a, que Google atribuyó a una fuga de agua que «se originó en una parte de la instalación que no pertenece a Google». Google usa Spanner para replicar datos entre zonas, pero Wong observó que esa configuración no se mantuvo una vez que un edificio en la zona inundada quedó indisponible.
«Es muy difícil averiguar cómo está arquitectada una región individual.» «Nuestros clientes suelen sorprenderse por eso.»
El informe de incidentes de Google incluye una disculpa, diciendo: «Sabemos cuánto confían en Google Cloud y lamentamos el impacto en su productividad», y promete un informe final con «acciones preventivas». Para los clientes, sin embargo, la pregunta más difícil puede ser si esas acciones también abordan las elecciones de diseño ocultas que pueden limitar silenciosamente la resiliencia.
Enterprise Editor
Marcus follows the money. He covers enterprise software, cloud architecture, and the tectonic shifts in Big Tech strategy. He translates dense earnings calls and complex M&A activity into actionable insights about where the industry is actually heading. If a tech giant makes a silent pivot, Marcus is usually the first to notice.
vía The Register


