Test del módulo · Semana 9

Test: Fiabilidad y operaciones — Well-Architected, alta disponibilidad, DR, SRE y observabilidad

Preguntas al estilo del examen. Contesta, pulsa «Comprobar» y lee siempre la explicación, también cuando aciertes: ahí está lo que de verdad se aprende.

21 preguntasComprobadas: 0/21

1. Una aplicación web recibe el tráfico por un balanceador de carga (SLA 99,99 %), lo sirve un MIG regional (SLA 99,99 %) y cada petición consulta una instancia de Cloud SQL Enterprise con alta disponibilidad (SLA 99,95 %). Todas las capas son necesarias para atender una petición. ¿Cuál es aproximadamente la disponibilidad máxima que puedes comprometer basándote en los SLA de Google?

2. Una empresa migra su base de datos PostgreSQL de pedidos a Cloud SQL. El requisito es que la base de datos siga disponible si cae una zona completa, con conmutación automática y sin pérdida de datos confirmados, y con el menor cambio posible en la aplicación. ¿Qué configuras?

3. Una aplicación interna de informes corre en dos VMs de Compute Engine. El negocio acepta hasta 24 horas de caída y perder los datos de un día si se pierde la región, y pide el menor coste posible. ¿Qué estrategia de recuperación ante desastres recomiendas?

4. Una tienda online tiene su frontend en un MIG y su base de datos en Cloud SQL, ambos en europe-southwest1. Tras un análisis de impacto, el negocio fija un RTO de 30 minutos y un RPO de pocos minutos ante la pérdida de la región, con un presupuesto moderado. ¿Qué diseño se ajusta mejor?

5. Un servicio financiero global registra transacciones que no pueden perderse aunque caiga una región entera, y debe seguir aceptando escrituras de forma automática. Necesita SQL y consistencia fuerte. ¿Qué base de datos eliges?

6. Tras un ataque de ransomware en otra empresa del grupo, el CISO exige que las copias de las VMs y de las bases de datos Cloud SQL no se puedan borrar ni modificar durante 90 días, ni siquiera por un administrador del proyecto con permisos de propietario, y quiere gestionarlas de forma centralizada. ¿Qué propones?

7. El servicio de pagos tiene un SLO de disponibilidad del 99,9 % en una ventana de 28 días. A mitad de periodo el equipo ya ha consumido el 100 % del presupuesto de errores, y producto quiere lanzar esta semana una nueva funcionalidad. Según las prácticas de SRE, ¿qué debería ocurrir?

8. Vas a definir el SLI de disponibilidad de una API pública servida por un balanceador de carga de aplicaciones externo delante de GKE. ¿Qué SLI refleja mejor la experiencia del usuario?

9. El equipo de guardia recibe decenas de alertas al día por umbrales de CPU y de errores por minuto, la mayoría sin impacto real, y ha empezado a ignorarlas. El servicio ya tiene un SLO definido en Cloud Monitoring. ¿Qué estrategia de alertado recomiendas?

10. EHR Healthcare debe conservar los registros de auditoría de todos sus proyectos durante 7 años por requisitos normativos, al menor coste posible y sin que puedan borrarse antes de tiempo. Rara vez se consultan. ¿Qué diseño propones?

11. El equipo de seguridad usa un SIEM de terceros que ingiere eventos desde una cola de mensajes. Quiere recibir en tiempo casi real los logs de auditoría de todos los proyectos de la organización, incluidos los que se creen en el futuro. ¿Qué configuras?

12. Una aplicación de microservicios en GKE tiene picos de latencia en el checkout. Cada petición atraviesa cinco servicios y nadie sabe en cuál se pierde el tiempo. ¿Qué herramienta de Google Cloud Observability usas primero?

13. Un servicio en Java en Compute Engine consume el doble de CPU desde el último despliegue, lo que ha disparado el coste del MIG. Las pruebas funcionales pasan y no hay errores. Quieres saber qué partes del código consumen la CPU en producción con una sobrecarga mínima. ¿Qué usas?

14. Una empresa tiene doce clústeres de GKE en tres regiones, cada uno con su propio servidor Prometheus y dashboards en Grafana. Operar Prometheus (almacenamiento, alta disponibilidad, retención) consume mucho tiempo y quieren consultas globales sin reescribir dashboards ni alertas PromQL. ¿Qué recomiendas?

15. Una aplicación de terceros en Cloud Run escribe en sus logs la línea «Payment gateway timeout» cada vez que falla la pasarela de pagos. No puedes modificar su código. Quieres una gráfica y una alerta cuando esos fallos superen 20 por minuto. ¿Qué haces?

16. Una cadena de retail prepara su campaña de Black Friday, con un pico de tráfico diez veces superior al habitual. Quiere que Google revise la arquitectura con antelación, ayude a preparar pruebas de carga y tenga un soporte reforzado durante el evento, y exige una primera respuesta de 15 minutos a incidencias críticas. ¿Qué opción cumple?

17. Una empresa ha contratado a una consultora para realizar pruebas de penetración sobre su aplicación web en Compute Engine y GKE. El responsable de seguridad pregunta qué tienen que hacer respecto a Google. ¿Qué respondes?

18. El equipo quiere empezar con ingeniería del caos para validar que su aplicación, desplegada en un MIG regional y Cloud SQL con HA, tolera la pérdida de una zona. ¿Qué dos prácticas son correctas? (Elige dos)

19. Diez minutos después de desplegar una nueva revisión de un servicio en Cloud Run, la tasa de errores sube del 0,1 % al 15 %. El equipo empieza a revisar el código para encontrar el fallo. Como arquitecto, ¿qué indicas?

20. Cymbal Retail va a realizar pruebas de carga antes de un gran lanzamiento sobre su frontend en un MIG regional con autoescalado. ¿Qué dos acciones son imprescindibles para que la prueba sea útil y no provoque problemas? (Elige dos)

21. Tras varios incidentes provocados por cambios manuales en producción, la dirección pide aplicar el pilar de operational excellence del Well-Architected Framework. ¿Qué medida encaja mejor con el principio «automate and manage change»?