Test del módulo · Semana 6
Test: Procesamiento de datos y analítica
Preguntas al estilo del examen. Contesta, pulsa «Comprobar» y lee siempre la explicación, también cuando aciertes: ahí está lo que de verdad se aprende.
1. Un e-commerce publica un evento por cada pedido. Tres sistemas deben procesar todos los pedidos de forma independiente: facturación, logística y un sistema de recomendaciones. Si logística se cae durante horas, no debe perder pedidos ni afectar a los otros dos. ¿Cómo lo diseñas con Pub/Sub?
2. Un banco publica en Pub/Sub los movimientos de las cuentas de sus clientes. El servicio que calcula el saldo debe procesar los movimientos de cada cuenta en el mismo orden en que se publicaron; el orden entre cuentas distintas no importa. ¿Qué configuras?
3. Un servicio en Cloud Run recibe mensajes de una suscripción push. Algunos mensajes tienen un formato corrupto y el servicio siempre devuelve error con ellos, por lo que Pub/Sub los reintenta sin fin y generan ruido y coste. Quieres apartarlos para analizarlos sin perderlos. ¿Qué haces?
4. Una aplicación de juegos genera eventos JSON ya limpios y con un esquema estable. El equipo de analítica quiere tenerlos en una tabla de BigQuery en segundos, con la menor operativa y el menor coste posibles; las transformaciones las harán después con SQL. ¿Qué arquitectura recomiendas?
5. Una plataforma de vídeo quiere medir la duración de las sesiones de visualización de cada usuario a partir de un flujo de eventos de reproducción. Una sesión termina cuando el usuario pasa 30 minutos sin generar eventos, y los eventos pueden llegar con varios minutos de retraso. ¿Qué configuras en la canalización de Dataflow?
6. Hay que desplegar una nueva versión incompatible de una canalización de Dataflow en streaming que lee de Pub/Sub y escribe en BigQuery. El equipo quiere detener el job actual sin perder los datos que ya ha leído y está procesando. ¿Qué acción usas para detenerlo?
7. Una aseguradora tiene 300 jobs de Spark y Hive en un clúster Hadoop on-premises que funciona 24 horas aunque los jobs solo corren de noche. Quiere migrar a Google Cloud con los mínimos cambios de código y reducir costes. ¿Qué dos medidas recomiendas? (Elige dos)
8. Una cadena de supermercados quiere analizar en BigQuery, con unos minutos de retraso como máximo, las ventas registradas en su base de datos Oracle on-premises. El DBA no permite consultas pesadas contra producción ni cambios en la aplicación. ¿Qué servicio usas para mover los datos?
9. El equipo de datos tiene una canalización diaria con 40 pasos: esperar ficheros de proveedores, lanzar jobs de Spark, cargar en BigQuery, ejecutar comprobaciones de calidad y reprocesar días anteriores cuando falla un proveedor. Ya conocen Apache Airflow y quieren un servicio gestionado. ¿Qué eliges para orquestarla?
10. Una tabla de BigQuery de 80 TB guarda eventos de navegación de 5 años. Casi todas las consultas filtran por la fecha del evento (últimos 7 o 30 días) y por el identificador de cliente. La factura de consultas bajo demanda es muy alta. ¿Qué cambio de diseño reduce más el coste sin cambiar las consultas de los analistas?
11. Una empresa gasta de forma constante unos 60.000 USD al mes en consultas bajo demanda de BigQuery y el director financiero pide un coste predecible y más bajo. Además, las cargas nocturnas de ETL no deben quitar capacidad a los paneles que usa la dirección por la mañana. ¿Qué recomiendas?
12. Un analista nuevo lanzó por error varias consultas SELECT * sobre una tabla de 200 TB y generó un cargo elevado. Quieres evitar que vuelva a ocurrir y que los analistas sepan cuánto costará una consulta antes de ejecutarla. ¿Qué dos medidas aplicas? (Elige dos)
13. Un grupo hospitalario guarda en BigQuery una tabla de episodios clínicos. Los analistas de cada hospital solo deben ver las filas de su hospital, y ninguno de ellos debe ver la columna con el número de historia clínica, que solo puede consultar el equipo de calidad. ¿Qué combinación aplicas?
14. Una empresa tiene un data lake con ficheros Parquet en Cloud Storage que consultan con Spark. Quiere que los analistas los consulten también desde BigQuery sin copiarlos, aplicando seguridad a nivel de fila y columna, y sin dar a los analistas permisos sobre el bucket. ¿Qué usas?
15. Un operador logístico quiere ofrecer a 50 empresas clientes un conjunto de datos de tiempos de entrega que se actualiza a diario en BigQuery. Cada cliente debe consultarlo desde su propio proyecto de Google Cloud, siempre con los datos actualizados y sin que el operador tenga que copiar los datos ni pagar el almacenamiento de 50 copias. ¿Qué usas?
16. El equipo de marketing, formado por analistas que dominan SQL pero no Python, quiere predecir la probabilidad de baja de cada cliente a partir de datos que ya están en BigQuery. Quieren un primer modelo en días, sin mover los datos ni gestionar infraestructura de ML. ¿Qué recomiendas?
17. Tras varias adquisiciones, una empresa tiene cientos de datasets de BigQuery y buckets de Cloud Storage en decenas de proyectos. Nadie sabe qué datos existen, de dónde vienen ni si son fiables. Quieren un servicio gestionado para descubrir y catalogar los datos, ver su linaje y ejecutar comprobaciones de calidad. ¿Qué eliges?
18. Un fabricante de vehículos recibe telemetría de 1 millón de coches. Necesita detectar en segundos anomalías agregadas por ventanas de 1 minuto, servir a la app del conductor el último estado de su coche con latencia de milisegundos y guardar el histórico para analítica con SQL. ¿Qué arquitectura es la más adecuada?