1/21
Flashcards basadas en el primer parcial de Ingeniería de Datos, cubriendo ciclos de vida de datos, arquitecturas (Data Lake, Data Warehouse, Kappa) y patrones de procesamiento.
Name | Mastery | Learn | Test | Matching | Spaced | Call with Kai | Chat |
|---|
No analytics yet
Send a link to your students to track their progress
¿En qué etapa del ciclo de vida de la ingeniería de datos se originan los datos a partir de sistemas fuente como aplicaciones, sensores, logs o APIs?
Generación.
¿Qué etapa del ciclo de vida implica la limpieza, integración, estandarización y aplicación de reglas de negocio?
Transformación.
¿Cómo se define la etapa donde los datos procesados se ponen a disposición de usuarios, analistas o sistemas de machine learning?
Serving.
¿Qué término describe el proceso mediante el cual los datos son trasladados desde los sistemas fuente hacia el ecosistema analítico?
Ingestión.
¿Qué es un Data Lake?
Es un repositorio que permite almacenar grandes volúmenes de datos en su formato original, sin imponer un esquema rígido al momento de su almacenamiento.
¿Qué es un Data Warehouse?
Un repositorio estructurado orientado al análisis de datos históricos, optimizado para consultas analíticas.
¿Cuál es la diferencia entre los patrones de procesamiento ELT y ETL?
En el ELT los datos se cargan en el sistema de almacenamiento y posteriormente se transforman; en el ETL tradicional, los datos se transforman antes de ser cargados en el sistema de destino.
¿En qué consiste el procesamiento Batch?
Tipo de procesamiento en el que los datos se manejan en bloques o lotes en intervalos de tiempo definidos.
¿Qué caracteriza al procesamiento en Streaming?
Los datos se procesan en tiempo real o casi en tiempo real conforme son generados.
¿Cuál es la función de la ingestión en el ciclo de vida de los datos?
Actúa como el puente entre los sistemas operacionales y los sistemas analíticos.
¿Qué aspectos atraviesan todas las etapas del ciclo de vida de la ingeniería de datos?
La seguridad y la gobernanza.
¿Verdadero o Falso: Un ingeniero de datos tiene control directo sobre los sistemas fuente donde se generan los datos?
Falso.
¿Qué permiten los sistemas distribuidos en una arquitectura de datos?
Permiten escalar el procesamiento y almacenamiento de datos.
¿Qué es FinOps?
Un enfoque que busca optimizar el uso y costo de los recursos en la nube.
En el diseño de un Data Warehouse para comercio electrónico, ¿qué elementos componen las dimensiones de análisis según el esquema estrella?
Productos (categoría), Tiempo (mes, año) y Usuarios (ciudad).
¿Qué tipo de datos almacena la capa 'raw' de un Data Lake?
Datos en su formato original, sin procesar, que esperan ser limpiados.
¿Cuál es el propósito de la capa 'curated' en un Data Lake?
Almacenar datos limpios y procesados listos para su análisis.
¿En qué capa del Data Lake se almacenarían los logs de navegación en formato JSON sin modificar?
Capa raw.
En una arquitectura Kappa, ¿qué es el log de eventos y qué almacena?
Es una secuencia de eventos que almacena el histórico de los datos.
¿Cómo se procesan los datos en la arquitectura Kappa?
Mediante streaming.
¿Cuál es una ventaja de la arquitectura Kappa respecto a la arquitectura Lambda?
Facilita más el análisis histórico.
En el procesamiento de eventos, ¿qué representan 'total_eventos' y 'total_valor' en una vista agregada?
total_eventos es el número total de eventos por usuario y total_valor es la suma acumulada del campo valor por usuario.