Arquitectura de Almacenamiento de Datos, Canalizaciones de Ingesta y Almacenes Analíticos
Volver a Learn
DP-900Capítulo 7

Preparación para la Certificación Microsoft DP-900

Arquitectura de Almacenamiento de Datos, Canalizaciones de Ingesta y Almacenes Analíticos

Microsoft Fabric, Azure Databricks, ETL y ELT, modelos semánticos, canalizaciones, almacenes de datos, lagos de datos y almacenes de lago

Tiempo de estudio sugerido: 95 minutos • Nivel principiante • Alineado con la guía DP-900 y la documentación oficial de Microsoft Learn

Arquitectura analítica moderna desde orígenes y canalizaciones hasta un almacén de lago e informes

1. Dos plataformas para análisis a gran escala

El análisis a gran escala une el almacenamiento de datos tradicional de inteligencia empresarial con técnicas para grandes volúmenes, formatos variados y datos continuos. Los registros transaccionales suelen copiarse a un esquema analítico; los archivos y flujos pueden llegar a un y procesarse en paralelo con motores como Apache Spark. Combinar la flexibilidad del lago con el comportamiento SQL del almacén crea una arquitectura de almacén de lago.

es una plataforma unificada de análisis. Ingeniería de datos, almacenamiento de datos, Inteligencia en tiempo real, ciencia de datos y comparten áreas de trabajo web y OneLake para todo el inquilino; Microsoft opera la infraestructura. es una plataforma administrada en basada en Apache Spark. Sus cuadernos y cargas SQL usan Delta Lake, que agrega transacciones, aplicación de esquemas e historial de versiones a Parquet.

Dos plataformas para análisis a gran escala
Figura 1 — Dos plataformas para análisis a gran escala

Resumen del tema

Fabric integra análisis sobre OneLake; centra ingeniería y análisis Spark en formatos abiertos de almacén de lago.

2. La arquitectura analítica de extremo a extremo

Una solución moderna parte de bases transaccionales, archivos, aplicaciones, dispositivos y flujos de eventos. La ingesta mueve los datos y el procesamiento limpia, filtra, combina o reestructura. ETL transforma antes de cargar; ELT carga primero y transforma con el cómputo de destino. Pueden coexistir rutas por lotes y en tiempo real con clústeres distribuidos.

Los datos procesados permanecen en un almacén relacional, un lago basado en archivos o un almacén de lago que combina ambos enfoques. Analistas y científicos pueden consultar directamente, pero un modelo preparado simplifica los informes. Informes, paneles, exploración interactiva e interfaces con IA forman la capa de consumo.

ETL y ELT
PatrónOrdenIdea habitual
ETLExtraer → Transformar → CargarPreparar antes del almacén analítico
ELTExtraer → Cargar → TransformarUsar el cómputo de destino después de cargar
La arquitectura analítica de extremo a extremo
Figura 2 — La arquitectura analítica de extremo a extremo

Resumen del tema

Piense en una cadena: orígenes, ingesta y procesamiento, almacén analítico, modelo analítico y consumo empresarial.

3. Modelos semánticos y consumo visual

Los sistemas de BI anteriores usaban cubos multidimensionales con valores preagregados por dimensiones. El enfoque preferido en y es el modelo semántico tabular: define tablas, relaciones, jerarquías y medidas DAX y calcula agregaciones al ejecutar la consulta.

Direct Lake permite leer tablas Delta de OneLake sin importar ni preagregar. Los analistas publican tendencias, comparaciones e indicadores en informes, gráficos de documentos o presentaciones, paneles web y experiencias interactivas de autoservicio.

Resumen del tema

Los modelos semánticos convierten los datos en conceptos y medidas empresariales gobernados para informes y autoservicio.

4. Análisis asistido por IA

Las funciones de lenguaje natural amplían el análisis a personas que no escriben consultas. Preguntas y respuestas de puede convertir una pregunta común en una respuesta visual. Copilot en ayuda a generar medidas DAX y SQL, resumir informes y explicar tendencias.

ofrece Genie para preguntas conversacionales sobre datos Delta Lake gobernados. Interpreta, genera y ejecuta SQL y devuelve resultados. Estos asistentes aceleran la exploración, pero la calidad, los permisos, las definiciones semánticas y la validación humana siguen siendo esenciales.

Resumen del tema

Los asistentes reducen la barrera de consulta, pero no sustituyen la gobernanza, los modelos fiables ni la revisión.

5. Cómo representa la arquitectura

OneLake es la base de almacenamiento compartida por todo el inquilino para las cargas de Fabric. Delta Lake es el formato abierto estándar de las tablas, por lo que las experiencias trabajan sobre datos comunes en lugar de silos separados.

guarda datos mixtos en Delta Lake y expone un punto de conexión de análisis SQL. ofrece una experiencia relacional administrada compatible con SQL Server y con mayor control de esquema. Fabric Data Factory crea y programa movimiento y transformación de código bajo. proporciona modelos, informes, paneles y Direct Lake.

Cómo Microsoft Fabric representa la arquitectura
Figura 3 — Cómo representa la arquitectura

Resumen del tema

Fabric reúne almacenamiento, ingeniería, almacén, orquestación, tiempo real y BI en un área de trabajo .

6. Cómo representa la arquitectura

usa Delta Lake como formato abierto nativo para SQL, ingeniería y aprendizaje automático. ofrece cómputo de almacén SQL , historial de consultas, paneles y alertas sobre tablas Delta.

Databricks Notebooks colaborativos admiten Python, SQL, Scala y R. Unity Catalog proporciona descubrimiento, y gobernanza detallada de activos de datos e IA. Genie agrega una interfaz conversacional que convierte preguntas en SQL ejecutado.

Resumen del tema

Databricks organiza la arquitectura alrededor de Spark, Delta Lake, cuadernos, cómputo SQL y gobernanza unificada.

7. Ingesta por canalización con Fabric Data Factory

Fabric Data Factory es el punto inicial habitual para ingesta mediante canalizaciones en OneLake. Las canalizaciones orquestan flujos de varias etapas y ejecutan actividades en serie o en paralelo. Dataflows Gen2 ofrece transformaciones visuales reutilizables con Power Query para creación de código bajo.

Una canalización conecta entradas y salidas mediante servicios vinculados y puede copiar datos, invocar procedimientos almacenados, ejecutar cuadernos o aplicar lógica personalizada. La salida puede ir a , u otro destino. Algunas actividades integradas no requieren servicio vinculado.

Ingesta por canalización con Fabric Data Factory
Figura 4 — Ingesta por canalización con Fabric Data Factory

Resumen del tema

Las canalizaciones coordinan movimiento y ejecución; Dataflows Gen2 expresa transformaciones reutilizables de código bajo.

8. Accesos directos, reflejo y eventos en tiempo real

Un acceso directo de OneLake es una referencia activa a Gen2, Amazon S3, Google Cloud u otra ubicación de OneLake. Los archivos externos aparecen en sin duplicarse, útil por residencia, cumplimiento o coste.

La creación de reflejo replica continuamente bases compatibles como , Snowflake y en OneLake casi en tiempo real. Fabric controla cambios y escribe tablas Delta sin una canalización personalizada.

Fabric Eventstream recibe eventos de , Apache Kafka, y puntos personalizados. Puede enrutar, filtrar y transformar antes de enviar a , una base KQL para series temporales u otro destino de Inteligencia en tiempo real.

Accesos directos, reflejo y eventos en tiempo real
Figura 5 — Accesos directos, reflejo y eventos en tiempo real

Resumen del tema

Los accesos directos federan sin copiar, el reflejo replica cambios y Eventstream trata eventos continuos.

9. Ingesta con código y independiente

Fabric Notebooks basado en Apache Spark sirve cuando falta un conector o se necesita lógica personalizada. PySpark, Python, Scala, R o SQL puede leer , bases, archivos y puntos accesibles, y escribir tablas Delta o Warehouse. Un cuaderno puede ser interactivo o una actividad programada.

es el servicio independiente de para integración fuera de Fabric. Atiende destinos como , plataformas externas y orígenes locales híbridos. Su modelo de canalizaciones y servicios vinculados es parecido al de Fabric Data Factory.

Resumen del tema

Use Fabric Notebooks para código Spark personalizado y para integración amplia o híbrida fuera de Fabric.

10. Opciones de ingesta en

Lakeflow Spark Declarative permite describir las tablas de salida mientras el servicio administra dependencias, orden e incrementos. Está pensado para canalizaciones fiables de producción, continuas o incrementales.

Databricks Notebooks admite ingesta exploratoria desde , JDBC, almacenamiento de objetos y flujos. Puede escribir tablas Delta, ejecutarse como trabajos programados o integrarse como transformación de Lakeflow. Existen mecanismos especializados adicionales fuera de este alcance.

Opciones de ingesta en Azure Databricks
Figura 6 — Opciones de ingesta en

Resumen del tema

Lakeflow administra flujos incrementales fiables; los cuadernos ofrecen ingesta y transformación flexible mediante código.

11. Almacenes de datos, hechos y dimensiones

Un almacén de datos es relacional y está diseñado para consultas analíticas, no transaccionales. Las medidas numéricas ocupan tablas de hechos centrales relacionadas con dimensiones de cliente, producto, tienda y tiempo. Así resultan sencillas agregaciones como ingresos mensuales por producto y tienda.

El esquema de estrella conecta dimensiones directamente con los hechos. El esquema de copo de nieve normaliza partes de una dimensión en tablas adicionales, como una jerarquía de categorías. Los almacenes encajan con datos estructurados, esquema estricto, equipos SQL y consultas BI concurrentes.

Esquemas de estrella y copo de nieve
DiseñoEstructura de dimensionesConsecuencia
EstrellaDimensiones conectadas a los hechosConsultas sencillas y menos combinaciones
Copo de nieveDimensiones extendidas en tablas jerárquicasMás normalización y más combinaciones
Almacenes de datos, hechos y dimensiones
Figura 7 — Almacenes de datos, hechos y dimensiones

Resumen del tema

Los hechos guardan eventos medibles, las dimensiones aportan contexto y estrella o copo de nieve optimizan SQL analítico.

12. Lagos de datos y esquema en lectura

Un guarda archivos en un sistema distribuido y admite contenido estructurado, semiestructurado y no estructurado. Motores como Apache Spark procesan archivos en paralelo para análisis e informes.

Muchos lagos aplican esquema en lectura: los archivos llegan sin restricciones relacionales y adquieren forma tabular al consultarse. La flexibilidad acelera recopilación y experimentación, pero siguen siendo necesarios catálogo, acceso, calidad y organización.

Resumen del tema

El lago prioriza archivos flexibles y procesamiento distribuido; el esquema puede aplicarse al leer, no al escribir.

13. El almacén de lago y Delta Lake

El almacén de lago conserva datos sin procesar y preparados como archivos, pero expone tablas fiables y SQL. Delta Lake agrega registro de transacciones, aplicación de esquemas, coherencia, versiones y actualizaciones por lotes y sobre Parquet.

y usan Delta Lake. En Fabric, las tablas viven en OneLake y reciben automáticamente un punto de conexión de análisis SQL. también se almacena en OneLake y comparte la base.

El almacén de lago y Delta Lake
Figura 8 — El almacén de lago y Delta Lake

Resumen del tema

Delta Lake combina archivos abiertos con tablas fiables, coherencia transaccional y análisis SQL.

14. Elección del almacén y combinación de servicios

sirve para datos mixtos, cuadernos, Spark y aprendizaje automático. sirve para datos relacionales estructurados, SQL, esquema estricto y BI concurrente. Fabric agrega Data Factory, Inteligencia en tiempo real y reflejo.

encaja con ingeniería Spark mediante código, ciencia de datos, SQL sobre Delta Lake, portabilidad multinube o experiencia previa. Su SQL Warehouse optimiza la concurrencia BI. Una solución puede cargar archivos, procesarlos con Databricks y cargar resultados en .

Un servicio puede exponer esquema y consulta aunque los bytes sigan en un lago. La decisión considera aptitudes, formatos, gobernanza, latencia, concurrencia, transformación y ecosistema.

Adecuación del almacén analítico
ExperienciaAdecuación principal
Datos mixtos, Spark, cuadernos y ML
Datos relacionales estructurados y BI SQL concurrente
Spark mediante código, Delta Lake, ciencia de datos y portabilidad
Elección del almacén y combinación de servicios
Figura 9 — Elección del almacén y combinación de servicios

Resumen del tema

Elija según datos, carga, aptitudes y gobernanza; Fabric y Databricks también pueden colaborar.

15. Ejercicio práctico y razonamiento de evaluación

El ejercicio guiado aprovisiona , crea un , ingiere datos de ejemplo y los analiza. Es una orientación, no un tutorial avanzado. Reserve unos 30 minutos, use una cuenta o prueba de Fabric y elimine elementos o capacidad innecesarios después.

En la revisión: la solución que combina y almacén relacional es un almacén de lago; es la plataforma que crea canalizaciones; Apache Spark es el motor distribuido de código abierto incluido para procesamiento a gran escala.

Resumen del tema

Para DP-900, relacione cada escenario con el término arquitectónico, mecanismo de ingesta, tipo de almacén y capacidad distintiva.