Arquitetura de Data Warehouse, Pipelines de Ingestão e Armazenamentos Analíticos
Voltar para Learn
DP-900Capítulo 7

Estudo para a Certificação Microsoft DP-900

Arquitetura de Data Warehouse, Pipelines de Ingestão e Armazenamentos Analíticos

Microsoft Fabric, Azure Databricks, ETL e ELT, modelos semânticos, pipelines, warehouses, lakes e lakehouses

Tempo de estudo sugerido: 95 minutos • Nível iniciante • Alinhado ao plano de estudos DP-900 e à documentação oficial do Microsoft Learn

Arquitetura analítica moderna desde fontes e pipelines até armazenamento lakehouse e relatórios

1. Duas plataformas para análise em grande escala

A análise em grande escala une o data warehousing tradicional de business intelligence a técnicas voltadas a grandes volumes, formatos variados e dados que chegam continuamente. Registros transacionais costumam ser copiados para um esquema analítico; arquivos e fluxos podem chegar a um e ser processados em paralelo por mecanismos como o Apache Spark. A combinação da flexibilidade do lake com o comportamento SQL de warehouse forma a arquitetura chamada data .

O é uma plataforma unificada de análise. Engenharia de dados, data warehousing, Inteligência em Tempo Real, ciência de dados e compartilham workspaces no navegador e a camada OneLake para todo o locatário; a Microsoft opera a infraestrutura. O é uma plataforma gerenciada no , baseada no Apache Spark. Notebooks e cargas SQL usam Delta Lake, que acrescenta transações, imposição de esquema e histórico de versões a arquivos Parquet.

Duas plataformas para análise em grande escala
Figura 1 — Duas plataformas para análise em grande escala

Resumo do tópico

O Fabric integra análise como sobre o OneLake; o concentra engenharia e análise Spark em formatos abertos.

2. A arquitetura analítica ponta a ponta

Uma solução moderna começa com fontes como bancos transacionais, arquivos, aplicativos, dispositivos e fluxos de eventos. A movimenta os dados; o processamento limpa, filtra, combina ou reestrutura. ETL transforma antes de carregar o armazenamento analítico; ELT carrega primeiro e usa a computação do destino para transformar depois. Caminhos em lote e em tempo real podem coexistir, frequentemente com distribuídos trabalhando em paralelo.

Os dados processados ficam em um relacional, baseado em arquivos ou que combina os dois. Analistas e cientistas podem consultar o armazenamento diretamente, mas um modelo preparado facilita a criação de relatórios. Relatórios, , exploração interativa e interfaces assistidas por IA formam a camada de consumo.

ETL e ELT
PadrãoOrdemIdeia típica
ETLExtrair → Transformar → CarregarPreparar antes do armazenamento analítico
ELTExtrair → Carregar → TransformarUsar a computação do destino depois da carga
A arquitetura analítica ponta a ponta
Figura 2 — A arquitetura analítica ponta a ponta

Resumo do tópico

Pense na carga como uma cadeia: fontes, e processamento, armazenamento analítico, modelo analítico e consumo de negócio.

3. Modelos semânticos e consumo visual

Sistemas de BI anteriores usavam cubos multidimensionais com valores pré-agregados por dimensões, como vendas por produto e região. A abordagem preferida no e no é o modelo semântico tabular. Ele define tabelas, relacionamentos, hierarquias e medidas DAX, calculando agregações no momento da consulta.

O modo Direct Lake permite que o modelo semântico leia tabelas Delta no OneLake sem importar nem pré-agregar os dados. Analistas publicam tendências, comparações e KPIs em relatórios impressos, gráficos em documentos ou apresentações, web e experiências interativas de autoatendimento.

Resumo do tópico

Modelos semânticos convertem dados armazenados em conceitos e medidas de negócio governados para relatórios e autoatendimento.

4. Análise assistida por IA

Recursos de linguagem natural ampliam a análise para quem não escreve consultas. O Q&A do pode transformar uma pergunta em linguagem comum em uma resposta visual. O Copilot no auxilia na geração de medidas DAX e SQL, resume relatórios, explica tendências e apoia outras tarefas analíticas.

O oferece o Genie para perguntas conversacionais sobre dados Delta Lake governados. Ele interpreta a solicitação, gera e executa SQL e devolve o resultado. Esses assistentes aceleram a exploração, mas qualidade, permissões, definições semânticas e validação humana continuam indispensáveis.

Resumo do tópico

Assistentes de IA reduzem a barreira das consultas, mas não substituem governança, modelos confiáveis nem revisão do resultado.

5. Como o representa a arquitetura

O OneLake é a base de armazenamento compartilhada por todo o locatário para as cargas do Fabric. O Delta Lake é o formato aberto padrão para tabelas , permitindo que as experiências usem os mesmos dados em vez de manter silos separados.

O guarda dados variados em Delta Lake e expõe um ponto de extremidade de análise SQL. O fornece experiência relacional totalmente gerenciada e compatível com SQL Server, com imposição de esquema mais forte. O Fabric Data Factory cria e agenda movimentação e transformação low-code. O fornece modelos semânticos, relatórios, e Direct Lake.

Como o Microsoft Fabric representa a arquitetura
Figura 3 — Como o representa a arquitetura

Resumo do tópico

O Fabric reúne armazenamento, engenharia, warehouse, orquestração, tempo real e BI em um .

6. Como o representa a arquitetura

O usa Delta Lake como formato aberto nativo para análise SQL, engenharia de dados e machine learning. O oferece computação de SQL warehouse , histórico de consultas, e alertas sobre tabelas Delta.

Databricks Notebooks colaborativos aceitam Python, SQL, Scala e R. O Unity Catalog fornece descoberta, e governança granular de ativos de dados e IA. O Genie acrescenta uma interface conversacional que transforma perguntas em SQL executado.

Resumo do tópico

O Databricks organiza a arquitetura em torno de Spark, Delta Lake, notebooks, computação SQL e governança unificada.

7. por com o Fabric Data Factory

O Fabric Data Factory é o ponto inicial habitual para orientada por no OneLake. orquestram fluxos com várias etapas e executam atividades em sequência ou paralelo. Dataflows Gen2 oferecem transformações visuais reutilizáveis com Power Query para autoria low-code.

Um conecta entradas e saídas por serviços vinculados e pode copiar dados, invocar procedimentos armazenados, executar notebooks ou aplicar lógica personalizada. A saída pode ir para , ou outro destino compatível. Algumas atividades internas não exigem serviço vinculado.

Ingestão por pipeline com o Fabric Data Factory
Figura 4 — por com o Fabric Data Factory

Resumo do tópico

coordenam movimentação e execução; Dataflows Gen2 expressam transformações low-code reutilizáveis.

8. Atalhos, espelhamento e eventos em tempo real

Um atalho do OneLake é uma referência ativa ao Gen2, Amazon S3, Google Cloud ou outra localização do OneLake. Os arquivos externos aparecem no sem duplicação, útil quando residência, conformidade ou custo tornam a cópia indesejável.

O espelhamento replica continuamente bancos operacionais compatíveis, como , Snowflake e , para o OneLake quase em tempo real. O Fabric controla alterações e grava tabelas Delta sem personalizado.

O Fabric Eventstream recebe eventos contínuos do , Apache Kafka, e pontos de extremidade personalizados. Ele roteia, filtra e transforma antes de enviar para um , banco KQL otimizado para séries temporais ou outro destino da Inteligência em Tempo Real.

Atalhos, espelhamento e eventos em tempo real
Figura 5 — Atalhos, espelhamento e eventos em tempo real

Resumo do tópico

Atalhos federam sem copiar, espelhamento replica alterações de bancos e Eventstream trata eventos contínuos.

9. com código e autônomo

Fabric Notebooks baseados em Apache Spark atendem conectores ausentes ou transformações personalizadas. PySpark, Python, Scala, R ou SQL podem ler , bancos, arquivos e pontos alcançáveis, e gravar em tabelas Delta ou Warehouse. O pode ser interativo ou atividade agendada de .

O é o serviço independente do para integração fora do Fabric. Ele atende destinos como , plataformas externas e fontes locais em ambientes híbridos. Seu modelo de e serviços vinculados é semelhante ao do Fabric Data Factory.

Resumo do tópico

Use Fabric Notebooks para código Spark personalizado e independente para integração ampla ou híbrida fora do Fabric.

10. Opções de no

Lakeflow Spark Declarative permite descrever as tabelas de saída desejadas, enquanto o serviço gerencia dependências, ordem de execução e processamento incremental. A proposta é criar confiáveis de produção que funcionem continuamente ou por atualizações incrementais.

Databricks Notebooks atendem exploratória por , fontes JDBC, armazenamento de objetos e . Eles podem gravar tabelas Delta, executar como jobs agendados ou atuar como etapas de transformação em Lakeflow. Há ainda mecanismos especializados fora do escopo introdutório.

Opções de ingestão no Azure Databricks
Figura 6 — Opções de no

Resumo do tópico

Lakeflow gerencia fluxos incrementais confiáveis; notebooks oferecem e transformação flexíveis com código.

11. Data warehouses, fatos e dimensões

Um é um armazenamento relacional voltado a consultas analíticas, não transacionais. Medidas numéricas ficam em tabelas fato centrais, relacionadas a tabelas dimensão que descrevem perspectivas como cliente, produto, loja e tempo. Assim, agregações como receita mensal por produto e loja se tornam diretas.

O esquema em estrela liga dimensões diretamente à tabela fato. O esquema floco de neve normaliza partes de uma dimensão em tabelas relacionadas, por exemplo uma hierarquia de categorias. Warehouses combinam bem com dados estruturados, esquema rígido, equipes SQL e muitas consultas de BI simultâneas.

Esquemas estrela e floco de neve
DesenhoEstrutura das dimensõesConsequência
EstrelaDimensões ligadas diretamente aos fatosConsultas simples e menos junções
Floco de neveDimensões estendidas em tabelas de hierarquiaMais normalização e mais junções
Data warehouses, fatos e dimensões
Figura 7 — Data warehouses, fatos e dimensões

Resumo do tópico

Fatos guardam eventos mensuráveis; dimensões fornecem contexto; estrela e floco de neve otimizam a análise SQL.

12. Data lakes e esquema na leitura

Um guarda arquivos em sistema distribuído e aceita conteúdo estruturado, semiestruturado e não estruturado. Mecanismos nativos de nuvem, como Apache Spark, processam os arquivos em paralelo para análise e relatórios.

Muitos lakes aplicam esquema na leitura: os arquivos chegam sem restrições relacionais e recebem forma tabular quando são consultados. A flexibilidade acelera coleta e experimentação, mas catálogo, controle de acesso, qualidade e organização continuam necessários.

Resumo do tópico

O lake privilegia arquivos flexíveis e processamento distribuído; o esquema pode ser aplicado na leitura, não na gravação.

13. O e o Delta Lake

O mantém dados brutos e preparados como arquivos, mas expõe tabelas confiáveis e acesso SQL. O Delta Lake acrescenta de transações, imposição de esquema, consistência, versionamento e atualizações em lote e sobre Parquet.

e usam Delta Lake. No Fabric, tabelas ficam no OneLake e recebem automaticamente um ponto de extremidade de análise SQL. O também armazena no OneLake, criando uma base comum entre as experiências.

O lakehouse e o Delta Lake
Figura 8 — O e o Delta Lake

Resumo do tópico

O Delta Lake combina armazenamento aberto em arquivos com tabelas confiáveis, consistência transacional e análise SQL.

14. Escolha do armazenamento e combinação de serviços

atende dados variados, notebooks, Spark e machine learning. atende dados relacionais estruturados, desenvolvimento SQL, esquema rigoroso e BI concorrente. O Fabric agrega Data Factory, Inteligência em Tempo Real e espelhamento.

atende engenharia Spark com código, ciência de dados, SQL sobre Delta Lake, portabilidade multicloud ou experiência já existente. Seu SQL Warehouse é otimizado para concorrência de BI. Uma solução pode combinar ELT em arquivos, processamento por Databricks e carga dos resultados em tabelas do .

Um serviço analítico pode expor esquema e consulta mesmo quando os bytes estão num . A decisão deve considerar competências, formatos, governança, latência, concorrência, transformação e ecossistema.

Adequação do armazenamento analítico
ExperiênciaAdequação principal
Dados variados, Spark, notebooks e ML
Dados relacionais estruturados e BI SQL concorrente
Spark com código, Delta Lake, ciência de dados e portabilidade
Escolha do armazenamento e combinação de serviços
Figura 9 — Escolha do armazenamento e combinação de serviços

Resumo do tópico

Escolha pela forma dos dados, carga, competências e governança; Fabric e Databricks também podem participar da mesma solução.

15. Exercício prático e raciocínio da avaliação

O exercício orientado provisiona um ambiente , cria um , ingere dados de exemplo e os analisa. É uma introdução aos componentes, não um guia avançado. Reserve cerca de 30 minutos, use uma conta ou avaliação gratuita do Fabric e remova itens ou capacidade desnecessários ao terminar.

Na revisão: a solução que combina e warehouse relacional é o data ; é a plataforma que cria de e processamento; Apache Spark é o mecanismo distribuído de código aberto incluído para processamento em grande escala.

Resumo do tópico

Para a DP-900, relacione cada cenário ao termo de arquitetura, mecanismo de , tipo de armazenamento e capacidade exclusiva da plataforma.