Arquitetura de Data Warehouse, Pipelines de Ingestão e Armazenamentos Analíticos
Microsoft Fabric, Azure Databricks, ETL e ELT, modelos semânticos, pipelines, warehouses, lakes e lakehouses
Tempo de estudo sugerido: 95 minutos • Nível iniciante • Alinhado ao plano de estudos DP-900 e à documentação oficial do Microsoft Learn
Por João Ricardo Dutra••Material integral
1. Duas plataformas para análise em grande escala
A análise em grande escala une o data warehousing tradicional de business intelligence a técnicas voltadas a grandes volumes, formatos variados e dados que chegam continuamente. Registros transacionais costumam ser copiados para um esquema analítico; arquivos e fluxos podem chegar a um e ser processados em paralelo por mecanismos como o Apache Spark. A combinação da flexibilidade do lake com o comportamento SQL de warehouse forma a arquitetura chamada data .
O é uma plataforma unificada de análise. Engenharia de dados, data warehousing, Inteligência em Tempo Real, ciência de dados e compartilham workspaces no navegador e a camada OneLake para todo o locatário; a Microsoft opera a infraestrutura. O é uma plataforma gerenciada no , baseada no Apache Spark. Notebooks e cargas SQL usam Delta Lake, que acrescenta transações, imposição de esquema e histórico de versões a arquivos Parquet.
Figura 1 — Duas plataformas para análise em grande escala
Resumo do tópico
O Fabric integra análise como sobre o OneLake; o concentra engenharia e análise Spark em formatos abertos.
2. A arquitetura analítica ponta a ponta
Uma solução moderna começa com fontes como bancos transacionais, arquivos, aplicativos, dispositivos e fluxos de eventos. A movimenta os dados; o processamento limpa, filtra, combina ou reestrutura. ETL transforma antes de carregar o armazenamento analítico; ELT carrega primeiro e usa a computação do destino para transformar depois. Caminhos em lote e em tempo real podem coexistir, frequentemente com distribuídos trabalhando em paralelo.
Os dados processados ficam em um relacional, baseado em arquivos ou que combina os dois. Analistas e cientistas podem consultar o armazenamento diretamente, mas um modelo preparado facilita a criação de relatórios. Relatórios, , exploração interativa e interfaces assistidas por IA formam a camada de consumo.
ETL e ELT
Padrão
Ordem
Ideia típica
ETL
Extrair → Transformar → Carregar
Preparar antes do armazenamento analítico
ELT
Extrair → Carregar → Transformar
Usar a computação do destino depois da carga
Figura 2 — A arquitetura analítica ponta a ponta
Resumo do tópico
Pense na carga como uma cadeia: fontes, e processamento, armazenamento analítico, modelo analítico e consumo de negócio.
3. Modelos semânticos e consumo visual
Sistemas de BI anteriores usavam cubos multidimensionais com valores pré-agregados por dimensões, como vendas por produto e região. A abordagem preferida no e no é o modelo semântico tabular. Ele define tabelas, relacionamentos, hierarquias e medidas DAX, calculando agregações no momento da consulta.
O modo Direct Lake permite que o modelo semântico leia tabelas Delta no OneLake sem importar nem pré-agregar os dados. Analistas publicam tendências, comparações e KPIs em relatórios impressos, gráficos em documentos ou apresentações, web e experiências interativas de autoatendimento.
Resumo do tópico
Modelos semânticos convertem dados armazenados em conceitos e medidas de negócio governados para relatórios e autoatendimento.
4. Análise assistida por IA
Recursos de linguagem natural ampliam a análise para quem não escreve consultas. O Q&A do pode transformar uma pergunta em linguagem comum em uma resposta visual. O Copilot no auxilia na geração de medidas DAX e SQL, resume relatórios, explica tendências e apoia outras tarefas analíticas.
O oferece o Genie para perguntas conversacionais sobre dados Delta Lake governados. Ele interpreta a solicitação, gera e executa SQL e devolve o resultado. Esses assistentes aceleram a exploração, mas qualidade, permissões, definições semânticas e validação humana continuam indispensáveis.
Resumo do tópico
Assistentes de IA reduzem a barreira das consultas, mas não substituem governança, modelos confiáveis nem revisão do resultado.
5. Como o representa a arquitetura
O OneLake é a base de armazenamento compartilhada por todo o locatário para as cargas do Fabric. O Delta Lake é o formato aberto padrão para tabelas , permitindo que as experiências usem os mesmos dados em vez de manter silos separados.
O guarda dados variados em Delta Lake e expõe um ponto de extremidade de análise SQL. O fornece experiência relacional totalmente gerenciada e compatível com SQL Server, com imposição de esquema mais forte. O Fabric Data Factory cria e agenda movimentação e transformação low-code. O fornece modelos semânticos, relatórios, e Direct Lake.
Figura 3 — Como o representa a arquitetura
Resumo do tópico
O Fabric reúne armazenamento, engenharia, warehouse, orquestração, tempo real e BI em um .
6. Como o representa a arquitetura
O usa Delta Lake como formato aberto nativo para análise SQL, engenharia de dados e machine learning. O oferece computação de SQL warehouse , histórico de consultas, e alertas sobre tabelas Delta.
Databricks Notebooks colaborativos aceitam Python, SQL, Scala e R. O Unity Catalog fornece descoberta, e governança granular de ativos de dados e IA. O Genie acrescenta uma interface conversacional que transforma perguntas em SQL executado.
Resumo do tópico
O Databricks organiza a arquitetura em torno de Spark, Delta Lake, notebooks, computação SQL e governança unificada.
7. por com o Fabric Data Factory
O Fabric Data Factory é o ponto inicial habitual para orientada por no OneLake. orquestram fluxos com várias etapas e executam atividades em sequência ou paralelo. Dataflows Gen2 oferecem transformações visuais reutilizáveis com Power Query para autoria low-code.
Um conecta entradas e saídas por serviços vinculados e pode copiar dados, invocar procedimentos armazenados, executar notebooks ou aplicar lógica personalizada. A saída pode ir para , ou outro destino compatível. Algumas atividades internas não exigem serviço vinculado.
Figura 4 — por com o Fabric Data Factory
Resumo do tópico
coordenam movimentação e execução; Dataflows Gen2 expressam transformações low-code reutilizáveis.
8. Atalhos, espelhamento e eventos em tempo real
Um atalho do OneLake é uma referência ativa ao Gen2, Amazon S3, Google Cloud ou outra localização do OneLake. Os arquivos externos aparecem no sem duplicação, útil quando residência, conformidade ou custo tornam a cópia indesejável.
O espelhamento replica continuamente bancos operacionais compatíveis, como , Snowflake e , para o OneLake quase em tempo real. O Fabric controla alterações e grava tabelas Delta sem personalizado.
O Fabric Eventstream recebe eventos contínuos do , Apache Kafka, e pontos de extremidade personalizados. Ele roteia, filtra e transforma antes de enviar para um , banco KQL otimizado para séries temporais ou outro destino da Inteligência em Tempo Real.
Figura 5 — Atalhos, espelhamento e eventos em tempo real
Resumo do tópico
Atalhos federam sem copiar, espelhamento replica alterações de bancos e Eventstream trata eventos contínuos.
9. com código e autônomo
Fabric Notebooks baseados em Apache Spark atendem conectores ausentes ou transformações personalizadas. PySpark, Python, Scala, R ou SQL podem ler , bancos, arquivos e pontos alcançáveis, e gravar em tabelas Delta ou Warehouse. O pode ser interativo ou atividade agendada de .
O é o serviço independente do para integração fora do Fabric. Ele atende destinos como , plataformas externas e fontes locais em ambientes híbridos. Seu modelo de e serviços vinculados é semelhante ao do Fabric Data Factory.
Resumo do tópico
Use Fabric Notebooks para código Spark personalizado e independente para integração ampla ou híbrida fora do Fabric.
10. Opções de no
Lakeflow Spark Declarative permite descrever as tabelas de saída desejadas, enquanto o serviço gerencia dependências, ordem de execução e processamento incremental. A proposta é criar confiáveis de produção que funcionem continuamente ou por atualizações incrementais.
Databricks Notebooks atendem exploratória por , fontes JDBC, armazenamento de objetos e . Eles podem gravar tabelas Delta, executar como jobs agendados ou atuar como etapas de transformação em Lakeflow. Há ainda mecanismos especializados fora do escopo introdutório.
Figura 6 — Opções de no
Resumo do tópico
Lakeflow gerencia fluxos incrementais confiáveis; notebooks oferecem e transformação flexíveis com código.
11. Data warehouses, fatos e dimensões
Um é um armazenamento relacional voltado a consultas analíticas, não transacionais. Medidas numéricas ficam em tabelas fato centrais, relacionadas a tabelas dimensão que descrevem perspectivas como cliente, produto, loja e tempo. Assim, agregações como receita mensal por produto e loja se tornam diretas.
O esquema em estrela liga dimensões diretamente à tabela fato. O esquema floco de neve normaliza partes de uma dimensão em tabelas relacionadas, por exemplo uma hierarquia de categorias. Warehouses combinam bem com dados estruturados, esquema rígido, equipes SQL e muitas consultas de BI simultâneas.
Esquemas estrela e floco de neve
Desenho
Estrutura das dimensões
Consequência
Estrela
Dimensões ligadas diretamente aos fatos
Consultas simples e menos junções
Floco de neve
Dimensões estendidas em tabelas de hierarquia
Mais normalização e mais junções
Figura 7 — Data warehouses, fatos e dimensões
Resumo do tópico
Fatos guardam eventos mensuráveis; dimensões fornecem contexto; estrela e floco de neve otimizam a análise SQL.
12. Data lakes e esquema na leitura
Um guarda arquivos em sistema distribuído e aceita conteúdo estruturado, semiestruturado e não estruturado. Mecanismos nativos de nuvem, como Apache Spark, processam os arquivos em paralelo para análise e relatórios.
Muitos lakes aplicam esquema na leitura: os arquivos chegam sem restrições relacionais e recebem forma tabular quando são consultados. A flexibilidade acelera coleta e experimentação, mas catálogo, controle de acesso, qualidade e organização continuam necessários.
Resumo do tópico
O lake privilegia arquivos flexíveis e processamento distribuído; o esquema pode ser aplicado na leitura, não na gravação.
13. O e o Delta Lake
O mantém dados brutos e preparados como arquivos, mas expõe tabelas confiáveis e acesso SQL. O Delta Lake acrescenta de transações, imposição de esquema, consistência, versionamento e atualizações em lote e sobre Parquet.
e usam Delta Lake. No Fabric, tabelas ficam no OneLake e recebem automaticamente um ponto de extremidade de análise SQL. O também armazena no OneLake, criando uma base comum entre as experiências.
Figura 8 — O e o Delta Lake
Resumo do tópico
O Delta Lake combina armazenamento aberto em arquivos com tabelas confiáveis, consistência transacional e análise SQL.
14. Escolha do armazenamento e combinação de serviços
atende dados variados, notebooks, Spark e machine learning. atende dados relacionais estruturados, desenvolvimento SQL, esquema rigoroso e BI concorrente. O Fabric agrega Data Factory, Inteligência em Tempo Real e espelhamento.
atende engenharia Spark com código, ciência de dados, SQL sobre Delta Lake, portabilidade multicloud ou experiência já existente. Seu SQL Warehouse é otimizado para concorrência de BI. Uma solução pode combinar ELT em arquivos, processamento por Databricks e carga dos resultados em tabelas do .
Um serviço analítico pode expor esquema e consulta mesmo quando os bytes estão num . A decisão deve considerar competências, formatos, governança, latência, concorrência, transformação e ecossistema.
Adequação do armazenamento analítico
Experiência
Adequação principal
Dados variados, Spark, notebooks e ML
Dados relacionais estruturados e BI SQL concorrente
Spark com código, Delta Lake, ciência de dados e portabilidade
Figura 9 — Escolha do armazenamento e combinação de serviços
Resumo do tópico
Escolha pela forma dos dados, carga, competências e governança; Fabric e Databricks também podem participar da mesma solução.
15. Exercício prático e raciocínio da avaliação
O exercício orientado provisiona um ambiente , cria um , ingere dados de exemplo e os analisa. É uma introdução aos componentes, não um guia avançado. Reserve cerca de 30 minutos, use uma conta ou avaliação gratuita do Fabric e remova itens ou capacidade desnecessários ao terminar.
Na revisão: a solução que combina e warehouse relacional é o data ; é a plataforma que cria de e processamento; Apache Spark é o mecanismo distribuído de código aberto incluído para processamento em grande escala.
Resumo do tópico
Para a DP-900, relacione cada cenário ao termo de arquitetura, mecanismo de , tipo de armazenamento e capacidade exclusiva da plataforma.