Processamento em Lote e Streaming com Inteligência em Tempo Real do Fabric e Spark
Voltar para Learn
DP-900Capítulo 8

Estudo para a Certificação Microsoft DP-900

Processamento em Lote e Streaming com Inteligência em Tempo Real do Fabric e Spark

Lote, streaming, padrões lambda e kappa, janelas temporais, fontes e sinks, Inteligência em Tempo Real, Structured Streaming e Delta Lake

Tempo de estudo sugerido: 90 minutos • Nível iniciante • Alinhado ao plano de estudos DP-900 e à documentação oficial do Microsoft Learn

Eventos fluindo por processamento em tempo real até dashboards, alertas e Delta Lake

1. Por que o processamento em tempo real importa

Dispositivos inteligentes, aplicativos conectados e acesso amplo à Internet geram eventos continuamente. Muitos deles perdem valor rapidamente: o sistema precisa revelar uma tendência, recomendar uma ação ou responder ao fato antes do próximo job agendado.

Tempo real significa que o processamento começa quando os eventos chegam; quase em tempo real admite um pequeno atraso. Este capítulo apresenta padrões e serviços do em nível conceitual, não uma implementação detalhada.

Resumo do tópico

converte eventos contínuos em insight ou ação oportuna; quase tempo real aceita uma pequena latência.

2. Processamento em lote

No processamento em lote, vários registros são coletados e armazenados para que o grupo completo seja tratado em uma única operação. O lote pode começar por agenda, volume acumulado ou outro gatilho. A fatura mensal do cartão exemplifica a consolidação de compras antes de um único demonstrativo.

Lotes processam grandes volumes com eficiência e podem executar fora do horário de pico. Em contrapartida, há atraso no resultado e dependência de entrada preparada e validada. Registro inválido, falha ou travamento pode interromper toda a execução e exigir correção antes da nova tentativa.

Processamento em lote
Figura 1 — Processamento em lote

Resumo do tópico

atende conjuntos completos, volumosos e análises complexas que podem esperar, mas o resultado só chega depois do preparo e processamento do grupo.

3. e cenários sensíveis ao tempo

monitora uma fonte e trata cada evento, ou um microbatch muito pequeno, à medida que chega. O resultado pode ser agregado em janelas, como carros por minuto, sem aguardar todo o tráfego do dia.

Exemplos incluem risco de mercado e rebalanceamento, interação de jogos e incentivos personalizados, sugestões imobiliárias pela localização e sistemas de segurança que detectam fumaça ou calor, disparam alarmes e destravam saídas imediatamente.

Streaming e cenários sensíveis ao tempo
Figura 2 — e cenários sensíveis ao tempo

Resumo do tópico

é indicado quando dados dinâmicos e contínuos precisam gerar resposta em segundos ou milissegundos.

4. Comparação entre lote e

pode analisar o conjunto inteiro, recebe grandes entradas e executa análises complexas, mas a latência costuma ser de horas. vê o evento mais recente ou uma janela, trabalha com registros ou microbatches e busca segundos ou milissegundos.

Consultas de filtram, projetam, contam, agregam ou calculam médias móveis. São tendências, não limites absolutos: mecanismos modernos compartilham código e armazenamento entre os dois modos.

Tendências de lote e
Dimensão
AbrangênciaConjunto completoEvento recente ou janela
UnidadeGrande conjuntoRegistro ou microbatch
LatênciaGeralmente horasSegundos ou milissegundos
AnáliseHistórico complexoFiltros, agregações e cálculos móveis
Comparação entre lote e streaming
Figura 3 — Comparação entre lote e

Resumo do tópico

Escolha pela abrangência, tamanho, latência e complexidade, não como se lote e fossem marcas concorrentes.

5. Combinação de análise histórica e ao vivo

Soluções corporativas usam para filtrar ou agregar eventos ao vivo em e persistem o resultado para análise histórica. Mesmo sem visualização imediata, a camada de eventos captura dados contínuos para processamento em lote posterior.

Na arquitetura lambda, um caminho rápido produz resultados atuais e um caminho em lote prepara o histórico completo; ambos alimentam a análise. Arquiteturas delta unificam o trabalho em tabelas confiáveis. Kappa elimina a camada de lote separada e reproduz o fluxo quando há reprocessamento. e Apache Kafka tornam essa abordagem mais prática.

Combinação de análise histórica e ao vivo
Figura 4 — Combinação de análise histórica e ao vivo

Resumo do tópico

Arquiteturas modernas preservam o mesmo evento para análise imediata e histórica durável.

6. Os quatro elementos da arquitetura de

Um evento cria dados digitais: sinal de sensor, postagem, , transação ou mensagem. Uma fonte de captura esse evento. Ela pode ser pasta ou tabela, mas sistemas robustos usam fila ou broker para separar produtores e consumidores, preservar ordem em partições e aplicar garantias de entrega.

Uma consulta perpétua seleciona tipos de evento, projeta campos, transforma valores ou agrega registros. A saída vai para um sink: arquivo, tabela, ou outra fila para processamento posterior.

Os quatro elementos da arquitetura de streaming
Figura 5 — Os quatro elementos da arquitetura de

Resumo do tópico

Toda solução pode ser entendida por eventos, fonte ou broker, processamento contínuo e um ou mais sinks.

7. Consultas perpétuas, janelas e entrega

A consulta perpétua permanece ativa enquanto os eventos chegam. Como o fluxo não termina, totais e médias precisam de janelas temporais, por exemplo eventos por minuto ou média móvel de 30 segundos.

Partições permitem consumidores paralelos preservando a ordem dentro de cada partição. A entrega pelo menos uma vez pode repetir eventos; a lógica posterior deve tolerar ou remover duplicatas. Resultado exatamente uma vez exige coordenação entre fonte, processador, estado e sink.

Resumo do tópico

Janelas limitam cálculos sobre fluxos infinitos; partições e garantias determinam ordem, escala e duplicação.

8. Serviços de processamento e fontes

A Inteligência em Tempo Real do integra , armazenamento, KQL, e ação. O é uma biblioteca programável do Apache Spark no e . O é gerenciado para jobs autônomos ou híbridos fora do Fabric.

Fontes comuns incluem do para grande volume, para dispositivos gerenciados, Gen2 para chegada de arquivos e Apache Kafka como plataforma aberta frequentemente combinada ao Spark.

Opções representativas
ServiçoPapel principal
Inteligência em Tempo Real do FabricAnálise e ação integradas
Spark orientado por código
Jobs gerenciados autônomos ou híbridos

Resumo do tópico

Escolha o mecanismo pelo escopo e modelo de código; escolha a fonte por volume, gestão de dispositivos, ordem e ecossistema.

9. Sinks comuns de

Eventos processados podem voltar aos do para consumidores posteriores. Gen2, OneLake ou persistem arquivos para e histórico.

, e armazenam tabelas consultáveis. apresenta relatórios e ao vivo ou quase ao vivo. Uma consulta pode enviar a vários sinks para atender operação e histórico.

Resumo do tópico

Sinks suportam mensagens posteriores, arquivos duráveis, tabelas analíticas ou visualização em tempo real.

10. Inteligência em Tempo Real do

A Inteligência em Tempo Real do Fabric cobre o caminho do evento até insight e resposta no mesmo . Eventstream ingere, roteia, filtra e transforma. Eventhouse armazena séries temporais, telemetria e em bancos KQL, consultados pela Linguagem de Consulta Kusto.

em Tempo Real exibem métricas mutáveis; Activator avalia condições e dispara alertas ou ações. O conjunto evita montar produtos separados de , banco, visualização e resposta.

Inteligência em Tempo Real do Microsoft Fabric
Figura 6 — Inteligência em Tempo Real do

Resumo do tópico

A Inteligência em Tempo Real une Eventstream, Eventhouse e KQL, e Activator numa experiência orientada por eventos.

11. Hub em Tempo Real, Copilot e ação

O Hub em Tempo Real é o catálogo central de dados em movimento. Equipes descobrem, conectam, exploram, compartilham e governam fluxos internos e externos sem refazer cada integração.

Padrões, anomalias e previsões podem ser explorados com KQL, recursos visuais, linguagem natural e Copilot. em Tempo Real ampliam o acesso, e regras do Activator convertem uma condição em alerta ou resposta automatizada.

Resumo do tópico

O hub torna fluxos descobríveis, a análise os explica e o Activator transforma condições em ação.

12. Apache

O Apache Spark distribui processamento entre máquinas de um e oferece Python, Scala, Java e fluxos orientados a SQL. Structured aplica o modelo DataFrame a uma tabela ilimitada que cresce quando os eventos chegam.

O fluxo é fonte, DataFrame contínuo, consulta e sink. A consulta conta eventos, calcula média móvel ou enriquece registros. É adequado quando a equipe já usa Spark no ou e precisa de orientado por código.

Apache Spark Structured Streaming
Figura 7 — Apache

Resumo do tópico

Structured trata o fluxo como tabela em crescimento e executa transformações DataFrame incrementalmente.

13. Delta Lake unificando lote e

Um básico é uma coleção de arquivos sem transações. O Delta Lake adiciona , gravações confiáveis, imposição de esquema e versões sobre Parquet, evitando que falhas parciais deixem dados inconsistentes.

A mesma tabela Delta recebe e atende consultas em lote. Os runtimes Spark do e incluem Delta, formando uma base consistente para ao vivo e análise histórica.

Delta Lake unificando lote e streaming
Figura 8 — Delta Lake unificando lote e

Resumo do tópico

Delta Lake oferece tabelas confiáveis que funcionam como sink de e fonte de lote sem duplicar armazenamento.

14. Exercício prático e raciocínio da avaliação

O exercício usa dados de exemplo para explorar os recursos principais da Inteligência em Tempo Real do . Reserve cerca de 15 minutos e use uma conta ou avaliação do Fabric. Conecte ou gere eventos, explore, visualize e remova itens ou capacidade desnecessários ao terminar.

Na avaliação, significa processar continuamente conforme os registros chegam. No , o Hub em Tempo Real — não notebooks nem atalhos do OneLake — é o local central para descobrir e gerenciar dados de .

Resumo do tópico

Para a DP-900, identifique lote ou e depois mapeie fonte, consulta perpétua, janela, sink e componente da plataforma.