Processamento em Lote e Streaming com Inteligência em Tempo Real do Fabric e Spark
Lote, streaming, padrões lambda e kappa, janelas temporais, fontes e sinks, Inteligência em Tempo Real, Structured Streaming e Delta Lake
Tempo de estudo sugerido: 90 minutos • Nível iniciante • Alinhado ao plano de estudos DP-900 e à documentação oficial do Microsoft Learn
Por João Ricardo Dutra••Material integral
1. Por que o processamento em tempo real importa
Dispositivos inteligentes, aplicativos conectados e acesso amplo à Internet geram eventos continuamente. Muitos deles perdem valor rapidamente: o sistema precisa revelar uma tendência, recomendar uma ação ou responder ao fato antes do próximo job agendado.
Tempo real significa que o processamento começa quando os eventos chegam; quase em tempo real admite um pequeno atraso. Este capítulo apresenta padrões e serviços do em nível conceitual, não uma implementação detalhada.
Resumo do tópico
converte eventos contínuos em insight ou ação oportuna; quase tempo real aceita uma pequena latência.
2. Processamento em lote
No processamento em lote, vários registros são coletados e armazenados para que o grupo completo seja tratado em uma única operação. O lote pode começar por agenda, volume acumulado ou outro gatilho. A fatura mensal do cartão exemplifica a consolidação de compras antes de um único demonstrativo.
Lotes processam grandes volumes com eficiência e podem executar fora do horário de pico. Em contrapartida, há atraso no resultado e dependência de entrada preparada e validada. Registro inválido, falha ou travamento pode interromper toda a execução e exigir correção antes da nova tentativa.
Figura 1 — Processamento em lote
Resumo do tópico
atende conjuntos completos, volumosos e análises complexas que podem esperar, mas o resultado só chega depois do preparo e processamento do grupo.
3. e cenários sensíveis ao tempo
monitora uma fonte e trata cada evento, ou um microbatch muito pequeno, à medida que chega. O resultado pode ser agregado em janelas, como carros por minuto, sem aguardar todo o tráfego do dia.
Exemplos incluem risco de mercado e rebalanceamento, interação de jogos e incentivos personalizados, sugestões imobiliárias pela localização e sistemas de segurança que detectam fumaça ou calor, disparam alarmes e destravam saídas imediatamente.
Figura 2 — e cenários sensíveis ao tempo
Resumo do tópico
é indicado quando dados dinâmicos e contínuos precisam gerar resposta em segundos ou milissegundos.
4. Comparação entre lote e
pode analisar o conjunto inteiro, recebe grandes entradas e executa análises complexas, mas a latência costuma ser de horas. vê o evento mais recente ou uma janela, trabalha com registros ou microbatches e busca segundos ou milissegundos.
Consultas de filtram, projetam, contam, agregam ou calculam médias móveis. São tendências, não limites absolutos: mecanismos modernos compartilham código e armazenamento entre os dois modos.
Tendências de lote e
Dimensão
Abrangência
Conjunto completo
Evento recente ou janela
Unidade
Grande conjunto
Registro ou microbatch
Latência
Geralmente horas
Segundos ou milissegundos
Análise
Histórico complexo
Filtros, agregações e cálculos móveis
Figura 3 — Comparação entre lote e
Resumo do tópico
Escolha pela abrangência, tamanho, latência e complexidade, não como se lote e fossem marcas concorrentes.
5. Combinação de análise histórica e ao vivo
Soluções corporativas usam para filtrar ou agregar eventos ao vivo em e persistem o resultado para análise histórica. Mesmo sem visualização imediata, a camada de eventos captura dados contínuos para processamento em lote posterior.
Na arquitetura lambda, um caminho rápido produz resultados atuais e um caminho em lote prepara o histórico completo; ambos alimentam a análise. Arquiteturas delta unificam o trabalho em tabelas confiáveis. Kappa elimina a camada de lote separada e reproduz o fluxo quando há reprocessamento. e Apache Kafka tornam essa abordagem mais prática.
Figura 4 — Combinação de análise histórica e ao vivo
Resumo do tópico
Arquiteturas modernas preservam o mesmo evento para análise imediata e histórica durável.
6. Os quatro elementos da arquitetura de
Um evento cria dados digitais: sinal de sensor, postagem, , transação ou mensagem. Uma fonte de captura esse evento. Ela pode ser pasta ou tabela, mas sistemas robustos usam fila ou broker para separar produtores e consumidores, preservar ordem em partições e aplicar garantias de entrega.
Uma consulta perpétua seleciona tipos de evento, projeta campos, transforma valores ou agrega registros. A saída vai para um sink: arquivo, tabela, ou outra fila para processamento posterior.
Figura 5 — Os quatro elementos da arquitetura de
Resumo do tópico
Toda solução pode ser entendida por eventos, fonte ou broker, processamento contínuo e um ou mais sinks.
7. Consultas perpétuas, janelas e entrega
A consulta perpétua permanece ativa enquanto os eventos chegam. Como o fluxo não termina, totais e médias precisam de janelas temporais, por exemplo eventos por minuto ou média móvel de 30 segundos.
Partições permitem consumidores paralelos preservando a ordem dentro de cada partição. A entrega pelo menos uma vez pode repetir eventos; a lógica posterior deve tolerar ou remover duplicatas. Resultado exatamente uma vez exige coordenação entre fonte, processador, estado e sink.
Resumo do tópico
Janelas limitam cálculos sobre fluxos infinitos; partições e garantias determinam ordem, escala e duplicação.
8. Serviços de processamento e fontes
A Inteligência em Tempo Real do integra , armazenamento, KQL, e ação. O é uma biblioteca programável do Apache Spark no e . O é gerenciado para jobs autônomos ou híbridos fora do Fabric.
Fontes comuns incluem do para grande volume, para dispositivos gerenciados, Gen2 para chegada de arquivos e Apache Kafka como plataforma aberta frequentemente combinada ao Spark.
Opções representativas
Serviço
Papel principal
Inteligência em Tempo Real do Fabric
Análise e ação integradas
Spark orientado por código
Jobs gerenciados autônomos ou híbridos
Resumo do tópico
Escolha o mecanismo pelo escopo e modelo de código; escolha a fonte por volume, gestão de dispositivos, ordem e ecossistema.
9. Sinks comuns de
Eventos processados podem voltar aos do para consumidores posteriores. Gen2, OneLake ou persistem arquivos para e histórico.
, e armazenam tabelas consultáveis. apresenta relatórios e ao vivo ou quase ao vivo. Uma consulta pode enviar a vários sinks para atender operação e histórico.
Resumo do tópico
Sinks suportam mensagens posteriores, arquivos duráveis, tabelas analíticas ou visualização em tempo real.
10. Inteligência em Tempo Real do
A Inteligência em Tempo Real do Fabric cobre o caminho do evento até insight e resposta no mesmo . Eventstream ingere, roteia, filtra e transforma. Eventhouse armazena séries temporais, telemetria e em bancos KQL, consultados pela Linguagem de Consulta Kusto.
em Tempo Real exibem métricas mutáveis; Activator avalia condições e dispara alertas ou ações. O conjunto evita montar produtos separados de , banco, visualização e resposta.
Figura 6 — Inteligência em Tempo Real do
Resumo do tópico
A Inteligência em Tempo Real une Eventstream, Eventhouse e KQL, e Activator numa experiência orientada por eventos.
11. Hub em Tempo Real, Copilot e ação
O Hub em Tempo Real é o catálogo central de dados em movimento. Equipes descobrem, conectam, exploram, compartilham e governam fluxos internos e externos sem refazer cada integração.
Padrões, anomalias e previsões podem ser explorados com KQL, recursos visuais, linguagem natural e Copilot. em Tempo Real ampliam o acesso, e regras do Activator convertem uma condição em alerta ou resposta automatizada.
Resumo do tópico
O hub torna fluxos descobríveis, a análise os explica e o Activator transforma condições em ação.
12. Apache
O Apache Spark distribui processamento entre máquinas de um e oferece Python, Scala, Java e fluxos orientados a SQL. Structured aplica o modelo DataFrame a uma tabela ilimitada que cresce quando os eventos chegam.
O fluxo é fonte, DataFrame contínuo, consulta e sink. A consulta conta eventos, calcula média móvel ou enriquece registros. É adequado quando a equipe já usa Spark no ou e precisa de orientado por código.
Figura 7 — Apache
Resumo do tópico
Structured trata o fluxo como tabela em crescimento e executa transformações DataFrame incrementalmente.
13. Delta Lake unificando lote e
Um básico é uma coleção de arquivos sem transações. O Delta Lake adiciona , gravações confiáveis, imposição de esquema e versões sobre Parquet, evitando que falhas parciais deixem dados inconsistentes.
A mesma tabela Delta recebe e atende consultas em lote. Os runtimes Spark do e incluem Delta, formando uma base consistente para ao vivo e análise histórica.
Figura 8 — Delta Lake unificando lote e
Resumo do tópico
Delta Lake oferece tabelas confiáveis que funcionam como sink de e fonte de lote sem duplicar armazenamento.
14. Exercício prático e raciocínio da avaliação
O exercício usa dados de exemplo para explorar os recursos principais da Inteligência em Tempo Real do . Reserve cerca de 15 minutos e use uma conta ou avaliação do Fabric. Conecte ou gere eventos, explore, visualize e remova itens ou capacidade desnecessários ao terminar.
Na avaliação, significa processar continuamente conforme os registros chegam. No , o Hub em Tempo Real — não notebooks nem atalhos do OneLake — é o local central para descobrir e gerenciar dados de .
Resumo do tópico
Para a DP-900, identifique lote ou e depois mapeie fonte, consulta perpétua, janela, sink e componente da plataforma.