Conceitos Centrais de Dados: Formatos, Armazenamento e Processamento
Formas de dados, formatos de arquivo, bancos relacionais e NoSQL, OLTP, ACID, análise, lakehouses, Microsoft Fabric, Azure Databricks, Microsoft Purview e Power BI
Tempo de estudo sugerido: 95 minutos • Nível iniciante • Alinhado ao plano de estudos DP-900 e à documentação oficial do Microsoft Learn
Por João Ricardo Dutra••Material integral
1. Por que os fundamentos dos dados são importantes
Sistemas, aplicações, sensores e dispositivos conectados produzem mais dados a cada ano. A coleta e o armazenamento são mais baratos do que no passado, portanto organizações de todos os tamanhos podem usar informações para melhorar produtos, operações, receitas e decisões de risco. O valor não vem apenas da acumulação: os dados devem ser representados, armazenados, processados e interpretados de forma adequada.
Uma arquitetura sólida começa perguntando o que os dados descrevem, com que rapidez eles mudam, quem os consome e se a carga de trabalho registra eventos ao vivo ou estuda o histórico. Essas questões determinam se um arquivo, banco de dados, mecanismo transacional ou plataforma analítica é a melhor opção.
Resumo do tópico
Os dados tornam-se úteis quando uma organização consegue capturá-los, mantê-los de forma confiável e analisá-los de uma forma adequada à questão do negócio.
2. Entidades, atributos e as quatro formas gerais de dados
Os dados registram fatos, descrições, medições e observações. Os dados comerciais geralmente representam entidades como clientes, produtos, pedidos ou dispositivos. Uma instância de entidade possui atributos: um cliente pode ter um nome, endereço postal, números de telefone e preferências de contato.
Forma de dados
Característica principal
Exemplos típicos
Estruturado
Cada instância segue um esquema fixo
Linhas de clientes, tabelas de produtos, saldos de contas
Semiestruturado
Existe uma estrutura reconhecível, mas os campos podem variar
Documentos , mensagens , cargas úteis de eventos
Não estruturado
Nenhum esquema tabular ou de documento independente de aplicativo
Trechos de documentos usados para recuperação em linguagem natural
Figura 1 - A forma de dados é um dos primeiros sinais utilizados para selecionar armazenamento e processamento.
Resumo do tópico
Identifique primeiro a entidade e seus atributos e, em seguida, determine se a representação é fixa, flexível, livre ou um embedding vetorial.
3. Dados estruturados e esquemas fixos
Os dados estruturados estão em conformidade com um esquema predefinido. Uma representação tabular usa linhas para instâncias de entidade e colunas para atributos. Como cada linha expõe os mesmos campos e tipos de dados compatíveis, os aplicativos podem validar, classificar, unir, agregar e consultar os dados de maneira previsível.
Os dados estruturados são frequentemente armazenados em bancos de dados relacionais, onde as tabelas fazem referência umas às outras por meio de valores-chave. Um esquema fixo melhora a consistência, mas as mudanças no esquema devem ser gerenciadas porque produtores e consumidores dependem da forma acordada.
Resumo do tópico
Dados estruturados trocam flexibilidade por consistência e consultas previsíveis.
4. Dados semiestruturados e
Os dados semiestruturados mantêm a organização sem exigir que cada instância contenha campos idênticos. Um cliente pode ter dois números de telefone, outro apenas um endereço de e-mail e um terceiro um número de apartamento. O documento ainda segue nomes e aninhamentos reconhecíveis, mas elementos opcionais e repetidos são permitidos.
JavaScript Object Notation () é uma representação generalizada para este modelo. Os objetos usam colchetes, as coleções usam colchetes e os atributos aparecem como pares nome-valor. também pode representar dados totalmente estruturados; sua principal característica é a capacidade de expressar hierarquia e variação.
Resumo do tópico
As representações semiestruturadas preservam a organização legível por máquina, ao mesmo tempo que permitem que os registros sejam diferentes.
5. Dados não estruturados, BLOBs e embeddings vetoriais
Documentos, imagens, áudio, vídeo e arquivos binários específicos de aplicações não expõem necessariamente um esquema compartilhado que um mecanismo de banco de dados possa interpretar diretamente. Frequentemente, eles são armazenados como objetos binários grandes (BLOBs) e renderizados ou decodificados por uma aplicação.
As soluções de IA criam cada vez mais embeddings vetoriais: matrizes de números que capturam características semânticas de texto, imagens ou outro conteúdo. Um banco de dados vetorial pode comparar esses embeddings por similaridade, permitindo que um assistente recupere passagens relevantes de documentos antes de responder a uma pergunta em linguagem natural. O arquivo original permanece não estruturado mesmo que seu embedding seja uma representação numérica estruturada.
Resumo do tópico
O armazenamento BLOB mantém o conteúdo bruto; o armazenamento vetorial mantém embeddings que tornam a recuperação semântica eficiente.
6. Escolhendo entre armazenamentos de arquivos e bancos de dados
Os armazenamentos de arquivos organizam e recuperam arquivos completos. Os bancos de dados gerenciam registros e expõem recursos de consulta, indexação, integridade e simultaneidade. O limite não é absoluto - um sistema de arquivos é tecnicamente uma forma de armazenamento de dados, e lakehouses modernos adicionam semântica de tabela semelhante a banco de dados sobre arquivos - mas a distinção é útil para decisões de arquitetura.
Requisito
Provável ponto de partida
Trocar dados tabulares legíveis por humanos
CSV ou outro arquivo delimitado
Mantenha imagens e vídeos em grande escala
Objeto em nuvem ou armazenamento de blob
Aplicar relacionamentos e transações
Banco de dados relacional
Armazenar documentos variáveis
Banco de dados de documentos ou armazenamento de arquivos
Analise grandes conjuntos de dados históricos
, ou
Recuperar conteúdo por similaridade semântica
Banco de dados vetorial ou índice vetorial
Resumo do tópico
Selecione o armazenamento com base em padrões de acesso, requisitos de integridade, escala, latência e formato de dados - não apenas na extensão do arquivo.
7. Armazenamento de arquivos de discos locais para a nuvem
Os arquivos podem residir em discos pessoais, mídia removível, sistemas de rede compartilhados ou armazenamento em nuvem. As organizações centralizam cada vez mais arquivos importantes em serviços em nuvem para obter capacidade elástica, durabilidade, controles de segurança e armazenamento econômico para grandes volumes.
A seleção do formato depende de quem lê e grava os dados, se as pessoas precisam inspecioná-los e se o armazenamento compacto e o processamento rápido são mais importantes do que a legibilidade. Um formato adequado para troca de dados pode ser ineficiente para análises, enquanto um formato colunar pode ser estranho para um produtor de .
Resumo do tópico
O armazenamento centralizado de arquivos em nuvem melhora a escala e a confiabilidade, enquanto a escolha do formato determina a interoperabilidade e a eficiência do processamento.
8. Texto delimitado e de largura fixa
O texto delimitado separa campos e linhas com caracteres acordados. Valores separados por vírgula (CSV) normalmente usam vírgulas entre campos e quebras de linha entre registros; uma linha de cabeçalho pode nomear as colunas. Valores separados por tabulação (TSV), dados delimitados por espaço e registros de largura fixa são alternativas.
Esses formatos são portáteis e legíveis, mas delimitadores de escape, codificação de caracteres, valores nulos, datas e tipos de dados exigem convenções explícitas. Arquivos de largura fixa evitam a ambigüidade do delimitador, mas desperdiçam espaço e são menos adaptáveis a alterações de esquema.
Resumo do tópico
O texto delimitado é excelente para amplo intercâmbio, desde que produtores e consumidores concordem sobre codificação, delimitadores, cabeçalhos e tipos de dados.
9. , e arquivos binários
expressa objetos e coleções aninhados com relativamente pouca sintaxe, tornando-o comum para , configuração e mensagens de eventos. Extensible Markup Language () usa elementos e atributos delimitados por tags. é mais detalhado, mas continua importante em sistemas e padrões empresariais estabelecidos.
Os formatos de texto mapeiam bytes para caracteres por meio de codificações como Unicode. Os formatos binários armazenam bytes que um aplicativo deve interpretar, como imagem JPEG, fluxo de áudio, vídeo, arquivo ou documento proprietário. Os profissionais de dados costumam chamar esses arquivos binários de BLOBs.
Figura 2 - Formatos de arquivo equilibram legibilidade, flexibilidade, compactação e padrões de processamento.
Resumo do tópico
e descrevem dados hierárquicos; os formatos binários priorizam a representação específica do aplicativo em vez da legibilidade humana.
10. Parquet: armazenamento analítico colunar
Apache Parquet é um formato colunar e um padrão de fato para data lakes modernos. Um arquivo é dividido em grupos de linhas e os valores de cada coluna são armazenados juntos em um grupo. Os descrevem os fragmentos, permitindo que um mecanismo ignore dados irrelevantes e leia apenas as colunas solicitadas.
O layout colunar permite compactação e codificação eficientes, principalmente quando valores adjacentes compartilham características. Parquet também lida com dados aninhados. Ele é otimizado para varreduras analíticas, não para leitura em um editor de texto ou para atualizações frequentes de registros únicos.
Resumo do tópico
Parquet reduz a E/S analítica organizando e compactando dados por coluna.
11.Avro e Delta Lake
Apache Avro é baseado em linhas. Cada arquivo contém um cabeçalho que descreve o esquema em e blocos binários contendo os registros. Manter cada registro unido torna o Avro útil para troca de dados, , serialização compacta e minimização da largura de banda da rede.
Delta Lake é um formato de tabela de código aberto criado em Parquet. Um de transações registra alterações na tabela e adiciona transações ACID, atualizações confiáveis, gerenciamento de esquema, controle de versão e viagens no tempo em arquivos em um . Parquet fornece os arquivos de dados; o Delta fornece histórico de tabela e coordenação transacional.
Resumo do tópico
Avro favorece a troca orientada a linhas; Delta Lake transforma arquivos Parquet em tabelas confiáveis e versionadas.
12. O que um banco de dados adiciona
No trabalho profissional com dados, um banco de dados é um sistema dedicado para armazenar, gerenciar e consultar registros. Além da persistência, ele pode fornecer índices, restrições, controle de simultaneidade, segurança, backup, recuperação e otimização de consultas. Esses recursos distinguem um sistema de gerenciamento de banco de dados de um diretório de arquivos.
Resumo do tópico
Um banco de dados gerencia registros e seu comportamento, não apenas os bytes que os armazenam.
13. Bancos de dados relacionais, chaves, normalização e SQL
Um banco de dados relacional armazena entidades estruturadas em tabelas. Uma chave primária identifica exclusivamente cada linha e uma chave estrangeira faz referência a uma linha em outra tabela. Esses relacionamentos permitem que um pedido identifique seu cliente sem repetir o registro completo do cliente.
A normalização separa entidades relacionadas para reduzir duplicação e atualizar anomalias. Melhora a consistência transacional, embora os esquemas analíticos possam desnormalizar deliberadamente os dados para acelerar as consultas. A linguagem de consulta estruturada (SQL) é baseada nos padrões ANSI, portanto, suas ideias principais são semelhantes em produtos de banco de dados, mesmo quando as implementações adicionam extensões.
Figura 3 - Modelos de banco de dados otimizam diferentes formatos e padrões de acesso.
Resumo do tópico
Bancos de dados relacionais usam tabelas, chaves, restrições, normalização e SQL para preservar relacionamentos estruturados.
14. Quatro modelos não relacionais comuns
Bancos de dados não relacionais não requerem um esquema relacional e geralmente são agrupados sob o termo , embora alguns ofereçam linguagens de consulta semelhantes a SQL. Eles são selecionados para esquemas flexíveis, distribuição, relacionamentos especializados ou escala muito alta.
Modelo
Representação
Bom ajuste
Valor-chave
Uma chave exclusiva é mapeada para um valor arbitrário
Sessões, , perfis, pesquisas rápidas
Documento
O valor é um documento consultável
Catálogos e entidades com atributos variáveis
Família de colunas
As linhas contêm grupos de colunas relacionados
Grandes conjuntos de dados esparsos e cargas de trabalho distribuídas
Gráfico
Entidades são nós e relacionamentos são arestas
Caminhos de fraude, relações sociais, recomendações
Resumo do tópico
é uma família de modelos; combinar valor-chave, documento, família de colunas ou armazenamento de gráfico com o padrão de consulta dominante.
15. Processamento transacional, OLTP e
Uma transação é um evento comercial pequeno e discreto, como o pagamento de um pedido ou a transferência de dinheiro. Os sistemas de processamento de transações on-line (OLTP) oferecem suporte a aplicativos de linha de negócios em tempo real e podem lidar com milhões de eventos, mantendo os dados disponíveis com baixa latência.
Os bancos de dados OLTP são otimizados para leituras e gravações. Os aplicativos criam, recuperam, atualizam e excluem registros – as operações – enquanto o banco de dados protege a integridade sob atividades simultâneas. Os esquemas costumam ser normalizados para que cada transação atinja um pequeno número de registros precisos.
Resumo do tópico
OLTP registra eventos de negócios atuais por meio de leituras e gravações rápidas e confiáveis.
16. Garantias de transação ACID
Considere transferir US$ 40 da conta A, inicialmente US$ 100, para a conta B, inicialmente US$ 50. O resultado correto é US$ 60 e US$ 90, e nenhum observador deverá ver uma transferência parcial permanente.
Propriedade
Garantia na transferência
Atomicidade
Débito e crédito são bem-sucedidos juntos ou ambos são revertidos
Consistência
As regras permanecem verdadeiras e o saldo total permanece em US$ 150
Isolamento
Leitores simultâneos não combinam valores antes e depois
Durabilidade
Após o commit, os novos saldos sobrevivem a uma reinicialização
Figura 4 - ACID evita estados de transação parciais, inválidos, mistos ou perdidos.
Resumo do tópico
ACID torna uma transação indivisível, válida, isolada de interferência e permanente após confirmação.
17. Processamento analítico, ETL e ELT
Os sistemas analíticos são principalmente de leitura e armazenam dados históricos ou métricas de negócios. Eles podem analisar um único instantâneo ou uma série temporal de instantâneos. Os dados operacionais são comumente extraídos, transformados e carregados (ETL), ou extraídos e carregados antes da aplicação das transformações (ELT), um padrão comum em lakehouses modernos.
Ingerir arquivos operacionais, eventos e registros de banco de dados.
Limpe, padronize, junte e enriqueça os dados antes ou depois do carregamento.
Organize os dados em tabelas ou warehouse.
Construir agregações e definições semânticas.
Forneça relatórios, visualizações, painéis, ciência de dados e cargas de trabalho de IA.
Figura 5 – Analytics separa a captura operacional da análise histórica.
Resumo do tópico
Transformações ETL antes do carregamento; ELT carrega primeiro e usa a plataforma de destino para transformação.
18. , e
Loja
Característica central
Uso típico
escalonável baseado em arquivos para dados brutos e selecionados
Exploração, ciência de dados, formatos diversos
Esquema relacional e mecanismo SQL otimizado para leituras
Relatórios governados e inteligência de negócios
Flexibilidade do lago, além de tabelas confiáveis e semântica de consulta relacional
Engenharia, análise e IA unificadas
Os esquemas analíticos geralmente desnormalizam os dados das fontes OLTP. Algumas duplicações podem reduzir junções e melhorar o desempenho de leitura. Esta é uma compensação deliberada: os modelos transacionais otimizam as atualizações e a integridade, enquanto os modelos analíticos otimizam amplas varreduras, agregações e relatórios.
Resumo do tópico
Lakes priorizam arquivos flexíveis, warehouses priorizam análises relacionais e lakehouses combinam ambas as abordagens.
19. OLAP, modelos semânticos, fatos, dimensões e usuários
Um modelo de Processamento Analítico Online (OLAP) - agora comumente chamado de modelo semântico e historicamente chamado de cubo - armazena ou define agregações para análise rápida. As medidas numéricas das tabelas de fatos são avaliadas em tabelas de dimensões, como data, cliente, produto e geografia. As hierarquias permitem o detalhamento de região para cidade para abordar e o detalhamento na direção oposta.
Os modelos semânticos são um exemplo comum. Os cientistas de dados podem explorar arquivos diretamente em um lago, os analistas de dados podem consultar tabelas de warehouse e criar visualizações, e os usuários corporativos normalmente consomem métricas selecionadas por meio de relatórios e painéis.
Resumo do tópico
Os modelos semânticos traduzem os dados armazenados em medidas, dimensões, hierarquias e análises prontas para negócios consistentes.
20. Plataformas modernas e arquitetura medalhão
é uma plataforma analítica unificada que traz armazenamento, engenharia de dados, armazenamento, ciência de dados, recursos em tempo real e relatórios em um ambiente compartilhado. suporta engenharia de dados e ciência de dados em grande escala e usa Delta Lake como formato de tabela padrão. fornece segurança de dados unificada, governança e conformidade entre fontes. fornece modelagem semântica, visualização e experiências de business intelligence.
Uma arquitetura medalhão cria limites de qualidade explícitos. Bronze retém registros de origem bruta para rastreabilidade e reprocessamento. Silver contém dados limpos e conformados com duplicatas removidas e tipos padronizados. Gold contém modelos agregados e prontos para negócios para relatórios e análises. e também fornecem experiências Copilot para exploração de linguagem natural.
Figura 6 – Plataformas modernas aplicam engenharia, governança e consumo em torno de camadas medalhões de qualidade.
Resumo do tópico
e processam análises, governa os dados, entrega insights de negócio e as camadas medalhão tornam explícita a progressão da qualidade.
21. Cenário de varejo integrado
Um varejista registra pedidos e alterações de estoque em um banco de dados relacional normalizado OLTP. As imagens do produto são mantidas no armazenamento de blobs, atributos de catálogo flexíveis em documentos e eventos de aplicativo em Avro. A plataforma analítica ingere essas fontes em Bronze, padroniza clientes e produtos em Prata e publica medidas de vendas e estoque em Ouro.
Parquet e Delta Lake suportam tabelas eficientes. Um modelo semântico define receita, margem, unidades, datas, lojas e produtos para . Os cientistas de dados podem usar arquivos para previsões, enquanto os usuários corporativos visualizam painéis. ajuda a descobrir, classificar, proteger e governar as fontes participantes.
Resumo do tópico
Soluções reais combinam modelos de armazenamento: OLTP para eventos atuais, armazenamento de objetos para arquivos, dados de documentos para flexibilidade e uma plataforma analítica governada para tendências.
22. Avaliação do módulo com explicações
Recuperação de linguagem natural sobre documentos: escolha um banco de dados vetorial porque ele pesquisa embeddings por similaridade semântica.
Imagens e vídeos grandes: escolha o armazenamento de blob em vez de um banco de dados relacional ou de família de colunas.
Leituras e gravações transacionais de alto volume: escolha um banco de dados relacional OLTP quando os relacionamentos e a integridade do ACID forem centrais.
Vantagem Parquet: o armazenamento colunar permite compactação, codificação e leituras seletivas eficientes.
Fluxo de trabalho de varejo: use OLTP para transações ao vivo e OLAP ou um modelo semântico para análise de tendências.
Distinção chave-valor: cada registro é recuperado por uma chave única associada a um valor arbitrário.
Estoque e transações de clientes: escolha OLTP, não um sistema de arquivos ou mecanismo OLAP.
Consultas lentas de business intelligence: otimize a camada analítica ou OLAP em vez do sistema transacional.
Característica única do Parquet entre os formatos listados: armazenamento colunar.
Resumo do tópico
As perguntas de avaliação testam se você pode combinar forma de dados, armazenamento, modelo de banco de dados e carga de trabalho de processamento com um requisito concreto.
23. Revisão final e mapa de memória
Representação: estruturada, semiestruturada, não estruturada e vetorial.
Arquivos: texto delimitado, ,, BLOB, Parquet, Avro e Delta Lake.
Bancos de dados: modelos relacionais mais valores-chave, documentos, famílias de colunas, gráficos e vetores.
Transações: OLTP, e ACID.
Análise: ETL ou ELT em , ou ; modelos semânticos aceleram o consumo.
Plataformas: ,, e ; Bronze, Prata e Ouro organizam a .
Prazo
Definição pronta para exame
Esquema
Regras que definem campos, tipos e organização
BLOB
Binary Large Object interpretado por uma aplicação
OLTP
Processamento operacional rápido de transações ao vivo
OLAP
Análise multidimensional ou semântica otimizada para leitura
Fato
Evento de negócios ou observação mensurável
Dimensão
Contexto usado para fatiar e agrupar medidas
ETL/ELT
Transformação antes do carregamento / transformação após carregamento
em com tabelas confiáveis e semântica de consulta analítica
Resumo do tópico
Para DP-900, sempre conecte o requisito a quatro decisões: representação, armazenamento, padrão de processamento e consumidor.
24. Referências oficiais
Microsoft Learn – Descreva os principais conceitos de dados.
Microsoft Learn - documentação .
Microsoft Learn - documentação .
Microsoft Learn - documentação .
Microsoft Learn - documentação .
Resumo do tópico
Use a documentação oficial para confirmar as capacidades atuais do serviço após dominar os conceitos duráveis deste capítulo.