Conceitos Centrais de Dados: Formatos, Armazenamento e Processamento
Voltar para Learn
DP-900Capítulo 1

Estudo para a Certificação Microsoft DP-900

Conceitos Centrais de Dados: Formatos, Armazenamento e Processamento

Formas de dados, formatos de arquivo, bancos relacionais e NoSQL, OLTP, ACID, análise, lakehouses, Microsoft Fabric, Azure Databricks, Microsoft Purview e Power BI

Tempo de estudo sugerido: 95 minutos • Nível iniciante • Alinhado ao plano de estudos DP-900 e à documentação oficial do Microsoft Learn

Escudo neon de Azure Data Fundamentals cercado por tabelas relacionais, documentos, armazenamento, streaming, bancos de dados e análise

1. Por que os fundamentos dos dados são importantes

Sistemas, aplicações, sensores e dispositivos conectados produzem mais dados a cada ano. A coleta e o armazenamento são mais baratos do que no passado, portanto organizações de todos os tamanhos podem usar informações para melhorar produtos, operações, receitas e decisões de risco. O valor não vem apenas da acumulação: os dados devem ser representados, armazenados, processados e interpretados de forma adequada.

Uma arquitetura sólida começa perguntando o que os dados descrevem, com que rapidez eles mudam, quem os consome e se a carga de trabalho registra eventos ao vivo ou estuda o histórico. Essas questões determinam se um arquivo, banco de dados, mecanismo transacional ou plataforma analítica é a melhor opção.

Resumo do tópico

Os dados tornam-se úteis quando uma organização consegue capturá-los, mantê-los de forma confiável e analisá-los de uma forma adequada à questão do negócio.

2. Entidades, atributos e as quatro formas gerais de dados

Os dados registram fatos, descrições, medições e observações. Os dados comerciais geralmente representam entidades como clientes, produtos, pedidos ou dispositivos. Uma instância de entidade possui atributos: um cliente pode ter um nome, endereço postal, números de telefone e preferências de contato.

Forma de dadosCaracterística principalExemplos típicos
EstruturadoCada instância segue um esquema fixoLinhas de clientes, tabelas de produtos, saldos de contas
SemiestruturadoExiste uma estrutura reconhecível, mas os campos podem variarDocumentos , mensagens , cargas úteis de eventos
Não estruturadoNenhum esquema tabular ou de documento independente de aplicativoImagens, áudio, vídeo, PDFs, documentos binários
Dados vetoriaisEmbeddings numéricos codificam similaridade semânticaTrechos de documentos usados para recuperação em linguagem natural
Quatro formas de dados fluindo para armazenamentos e cargas de trabalho adequados.
Figura 1 - A forma de dados é um dos primeiros sinais utilizados para selecionar armazenamento e processamento.

Resumo do tópico

Identifique primeiro a entidade e seus atributos e, em seguida, determine se a representação é fixa, flexível, livre ou um embedding vetorial.

3. Dados estruturados e esquemas fixos

Os dados estruturados estão em conformidade com um esquema predefinido. Uma representação tabular usa linhas para instâncias de entidade e colunas para atributos. Como cada linha expõe os mesmos campos e tipos de dados compatíveis, os aplicativos podem validar, classificar, unir, agregar e consultar os dados de maneira previsível.

Os dados estruturados são frequentemente armazenados em bancos de dados relacionais, onde as tabelas fazem referência umas às outras por meio de valores-chave. Um esquema fixo melhora a consistência, mas as mudanças no esquema devem ser gerenciadas porque produtores e consumidores dependem da forma acordada.

Resumo do tópico

Dados estruturados trocam flexibilidade por consistência e consultas previsíveis.

4. Dados semiestruturados e

Os dados semiestruturados mantêm a organização sem exigir que cada instância contenha campos idênticos. Um cliente pode ter dois números de telefone, outro apenas um endereço de e-mail e um terceiro um número de apartamento. O documento ainda segue nomes e aninhamentos reconhecíveis, mas elementos opcionais e repetidos são permitidos.

{
  "customerId": 101,
  "name": "Asha",
  "contacts": [
    { "type": "email", "value": "asha@example.com" },
    { "type": "phone", "value": "+1-555-0101" }
  ]
}

JavaScript Object Notation () é uma representação generalizada para este modelo. Os objetos usam colchetes, as coleções usam colchetes e os atributos aparecem como pares nome-valor. também pode representar dados totalmente estruturados; sua principal característica é a capacidade de expressar hierarquia e variação.

Resumo do tópico

As representações semiestruturadas preservam a organização legível por máquina, ao mesmo tempo que permitem que os registros sejam diferentes.

5. Dados não estruturados, BLOBs e embeddings vetoriais

Documentos, imagens, áudio, vídeo e arquivos binários específicos de aplicações não expõem necessariamente um esquema compartilhado que um mecanismo de banco de dados possa interpretar diretamente. Frequentemente, eles são armazenados como objetos binários grandes (BLOBs) e renderizados ou decodificados por uma aplicação.

As soluções de IA criam cada vez mais embeddings vetoriais: matrizes de números que capturam características semânticas de texto, imagens ou outro conteúdo. Um banco de dados vetorial pode comparar esses embeddings por similaridade, permitindo que um assistente recupere passagens relevantes de documentos antes de responder a uma pergunta em linguagem natural. O arquivo original permanece não estruturado mesmo que seu embedding seja uma representação numérica estruturada.

Resumo do tópico

O armazenamento BLOB mantém o conteúdo bruto; o armazenamento vetorial mantém embeddings que tornam a recuperação semântica eficiente.

6. Escolhendo entre armazenamentos de arquivos e bancos de dados

Os armazenamentos de arquivos organizam e recuperam arquivos completos. Os bancos de dados gerenciam registros e expõem recursos de consulta, indexação, integridade e simultaneidade. O limite não é absoluto - um sistema de arquivos é tecnicamente uma forma de armazenamento de dados, e lakehouses modernos adicionam semântica de tabela semelhante a banco de dados sobre arquivos - mas a distinção é útil para decisões de arquitetura.

RequisitoProvável ponto de partida
Trocar dados tabulares legíveis por humanosCSV ou outro arquivo delimitado
Mantenha imagens e vídeos em grande escalaObjeto em nuvem ou armazenamento de blob
Aplicar relacionamentos e transaçõesBanco de dados relacional
Armazenar documentos variáveis Banco de dados de documentos ou armazenamento de arquivos
Analise grandes conjuntos de dados históricos, ou
Recuperar conteúdo por similaridade semânticaBanco de dados vetorial ou índice vetorial

Resumo do tópico

Selecione o armazenamento com base em padrões de acesso, requisitos de integridade, escala, latência e formato de dados - não apenas na extensão do arquivo.

7. Armazenamento de arquivos de discos locais para a nuvem

Os arquivos podem residir em discos pessoais, mídia removível, sistemas de rede compartilhados ou armazenamento em nuvem. As organizações centralizam cada vez mais arquivos importantes em serviços em nuvem para obter capacidade elástica, durabilidade, controles de segurança e armazenamento econômico para grandes volumes.

A seleção do formato depende de quem lê e grava os dados, se as pessoas precisam inspecioná-los e se o armazenamento compacto e o processamento rápido são mais importantes do que a legibilidade. Um formato adequado para troca de dados pode ser ineficiente para análises, enquanto um formato colunar pode ser estranho para um produtor de .

Resumo do tópico

O armazenamento centralizado de arquivos em nuvem melhora a escala e a confiabilidade, enquanto a escolha do formato determina a interoperabilidade e a eficiência do processamento.

8. Texto delimitado e de largura fixa

O texto delimitado separa campos e linhas com caracteres acordados. Valores separados por vírgula (CSV) normalmente usam vírgulas entre campos e quebras de linha entre registros; uma linha de cabeçalho pode nomear as colunas. Valores separados por tabulação (TSV), dados delimitados por espaço e registros de largura fixa são alternativas.

FirstName,LastName,Email
Asha,Patel,asha@example.com
Diego,Ruiz,diego@example.com

Esses formatos são portáteis e legíveis, mas delimitadores de escape, codificação de caracteres, valores nulos, datas e tipos de dados exigem convenções explícitas. Arquivos de largura fixa evitam a ambigüidade do delimitador, mas desperdiçam espaço e são menos adaptáveis a alterações de esquema.

Resumo do tópico

O texto delimitado é excelente para amplo intercâmbio, desde que produtores e consumidores concordem sobre codificação, delimitadores, cabeçalhos e tipos de dados.

9. , e arquivos binários

expressa objetos e coleções aninhados com relativamente pouca sintaxe, tornando-o comum para , configuração e mensagens de eventos. Extensible Markup Language () usa elementos e atributos delimitados por tags. é mais detalhado, mas continua importante em sistemas e padrões empresariais estabelecidos.

<customers>
  <customer id="101">
    <name>Asha Patel</name>
    <email>asha@example.com</email>
  </customer>
</customers>

Os formatos de texto mapeiam bytes para caracteres por meio de codificações como Unicode. Os formatos binários armazenam bytes que um aplicativo deve interpretar, como imagem JPEG, fluxo de áudio, vídeo, arquivo ou documento proprietário. Os profissionais de dados costumam chamar esses arquivos binários de BLOBs.

Comparação de texto delimitado, JSON, XML, BLOB, Parquet, Avro e Delta Lake.
Figura 2 - Formatos de arquivo equilibram legibilidade, flexibilidade, compactação e padrões de processamento.

Resumo do tópico

e descrevem dados hierárquicos; os formatos binários priorizam a representação específica do aplicativo em vez da legibilidade humana.

10. Parquet: armazenamento analítico colunar

Apache Parquet é um formato colunar e um padrão de fato para data lakes modernos. Um arquivo é dividido em grupos de linhas e os valores de cada coluna são armazenados juntos em um grupo. Os descrevem os fragmentos, permitindo que um mecanismo ignore dados irrelevantes e leia apenas as colunas solicitadas.

O layout colunar permite compactação e codificação eficientes, principalmente quando valores adjacentes compartilham características. Parquet também lida com dados aninhados. Ele é otimizado para varreduras analíticas, não para leitura em um editor de texto ou para atualizações frequentes de registros únicos.

Resumo do tópico

Parquet reduz a E/S analítica organizando e compactando dados por coluna.

11.Avro e Delta Lake

Apache Avro é baseado em linhas. Cada arquivo contém um cabeçalho que descreve o esquema em e blocos binários contendo os registros. Manter cada registro unido torna o Avro útil para troca de dados, , serialização compacta e minimização da largura de banda da rede.

Delta Lake é um formato de tabela de código aberto criado em Parquet. Um de transações registra alterações na tabela e adiciona transações ACID, atualizações confiáveis, gerenciamento de esquema, controle de versão e viagens no tempo em arquivos em um . Parquet fornece os arquivos de dados; o Delta fornece histórico de tabela e coordenação transacional.

Resumo do tópico

Avro favorece a troca orientada a linhas; Delta Lake transforma arquivos Parquet em tabelas confiáveis e versionadas.

12. O que um banco de dados adiciona

No trabalho profissional com dados, um banco de dados é um sistema dedicado para armazenar, gerenciar e consultar registros. Além da persistência, ele pode fornecer índices, restrições, controle de simultaneidade, segurança, backup, recuperação e otimização de consultas. Esses recursos distinguem um sistema de gerenciamento de banco de dados de um diretório de arquivos.

Resumo do tópico

Um banco de dados gerencia registros e seu comportamento, não apenas os bytes que os armazenam.

13. Bancos de dados relacionais, chaves, normalização e SQL

Um banco de dados relacional armazena entidades estruturadas em tabelas. Uma chave primária identifica exclusivamente cada linha e uma chave estrangeira faz referência a uma linha em outra tabela. Esses relacionamentos permitem que um pedido identifique seu cliente sem repetir o registro completo do cliente.

A normalização separa entidades relacionadas para reduzir duplicação e atualizar anomalias. Melhora a consistência transacional, embora os esquemas analíticos possam desnormalizar deliberadamente os dados para acelerar as consultas. A linguagem de consulta estruturada (SQL) é baseada nos padrões ANSI, portanto, suas ideias principais são semelhantes em produtos de banco de dados, mesmo quando as implementações adicionam extensões.

Tabelas relacionais comparadas com bancos de dados de valores-chave, documentos, famílias de colunas e gráficos.
Figura 3 - Modelos de banco de dados otimizam diferentes formatos e padrões de acesso.

Resumo do tópico

Bancos de dados relacionais usam tabelas, chaves, restrições, normalização e SQL para preservar relacionamentos estruturados.

14. Quatro modelos não relacionais comuns

Bancos de dados não relacionais não requerem um esquema relacional e geralmente são agrupados sob o termo , embora alguns ofereçam linguagens de consulta semelhantes a SQL. Eles são selecionados para esquemas flexíveis, distribuição, relacionamentos especializados ou escala muito alta.

ModeloRepresentaçãoBom ajuste
Valor-chaveUma chave exclusiva é mapeada para um valor arbitrárioSessões, , perfis, pesquisas rápidas
DocumentoO valor é um documento consultávelCatálogos e entidades com atributos variáveis
Família de colunasAs linhas contêm grupos de colunas relacionadosGrandes conjuntos de dados esparsos e cargas de trabalho distribuídas
GráficoEntidades são nós e relacionamentos são arestasCaminhos de fraude, relações sociais, recomendações

Resumo do tópico

é uma família de modelos; combinar valor-chave, documento, família de colunas ou armazenamento de gráfico com o padrão de consulta dominante.

15. Processamento transacional, OLTP e

Uma transação é um evento comercial pequeno e discreto, como o pagamento de um pedido ou a transferência de dinheiro. Os sistemas de processamento de transações on-line (OLTP) oferecem suporte a aplicativos de linha de negócios em tempo real e podem lidar com milhões de eventos, mantendo os dados disponíveis com baixa latência.

Os bancos de dados OLTP são otimizados para leituras e gravações. Os aplicativos criam, recuperam, atualizam e excluem registros – as operações – enquanto o banco de dados protege a integridade sob atividades simultâneas. Os esquemas costumam ser normalizados para que cada transação atinja um pequeno número de registros precisos.

Resumo do tópico

OLTP registra eventos de negócios atuais por meio de leituras e gravações rápidas e confiáveis.

16. Garantias de transação ACID

Considere transferir US$ 40 da conta A, inicialmente US$ 100, para a conta B, inicialmente US$ 50. O resultado correto é US$ 60 e US$ 90, e nenhum observador deverá ver uma transferência parcial permanente.

PropriedadeGarantia na transferência
AtomicidadeDébito e crédito são bem-sucedidos juntos ou ambos são revertidos
ConsistênciaAs regras permanecem verdadeiras e o saldo total permanece em US$ 150
IsolamentoLeitores simultâneos não combinam valores antes e depois
DurabilidadeApós o commit, os novos saldos sobrevivem a uma reinicialização
Transferência bancária ilustrando atomicidade, consistência, isolamento e durabilidade.
Figura 4 - ACID evita estados de transação parciais, inválidos, mistos ou perdidos.

Resumo do tópico

ACID torna uma transação indivisível, válida, isolada de interferência e permanente após confirmação.

17. Processamento analítico, ETL e ELT

Os sistemas analíticos são principalmente de leitura e armazenam dados históricos ou métricas de negócios. Eles podem analisar um único instantâneo ou uma série temporal de instantâneos. Os dados operacionais são comumente extraídos, transformados e carregados (ETL), ou extraídos e carregados antes da aplicação das transformações (ELT), um padrão comum em lakehouses modernos.

  1. Ingerir arquivos operacionais, eventos e registros de banco de dados.
  2. Limpe, padronize, junte e enriqueça os dados antes ou depois do carregamento.
  3. Organize os dados em tabelas ou warehouse.
  4. Construir agregações e definições semânticas.
  5. Forneça relatórios, visualizações, painéis, ciência de dados e cargas de trabalho de IA.
Fontes operacionais que passam por ETL ou ELT para data lake, lakehouse, data warehouse, modelo semântico e relatórios.
Figura 5 – Analytics separa a captura operacional da análise histórica.

Resumo do tópico

Transformações ETL antes do carregamento; ELT carrega primeiro e usa a plataforma de destino para transformação.

18. , e

LojaCaracterística centralUso típico
escalonável baseado em arquivos para dados brutos e selecionadosExploração, ciência de dados, formatos diversos
Esquema relacional e mecanismo SQL otimizado para leiturasRelatórios governados e inteligência de negócios
Flexibilidade do lago, além de tabelas confiáveis e semântica de consulta relacionalEngenharia, análise e IA unificadas

Os esquemas analíticos geralmente desnormalizam os dados das fontes OLTP. Algumas duplicações podem reduzir junções e melhorar o desempenho de leitura. Esta é uma compensação deliberada: os modelos transacionais otimizam as atualizações e a integridade, enquanto os modelos analíticos otimizam amplas varreduras, agregações e relatórios.

Resumo do tópico

Lakes priorizam arquivos flexíveis, warehouses priorizam análises relacionais e lakehouses combinam ambas as abordagens.

19. OLAP, modelos semânticos, fatos, dimensões e usuários

Um modelo de Processamento Analítico Online (OLAP) - agora comumente chamado de modelo semântico e historicamente chamado de cubo - armazena ou define agregações para análise rápida. As medidas numéricas das tabelas de fatos são avaliadas em tabelas de dimensões, como data, cliente, produto e geografia. As hierarquias permitem o detalhamento de região para cidade para abordar e o detalhamento na direção oposta.

Os modelos semânticos são um exemplo comum. Os cientistas de dados podem explorar arquivos diretamente em um lago, os analistas de dados podem consultar tabelas de warehouse e criar visualizações, e os usuários corporativos normalmente consomem métricas selecionadas por meio de relatórios e painéis.

Resumo do tópico

Os modelos semânticos traduzem os dados armazenados em medidas, dimensões, hierarquias e análises prontas para negócios consistentes.

20. Plataformas modernas e arquitetura medalhão

é uma plataforma analítica unificada que traz armazenamento, engenharia de dados, armazenamento, ciência de dados, recursos em tempo real e relatórios em um ambiente compartilhado. suporta engenharia de dados e ciência de dados em grande escala e usa Delta Lake como formato de tabela padrão. fornece segurança de dados unificada, governança e conformidade entre fontes. fornece modelagem semântica, visualização e experiências de business intelligence.

Uma arquitetura medalhão cria limites de qualidade explícitos. Bronze retém registros de origem bruta para rastreabilidade e reprocessamento. Silver contém dados limpos e conformados com duplicatas removidas e tipos padronizados. Gold contém modelos agregados e prontos para negócios para relatórios e análises. e também fornecem experiências Copilot para exploração de linguagem natural.

Camadas de dados Bronze, Silver e Gold conectadas a Microsoft Fabric, Azure Databricks, Microsoft Purview e Power BI.
Figura 6 – Plataformas modernas aplicam engenharia, governança e consumo em torno de camadas medalhões de qualidade.

Resumo do tópico

e processam análises, governa os dados, entrega insights de negócio e as camadas medalhão tornam explícita a progressão da qualidade.

21. Cenário de varejo integrado

Um varejista registra pedidos e alterações de estoque em um banco de dados relacional normalizado OLTP. As imagens do produto são mantidas no armazenamento de blobs, atributos de catálogo flexíveis em documentos e eventos de aplicativo em Avro. A plataforma analítica ingere essas fontes em Bronze, padroniza clientes e produtos em Prata e publica medidas de vendas e estoque em Ouro.

Parquet e Delta Lake suportam tabelas eficientes. Um modelo semântico define receita, margem, unidades, datas, lojas e produtos para . Os cientistas de dados podem usar arquivos para previsões, enquanto os usuários corporativos visualizam painéis. ajuda a descobrir, classificar, proteger e governar as fontes participantes.

Resumo do tópico

Soluções reais combinam modelos de armazenamento: OLTP para eventos atuais, armazenamento de objetos para arquivos, dados de documentos para flexibilidade e uma plataforma analítica governada para tendências.

22. Avaliação do módulo com explicações

  1. Recuperação de linguagem natural sobre documentos: escolha um banco de dados vetorial porque ele pesquisa embeddings por similaridade semântica.
  2. Imagens e vídeos grandes: escolha o armazenamento de blob em vez de um banco de dados relacional ou de família de colunas.
  3. Leituras e gravações transacionais de alto volume: escolha um banco de dados relacional OLTP quando os relacionamentos e a integridade do ACID forem centrais.
  4. Vantagem Parquet: o armazenamento colunar permite compactação, codificação e leituras seletivas eficientes.
  5. Fluxo de trabalho de varejo: use OLTP para transações ao vivo e OLAP ou um modelo semântico para análise de tendências.
  6. Distinção chave-valor: cada registro é recuperado por uma chave única associada a um valor arbitrário.
  7. Estoque e transações de clientes: escolha OLTP, não um sistema de arquivos ou mecanismo OLAP.
  8. Consultas lentas de business intelligence: otimize a camada analítica ou OLAP em vez do sistema transacional.
  9. Característica única do Parquet entre os formatos listados: armazenamento colunar.

Resumo do tópico

As perguntas de avaliação testam se você pode combinar forma de dados, armazenamento, modelo de banco de dados e carga de trabalho de processamento com um requisito concreto.

23. Revisão final e mapa de memória

  • Representação: estruturada, semiestruturada, não estruturada e vetorial.
  • Arquivos: texto delimitado, , , BLOB, Parquet, Avro e Delta Lake.
  • Bancos de dados: modelos relacionais mais valores-chave, documentos, famílias de colunas, gráficos e vetores.
  • Transações: OLTP, e ACID.
  • Análise: ETL ou ELT em , ou ; modelos semânticos aceleram o consumo.
  • Plataformas: , , e ; Bronze, Prata e Ouro organizam a .
PrazoDefinição pronta para exame
EsquemaRegras que definem campos, tipos e organização
BLOBBinary Large Object interpretado por uma aplicação
OLTPProcessamento operacional rápido de transações ao vivo
OLAPAnálise multidimensional ou semântica otimizada para leitura
FatoEvento de negócios ou observação mensurável
DimensãoContexto usado para fatiar e agrupar medidas
ETL/ELTTransformação antes do carregamento / transformação após carregamento
em com tabelas confiáveis e semântica de consulta analítica

Resumo do tópico

Para DP-900, sempre conecte o requisito a quatro decisões: representação, armazenamento, padrão de processamento e consumidor.

24. Referências oficiais

  • Microsoft Learn – Descreva os principais conceitos de dados.
  • Microsoft Learn - documentação .
  • Microsoft Learn - documentação .
  • Microsoft Learn - documentação .
  • Microsoft Learn - documentação .

Resumo do tópico

Use a documentação oficial para confirmar as capacidades atuais do serviço após dominar os conceitos duráveis deste capítulo.