Preparación para la Certificación Microsoft DP-900
Conceptos Fundamentales de Datos: Formatos, Almacenamiento y Procesamiento
Formas de datos, formatos de archivo, bases relacionales y NoSQL, OLTP, ACID, análisis, lakehouses, Microsoft Fabric, Azure Databricks, Microsoft Purview y Power BI
Tiempo de estudio sugerido: 95 minutos • Nivel principiante • Alineado con la guía de estudio DP-900 y la documentación oficial de Microsoft Learn
Por João Ricardo Dutra••Material completo
1. Por qué son importantes los fundamentos de los datos
Los sistemas, aplicaciones, sensores y dispositivos conectados producen más datos cada año. La recopilación y el almacenamiento son menos costosos que en el pasado, por lo que las organizaciones de todos los tamaños pueden utilizar la información para mejorar los productos, las operaciones, los ingresos y las decisiones sobre riesgos. El valor no proviene únicamente de la acumulación: los datos deben representarse, almacenarse, procesarse e interpretarse de manera adecuada.
Una arquitectura sólida comienza preguntando qué describen los datos, qué tan rápido cambian, quién los consume y si la carga de trabajo registra eventos en vivo o estudia el historial. Estas preguntas determinan si un archivo, una base de datos, un motor transaccional o una plataforma analítica es la mejor opción.
Resumen del tema
Los datos se vuelven útiles cuando una organización puede capturarlos, conservarlos de manera confiable y analizarlos en una forma adecuada a la cuestión comercial.
2. Entidades, atributos y las cuatro formas generales de datos
Los datos registran hechos, descripciones, mediciones y observaciones. Los datos comerciales suelen representar entidades como clientes, productos, pedidos o dispositivos. Una instancia de entidad tiene atributos: un cliente puede tener un nombre, dirección postal, números de teléfono y preferencias de contacto.
Forma de datos
Característica principal
Ejemplos típicos
Estructurado
Cada instancia sigue un esquema fijo
Filas de clientes, tablas de productos, saldos de cuentas
Semiestructurado
Existe una estructura reconocible, pero los campos pueden variar
Documentos , mensajes , cargas útiles de eventos
No estructurado
No hay esquema tabular o de documento independiente de la aplicación
Imágenes, audio, vídeo, PDF, documentos binarios
Datos vectoriales
Las inserciones vectoriales numéricas codifican similitud semántica
Fragmentos de documentos utilizados para la recuperación en lenguaje natural
Figura 1: La forma de los datos es una de las primeras señales utilizadas para seleccionar el almacenamiento y el procesamiento.
Resumen del tema
Primero identifique la entidad y sus atributos; después determine si la representación es fija, flexible, libre o un embedding vectorial.
3. Datos estructurados y esquemas fijos
Los datos estructurados se ajustan a un esquema predefinido. Una representación tabular utiliza filas para instancias de entidades y columnas para atributos. Debido a que cada fila expone los mismos campos y tipos de datos compatibles, las aplicaciones pueden validar, ordenar, unir, agregar y consultar los datos de manera predecible.
Los datos estructurados se almacenan con frecuencia en bases de datos relacionales, donde las tablas hacen referencia entre sí a través de valores clave. Un esquema fijo mejora la coherencia, pero los cambios de esquema deben gestionarse porque los productores y consumidores dependen de la forma acordada.
Resumen del tema
Los datos estructurados intercambian flexibilidad por coherencia y consultas predecibles.
4. Datos semiestructurados y
Los datos semiestructurados conservan la organización sin requerir que cada instancia contenga campos idénticos. Un cliente puede tener dos números de teléfono, otro sólo una dirección de correo electrónico y un tercero el número de apartamento. El documento todavía sigue nombres y anidamientos reconocibles, pero se permiten elementos opcionales y repetidos.
JavaScript Object Notation () es una representación generalizada de este modelo. Los objetos usan llaves, las colecciones usan llaves y los atributos aparecen como pares nombre-valor. también puede representar datos completamente estructurados; su característica clave es la capacidad de expresar jerarquía y variación.
Resumen del tema
Las representaciones semiestructuradas preservan la organización legible por máquina al tiempo que permiten que los registros difieran.
5. Datos no estructurados, BLOB e inserciones vectoriales de vectores
Los documentos, imágenes, audio, video y archivos binarios específicos de aplicaciones no necesariamente exponen un esquema compartido que un motor de base de datos pueda interpretar directamente. A menudo se almacenan como Binary Large Object (BLOB) y una aplicación los procesa o decodifica.
Las soluciones de inteligencia artificial crean cada vez más embeddings vectoriales: matrices de números que capturan características semánticas de texto, imágenes u otro contenido. Una base de datos vectorial puede comparar estos embeddings por similitud, lo que permite a un asistente recuperar pasajes relevantes antes de responder una pregunta en lenguaje natural. El archivo original permanece sin estructura aunque su embedding sea una representación numérica estructurada.
Resumen del tema
El almacenamiento BLOB conserva el contenido sin procesar; el almacenamiento vectorial mantiene embeddings que hacen eficiente la recuperación semántica.
6. Elegir entre almacenes de archivos y bases de datos
Los almacenes de archivos organizan y recuperan archivos completos. Las bases de datos administran registros y exponen capacidades de consulta, indexación, integridad y concurrencia. El límite no es absoluto: un sistema de archivos es técnicamente una forma de almacén de datos, y los lakehouses modernos agregan una semántica de tablas similar a una base de datos sobre los archivos, pero la distinción es útil para las decisiones de arquitectura.
Requisito
Punto de partida probable
Intercambiar datos tabulares legibles por humanos
CSV u otro archivo delimitado
Mantenga imágenes y videos a gran escala
Almacenamiento de objetos o blobs en la nube
Hacer cumplir las relaciones y transacciones
Base de datos relacional
Almacenar documentos variables
Base de datos de documentos o almacenamiento de archivos
Analizar grandes conjuntos de datos históricos
, almacén o lago
Recuperar contenido por similitud semántica
Base de datos de vectores o índice de vectores
Resumen del tema
Seleccione el almacenamiento a partir de patrones de acceso, requisitos de integridad, escala, latencia y forma de datos, no solo desde la extensión del archivo.
7. Almacenamiento de archivos desde discos locales a la nube
Los archivos pueden vivir en discos personales, medios extraíbles, sistemas de red compartidos o almacenamiento en la nube. Las organizaciones centralizan cada vez más archivos importantes en servicios en la nube para obtener capacidad elástica, durabilidad, controles de seguridad y almacenamiento rentable para grandes volúmenes.
La selección del formato depende de quién lee y escribe los datos, si las personas necesitan inspeccionarlos y si el almacenamiento compacto y el procesamiento rápido son más importantes que la legibilidad. Un formato adecuado para el intercambio de datos puede resultar ineficaz para el análisis, mientras que un formato en columnas puede resultar incómodo para un productor de .
Resumen del tema
El almacenamiento centralizado de archivos en la nube mejora la escala y la confiabilidad, mientras que la elección del formato determina la interoperabilidad y la eficiencia del procesamiento.
8. Texto delimitado y de ancho fijo
El texto delimitado separa campos y filas con caracteres acordados. Los valores separados por comas (CSV) suelen utilizar comas entre campos y saltos de línea entre registros; una fila de encabezado puede nombrar las columnas. Las alternativas son valores separados por tabulaciones (TSV), datos delimitados por espacios y registros de ancho fijo.
Estos formatos son portátiles y legibles, pero los delimitadores de escape, la codificación de caracteres, los valores nulos, las fechas y los tipos de datos requieren convenciones explícitas. Los archivos de ancho fijo evitan la ambigüedad del delimitador pero desperdician espacio y son menos adaptables a los cambios de esquema.
Resumen del tema
El texto delimitado es excelente para un intercambio amplio, siempre que los productores y consumidores acuerden la codificación, los delimitadores, los encabezados y los tipos de datos.
9. , y archivos binarios
expresa colecciones y objetos anidados con relativamente poca sintaxis, lo que lo hace común para , configuración y mensajes de eventos. Extensible Markup Language () utiliza elementos y atributos encerrados por etiquetas. es más detallado pero sigue siendo importante en los sistemas y estándares empresariales establecidos.
Los formatos de texto asignan bytes a caracteres mediante codificaciones como Unicode. Los formatos binarios almacenan bytes que una aplicación debe interpretar, como una imagen JPEG, una secuencia de audio, un vídeo, un archivo o un documento propietario. Los profesionales de datos suelen llamar a estos archivos binarios BLOB.
Figura 2: Los formatos de archivo equilibran la legibilidad, la flexibilidad, la compresión y los patrones de procesamiento.
Resumen del tema
y describen datos jerárquicos; Los formatos binarios priorizan la representación específica de la aplicación en lugar de la legibilidad humana.
10. Parquet: almacenamiento de análisis en columnas
Apache Parquet es un formato columnar y un estándar de facto para los lakehouses modernos. Un archivo se divide en grupos de filas y los valores de cada columna se almacenan juntos dentro de un grupo. Los describen los fragmentos, lo que permite que un motor omita datos irrelevantes y lea solo las columnas solicitadas.
El diseño en columnas permite una compresión y codificación eficientes, particularmente cuando los valores adyacentes comparten características. Parquet también maneja datos anidados. Está optimizado para escaneos analíticos, no para que la gente lo lea en un editor de texto o para actualizaciones frecuentes de un solo registro.
Resumen del tema
Parquet reduce la E/S analítica organizando y comprimiendo datos por columna.
11. Avro y Delta Lake
Apache Avro se basa en filas. Cada archivo contiene un encabezado que describe el esquema en y bloques binarios que contienen los registros. Mantener cada registro junto hace que Avro sea útil para el intercambio de datos, la transmisión por secuencias, la serialización compacta y la minimización del ancho de banda de la red.
Delta Lake es un formato de tabla de código abierto creado sobre Parquet. Una tabla de registros de transacciones registra cambios y agrega transacciones ACID, actualizaciones confiables, administración de esquemas, control de versiones y viajes en el tiempo sobre archivos en un . Parquet proporciona los archivos de datos; el registro Delta proporciona historial de tablas y coordinación transaccional.
Resumen del tema
Avro favorece el intercambio orientado a filas; Delta Lake convierte los archivos Parquet en tablas versionadas y confiables.
12. Qué aporta una base de datos
En el trabajo de datos profesional, una base de datos es un sistema dedicado para almacenar, administrar y consultar registros. Más allá de la persistencia, puede proporcionar índices, restricciones, control de concurrencia, seguridad, respaldo, recuperación y optimización de consultas. Estas capacidades distinguen un sistema de gestión de bases de datos de un directorio de archivos.
Resumen del tema
Una base de datos gestiona los registros y su comportamiento, no sólo los bytes que los almacenan.
13. Bases de datos relacionales, claves, normalización y SQL
Una base de datos relacional almacena entidades estructuradas en tablas. Una clave principal identifica de forma única cada fila y una clave externa hace referencia a una fila de otra tabla. Estas relaciones permiten que un pedido identifique a su cliente sin repetir el registro completo del cliente.
La normalización separa entidades relacionadas para reducir la duplicación y actualizar anomalías. Mejora la coherencia transaccional, aunque los esquemas analíticos pueden desnormalizar deliberadamente los datos para acelerar las consultas. El lenguaje de consulta estructurado (SQL) se basa en los estándares ANSI, por lo que sus ideas centrales son similares en todos los productos de bases de datos, incluso cuando las implementaciones agregan extensiones.
Figura 3 - Los modelos de bases de datos optimizan diferentes formas y patrones de acceso.
Resumen del tema
Las bases de datos relacionales utilizan tablas, claves, restricciones, normalización y SQL para preservar las relaciones estructuradas.
14. Cuatro modelos no relacionales comunes
Las bases de datos no relacionales no requieren un esquema relacional y a menudo se agrupan bajo el término , aunque algunas ofrecen lenguajes de consulta similares a SQL. Se seleccionan por esquemas flexibles, distribución, relaciones especializadas o escala muy alta.
Modelo
Representación
Buen ajuste
Valor clave
Una clave única se asigna a un valor arbitrario
Sesiones, almacenamiento en caché, perfiles, búsquedas rápidas
Documento
El valor es un documento consultable
Catálogos y entidades con atributos variables
Familia de columnas
Las filas contienen grupos de columnas relacionados
Grandes conjuntos de datos dispersos y cargas de trabajo distribuidas
Gráfico
Las entidades son nodos y las relaciones son aristas
Rutas de fraude, relaciones sociales, recomendaciones.
Resumen del tema
es una familia de modelos; haga coincidir el almacenamiento de clave-valor, documento, familia de columnas o gráficos con el patrón de consulta dominante.
15. Procesamiento transaccional, OLTP y
Una transacción es un evento comercial pequeño y discreto, como pagar un pedido o transferir dinero. Los sistemas de procesamiento de transacciones en línea (OLTP) admiten aplicaciones de línea de negocios en vivo y pueden manejar millones de eventos mientras mantienen los datos disponibles con baja latencia.
Las bases de datos OLTP están optimizadas tanto para lectura como para escritura. Las aplicaciones crean, recuperan, actualizan y eliminan registros (las operaciones ) mientras que la base de datos protege la integridad bajo actividad concurrente. Los esquemas a menudo están normalizados para que cada transacción toque una pequeña cantidad de registros precisos.
Resumen del tema
OLTP registra eventos comerciales actuales mediante lecturas y escrituras rápidas y confiables.
16. Garantías de transacciones ACID
Considere transferir $40 de la cuenta A, inicialmente $100, a la cuenta B, inicialmente $50. El resultado correcto es $60 y $90, y ningún observador debería ver una transferencia parcial permanente.
Propiedad
Garantía en el traslado
Atomicidad
El débito y el crédito se realizan juntos o ambos se revierten
Consistencia
Las reglas siguen siendo válidas y el saldo total permanece en $150
Aislamiento
Los lectores simultáneos no combinan valores de antes y después
Durabilidad
Después de la confirmación, los nuevos saldos sobreviven a un reinicio
Figura 4: ACID evita estados de transacciones parciales, no válidas, mixtas o perdidas.
Resumen del tema
ACID hace que una transacción sea indivisible, válida, aislada de interferencias y permanente después de la confirmación.
17. Procesamiento analítico, ETL y ELT
Los sistemas analíticos son principalmente de lectura y contienen datos históricos o métricas de negocio. Pueden analizar una sola instantánea o una serie temporal de instantáneas. Los datos operativos suelen extraerse, transformarse y cargarse (ETL), o extraerse y cargarse antes de aplicar las transformaciones (ELT), un patrón común en los lakehouses modernos.
Ingerir archivos operativos, eventos y registros de bases de datos.
Limpiar, estandarizar, unir y enriquecer los datos antes o después de la carga.
Organice los datos en tablas de lago o almacén.
Construir agregaciones y definiciones semánticas.
Entregue informes, visualizaciones, paneles, ciencia de datos y cargas de trabajo de IA.
Figura 5: Analytics separa la captura operativa del análisis histórico.
Resumen del tema
ETL se transforma antes de cargar; ELT se carga primero y utiliza la plataforma de destino para la transformación.
18. , almacén y
Tienda
Característica principal
Uso típico
Almacenamiento escalable basado en archivos para datos sin procesar y seleccionados
Exploración, ciencia de datos, diversos formatos.
Almacén de datos
Esquema relacional y motor SQL optimizados para lecturas
Informes gobernados e inteligencia empresarial
La de datos
Flexibilidad del lago más tablas confiables y semántica de consultas relacionales
Ingeniería, análisis e inteligencia artificial unificados
Los esquemas analíticos a menudo desnormalizan los datos de las fuentes OLTP. Algunas duplicaciones pueden reducir las uniones y mejorar el rendimiento de lectura. Se trata de una compensación deliberada: los modelos transaccionales optimizan las actualizaciones y la integridad, mientras que los modelos analíticos optimizan análisis, agregaciones e informes amplios.
Resumen del tema
Los lagos priorizan los archivos flexibles, los almacenes priorizan el análisis relacional y los lakehouses combinan ambos enfoques.
19. OLAP, modelos semánticos, hechos, dimensiones y usuarios
Un modelo de procesamiento analítico en línea (OLAP), ahora comúnmente llamado modelo semántico e históricamente llamado cubo, almacena o define agregaciones para un análisis rápido. Las medidas numéricas de las tablas de hechos se evalúan en tablas de dimensiones como fecha, cliente, producto y geografía. Las jerarquías permiten profundizar de región a ciudad para abordar y profundizar en la dirección opuesta.
Los modelos semánticos son un ejemplo común. Los científicos de datos pueden explorar archivos directamente en un lago, los analistas de datos pueden consultar tablas de almacén y crear visualizaciones, y los usuarios empresariales suelen consumir métricas seleccionadas a través de informes y paneles.
Resumen del tema
Los modelos semánticos traducen los datos almacenados en medidas, dimensiones, jerarquías y análisis consistentes listos para el negocio.
20. Plataformas modernas y la arquitectura del medallón.
es una plataforma de análisis unificada que ofrece almacenamiento, ingeniería de datos, almacenamiento, ciencia de datos, capacidades en tiempo real e informes en un entorno compartido. admite ingeniería y ciencia de datos a gran escala y utiliza Delta Lake como formato de tabla estándar. proporciona seguridad, gobernanza y cumplimiento de datos unificados en todas las fuentes. proporciona experiencias de modelado semántico, visualización e inteligencia empresarial.
Una arquitectura medallón crea límites de calidad explícitos. Bronze conserva registros de fuentes sin procesar para su trazabilidad y reprocesamiento. Silver contiene datos limpios y conformados, con duplicados eliminados y tipos estandarizados. Gold contiene modelos agregados y listos para el negocio para informes y análisis. y también brindan experiencias Copilot para la exploración del lenguaje natural.
Figura 6: Las plataformas modernas aplican ingeniería, gobernanza y consumo en torno a capas de calidad medallón.
Resumen del tema
Análisis de procesos de Fabric y Databricks, Purview gobierna los datos, brinda información empresarial y las capas de medallón hacen explícita la progresión de la calidad.
21. Escenario minorista integrado
Un minorista registra pedidos y cambios de inventario en una base de datos relacional normalizada OLTP. Las imágenes de productos se guardan en el almacenamiento de blobs, los atributos de catálogo flexibles en documentos y los eventos de aplicaciones en Avro. La plataforma analítica incorpora estas fuentes en Bronze, estandariza clientes y productos en Silver y publica medidas de ventas e inventario en Gold.
Parquet y Delta Lake admiten mesas de lago eficientes. Un modelo semántico define ingresos, margen, unidades, fechas, tiendas y productos para . Los científicos de datos pueden utilizar archivos para realizar pronósticos, mientras que los usuarios empresariales ven paneles. ayuda a descubrir, clasificar, proteger y gobernar las fuentes participantes.
Resumen del tema
Las soluciones reales combinan modelos de almacenamiento: OLTP para eventos actuales, almacenamiento de objetos para archivos, datos de documentos para mayor flexibilidad y una plataforma analítica gobernada para tendencias.
22. Evaluación del módulo con explicaciones.
Recuperación de documentos en lenguaje natural: elija una base de datos vectorial porque busca inserciones vectoriales por similitud semántica.
Imágenes y vídeos de gran tamaño: elija el almacenamiento de blobs en lugar de una base de datos relacional o de familia de columnas.
Lecturas y escrituras transaccionales de gran volumen: elija una base de datos relacional OLTP cuando las relaciones y la integridad de ACID sean fundamentales.
Ventaja de Parquet: el almacenamiento en columnas permite una compresión, codificación y lecturas selectivas eficientes.
Flujo de trabajo minorista: use OLTP para transacciones en vivo y OLAP o un modelo semántico para análisis de tendencias.
Distinción clave-valor: cada registro se recupera mediante una clave única asociada con un valor arbitrario.
Transacciones de inventario y clientes: elija OLTP, no un sistema de archivos ni un motor OLAP.
Consultas lentas de inteligencia empresarial: optimice la capa analítica o OLAP en lugar del sistema transaccional.
Rasgo único de Parquet entre los formatos enumerados: almacenamiento en columnas.
Resumen del tema
Las preguntas de evaluación comprueban si puede relacionar la forma de los datos, el almacén, el modelo de base de datos y la carga de procesamiento con un requisito concreto.
23. Revisión final y mapa de memoria.
Representación: estructurada, semiestructurada, no estructurada y vectorial.
Archivos: texto delimitado, ,, BLOB, Parquet, Avro y Delta Lake.
Bases de datos: modelos relacionales más clave-valor, de documentos, de familia de columnas, de gráficos y vectoriales.
Transacciones: OLTP, y ACID.
Análisis: ETL o ELT en lago, almacén o ; Los modelos semánticos aceleran el consumo.
Plataformas: ,, y ; Bronce, Plata y Oro organizan la calidad de los datos.
Plazo
Definición lista para el examen
Esquema
Reglas que definen campos, tipos y organización
BLOB
Binary Large Object interpretado por una aplicación
OLTP
Procesamiento operativo rápido de transacciones en vivo
OLAP
Análisis multidimensional o semántico optimizado para lectura
Hecho
Evento empresarial u observación medible
Dimensión
Contexto utilizado para dividir y agrupar medidas
ETL / ELT
Transformar antes de cargar / transformar después de cargar
La
Almacenamiento en con tablas confiables y semántica de consultas analíticas
Resumen del tema
Para DP-900, conecte siempre el requisito a cuatro decisiones: representación, almacenamiento, patrón de procesamiento y consumidor.
24. Referencias oficiales
Microsoft Learn: describe conceptos básicos de datos.
Microsoft Learn: documentación de .
Microsoft Learn: documentación de .
Microsoft Learn: documentación de .
Microsoft Learn: documentación de .
Resumen del tema
Utilice la documentación oficial para confirmar las capacidades actuales del servicio después de dominar los conceptos duraderos de este capítulo.