Conceptos Fundamentales de Datos: Formatos, Almacenamiento y Procesamiento
Volver a Learn
DP-900Capítulo 1

Preparación para la Certificación Microsoft DP-900

Conceptos Fundamentales de Datos: Formatos, Almacenamiento y Procesamiento

Formas de datos, formatos de archivo, bases relacionales y NoSQL, OLTP, ACID, análisis, lakehouses, Microsoft Fabric, Azure Databricks, Microsoft Purview y Power BI

Tiempo de estudio sugerido: 95 minutos • Nivel principiante • Alineado con la guía de estudio DP-900 y la documentación oficial de Microsoft Learn

Escudo neón de Azure Data Fundamentals rodeado de tablas relacionales, documentos, almacenamiento, streaming, bases de datos y análisis

1. Por qué son importantes los fundamentos de los datos

Los sistemas, aplicaciones, sensores y dispositivos conectados producen más datos cada año. La recopilación y el almacenamiento son menos costosos que en el pasado, por lo que las organizaciones de todos los tamaños pueden utilizar la información para mejorar los productos, las operaciones, los ingresos y las decisiones sobre riesgos. El valor no proviene únicamente de la acumulación: los datos deben representarse, almacenarse, procesarse e interpretarse de manera adecuada.

Una arquitectura sólida comienza preguntando qué describen los datos, qué tan rápido cambian, quién los consume y si la carga de trabajo registra eventos en vivo o estudia el historial. Estas preguntas determinan si un archivo, una base de datos, un motor transaccional o una plataforma analítica es la mejor opción.

Resumen del tema

Los datos se vuelven útiles cuando una organización puede capturarlos, conservarlos de manera confiable y analizarlos en una forma adecuada a la cuestión comercial.

2. Entidades, atributos y las cuatro formas generales de datos

Los datos registran hechos, descripciones, mediciones y observaciones. Los datos comerciales suelen representar entidades como clientes, productos, pedidos o dispositivos. Una instancia de entidad tiene atributos: un cliente puede tener un nombre, dirección postal, números de teléfono y preferencias de contacto.

Forma de datosCaracterística principalEjemplos típicos
EstructuradoCada instancia sigue un esquema fijoFilas de clientes, tablas de productos, saldos de cuentas
SemiestructuradoExiste una estructura reconocible, pero los campos pueden variarDocumentos , mensajes , cargas útiles de eventos
No estructuradoNo hay esquema tabular o de documento independiente de la aplicaciónImágenes, audio, vídeo, PDF, documentos binarios
Datos vectorialesLas inserciones vectoriales numéricas codifican similitud semánticaFragmentos de documentos utilizados para la recuperación en lenguaje natural
Cuatro formas de datos que fluyen hacia almacenes y cargas de trabajo adecuados.
Figura 1: La forma de los datos es una de las primeras señales utilizadas para seleccionar el almacenamiento y el procesamiento.

Resumen del tema

Primero identifique la entidad y sus atributos; después determine si la representación es fija, flexible, libre o un embedding vectorial.

3. Datos estructurados y esquemas fijos

Los datos estructurados se ajustan a un esquema predefinido. Una representación tabular utiliza filas para instancias de entidades y columnas para atributos. Debido a que cada fila expone los mismos campos y tipos de datos compatibles, las aplicaciones pueden validar, ordenar, unir, agregar y consultar los datos de manera predecible.

Los datos estructurados se almacenan con frecuencia en bases de datos relacionales, donde las tablas hacen referencia entre sí a través de valores clave. Un esquema fijo mejora la coherencia, pero los cambios de esquema deben gestionarse porque los productores y consumidores dependen de la forma acordada.

Resumen del tema

Los datos estructurados intercambian flexibilidad por coherencia y consultas predecibles.

4. Datos semiestructurados y

Los datos semiestructurados conservan la organización sin requerir que cada instancia contenga campos idénticos. Un cliente puede tener dos números de teléfono, otro sólo una dirección de correo electrónico y un tercero el número de apartamento. El documento todavía sigue nombres y anidamientos reconocibles, pero se permiten elementos opcionales y repetidos.

{
  "customerId": 101,
  "name": "Asha",
  "contacts": [
    { "type": "email", "value": "asha@example.com" },
    { "type": "phone", "value": "+1-555-0101" }
  ]
}

JavaScript Object Notation () es una representación generalizada de este modelo. Los objetos usan llaves, las colecciones usan llaves y los atributos aparecen como pares nombre-valor. también puede representar datos completamente estructurados; su característica clave es la capacidad de expresar jerarquía y variación.

Resumen del tema

Las representaciones semiestructuradas preservan la organización legible por máquina al tiempo que permiten que los registros difieran.

5. Datos no estructurados, BLOB e inserciones vectoriales de vectores

Los documentos, imágenes, audio, video y archivos binarios específicos de aplicaciones no necesariamente exponen un esquema compartido que un motor de base de datos pueda interpretar directamente. A menudo se almacenan como Binary Large Object (BLOB) y una aplicación los procesa o decodifica.

Las soluciones de inteligencia artificial crean cada vez más embeddings vectoriales: matrices de números que capturan características semánticas de texto, imágenes u otro contenido. Una base de datos vectorial puede comparar estos embeddings por similitud, lo que permite a un asistente recuperar pasajes relevantes antes de responder una pregunta en lenguaje natural. El archivo original permanece sin estructura aunque su embedding sea una representación numérica estructurada.

Resumen del tema

El almacenamiento BLOB conserva el contenido sin procesar; el almacenamiento vectorial mantiene embeddings que hacen eficiente la recuperación semántica.

6. Elegir entre almacenes de archivos y bases de datos

Los almacenes de archivos organizan y recuperan archivos completos. Las bases de datos administran registros y exponen capacidades de consulta, indexación, integridad y concurrencia. El límite no es absoluto: un sistema de archivos es técnicamente una forma de almacén de datos, y los lakehouses modernos agregan una semántica de tablas similar a una base de datos sobre los archivos, pero la distinción es útil para las decisiones de arquitectura.

RequisitoPunto de partida probable
Intercambiar datos tabulares legibles por humanosCSV u otro archivo delimitado
Mantenga imágenes y videos a gran escalaAlmacenamiento de objetos o blobs en la nube
Hacer cumplir las relaciones y transaccionesBase de datos relacional
Almacenar documentos variables Base de datos de documentos o almacenamiento de archivos
Analizar grandes conjuntos de datos históricos, almacén o lago
Recuperar contenido por similitud semánticaBase de datos de vectores o índice de vectores

Resumen del tema

Seleccione el almacenamiento a partir de patrones de acceso, requisitos de integridad, escala, latencia y forma de datos, no solo desde la extensión del archivo.

7. Almacenamiento de archivos desde discos locales a la nube

Los archivos pueden vivir en discos personales, medios extraíbles, sistemas de red compartidos o almacenamiento en la nube. Las organizaciones centralizan cada vez más archivos importantes en servicios en la nube para obtener capacidad elástica, durabilidad, controles de seguridad y almacenamiento rentable para grandes volúmenes.

La selección del formato depende de quién lee y escribe los datos, si las personas necesitan inspeccionarlos y si el almacenamiento compacto y el procesamiento rápido son más importantes que la legibilidad. Un formato adecuado para el intercambio de datos puede resultar ineficaz para el análisis, mientras que un formato en columnas puede resultar incómodo para un productor de .

Resumen del tema

El almacenamiento centralizado de archivos en la nube mejora la escala y la confiabilidad, mientras que la elección del formato determina la interoperabilidad y la eficiencia del procesamiento.

8. Texto delimitado y de ancho fijo

El texto delimitado separa campos y filas con caracteres acordados. Los valores separados por comas (CSV) suelen utilizar comas entre campos y saltos de línea entre registros; una fila de encabezado puede nombrar las columnas. Las alternativas son valores separados por tabulaciones (TSV), datos delimitados por espacios y registros de ancho fijo.

FirstName,LastName,Email
Asha,Patel,asha@example.com
Diego,Ruiz,diego@example.com

Estos formatos son portátiles y legibles, pero los delimitadores de escape, la codificación de caracteres, los valores nulos, las fechas y los tipos de datos requieren convenciones explícitas. Los archivos de ancho fijo evitan la ambigüedad del delimitador pero desperdician espacio y son menos adaptables a los cambios de esquema.

Resumen del tema

El texto delimitado es excelente para un intercambio amplio, siempre que los productores y consumidores acuerden la codificación, los delimitadores, los encabezados y los tipos de datos.

9. , y archivos binarios

expresa colecciones y objetos anidados con relativamente poca sintaxis, lo que lo hace común para , configuración y mensajes de eventos. Extensible Markup Language () utiliza elementos y atributos encerrados por etiquetas. es más detallado pero sigue siendo importante en los sistemas y estándares empresariales establecidos.

<customers>
  <customer id="101">
    <name>Asha Patel</name>
    <email>asha@example.com</email>
  </customer>
</customers>

Los formatos de texto asignan bytes a caracteres mediante codificaciones como Unicode. Los formatos binarios almacenan bytes que una aplicación debe interpretar, como una imagen JPEG, una secuencia de audio, un vídeo, un archivo o un documento propietario. Los profesionales de datos suelen llamar a estos archivos binarios BLOB.

Comparación de texto delimitado, JSON, XML, BLOB, Parquet, Avro y Delta Lake.
Figura 2: Los formatos de archivo equilibran la legibilidad, la flexibilidad, la compresión y los patrones de procesamiento.

Resumen del tema

y describen datos jerárquicos; Los formatos binarios priorizan la representación específica de la aplicación en lugar de la legibilidad humana.

10. Parquet: almacenamiento de análisis en columnas

Apache Parquet es un formato columnar y un estándar de facto para los lakehouses modernos. Un archivo se divide en grupos de filas y los valores de cada columna se almacenan juntos dentro de un grupo. Los describen los fragmentos, lo que permite que un motor omita datos irrelevantes y lea solo las columnas solicitadas.

El diseño en columnas permite una compresión y codificación eficientes, particularmente cuando los valores adyacentes comparten características. Parquet también maneja datos anidados. Está optimizado para escaneos analíticos, no para que la gente lo lea en un editor de texto o para actualizaciones frecuentes de un solo registro.

Resumen del tema

Parquet reduce la E/S analítica organizando y comprimiendo datos por columna.

11. Avro y Delta Lake

Apache Avro se basa en filas. Cada archivo contiene un encabezado que describe el esquema en y bloques binarios que contienen los registros. Mantener cada registro junto hace que Avro sea útil para el intercambio de datos, la transmisión por secuencias, la serialización compacta y la minimización del ancho de banda de la red.

Delta Lake es un formato de tabla de código abierto creado sobre Parquet. Una tabla de registros de transacciones registra cambios y agrega transacciones ACID, actualizaciones confiables, administración de esquemas, control de versiones y viajes en el tiempo sobre archivos en un . Parquet proporciona los archivos de datos; el registro Delta proporciona historial de tablas y coordinación transaccional.

Resumen del tema

Avro favorece el intercambio orientado a filas; Delta Lake convierte los archivos Parquet en tablas versionadas y confiables.

12. Qué aporta una base de datos

En el trabajo de datos profesional, una base de datos es un sistema dedicado para almacenar, administrar y consultar registros. Más allá de la persistencia, puede proporcionar índices, restricciones, control de concurrencia, seguridad, respaldo, recuperación y optimización de consultas. Estas capacidades distinguen un sistema de gestión de bases de datos de un directorio de archivos.

Resumen del tema

Una base de datos gestiona los registros y su comportamiento, no sólo los bytes que los almacenan.

13. Bases de datos relacionales, claves, normalización y SQL

Una base de datos relacional almacena entidades estructuradas en tablas. Una clave principal identifica de forma única cada fila y una clave externa hace referencia a una fila de otra tabla. Estas relaciones permiten que un pedido identifique a su cliente sin repetir el registro completo del cliente.

La normalización separa entidades relacionadas para reducir la duplicación y actualizar anomalías. Mejora la coherencia transaccional, aunque los esquemas analíticos pueden desnormalizar deliberadamente los datos para acelerar las consultas. El lenguaje de consulta estructurado (SQL) se basa en los estándares ANSI, por lo que sus ideas centrales son similares en todos los productos de bases de datos, incluso cuando las implementaciones agregan extensiones.

Tablas relacionales comparadas con bases de datos clave-valor, documentos, familias de columnas y gráficos.
Figura 3 - Los modelos de bases de datos optimizan diferentes formas y patrones de acceso.

Resumen del tema

Las bases de datos relacionales utilizan tablas, claves, restricciones, normalización y SQL para preservar las relaciones estructuradas.

14. Cuatro modelos no relacionales comunes

Las bases de datos no relacionales no requieren un esquema relacional y a menudo se agrupan bajo el término , aunque algunas ofrecen lenguajes de consulta similares a SQL. Se seleccionan por esquemas flexibles, distribución, relaciones especializadas o escala muy alta.

ModeloRepresentaciónBuen ajuste
Valor claveUna clave única se asigna a un valor arbitrarioSesiones, almacenamiento en caché, perfiles, búsquedas rápidas
DocumentoEl valor es un documento consultableCatálogos y entidades con atributos variables
Familia de columnasLas filas contienen grupos de columnas relacionadosGrandes conjuntos de datos dispersos y cargas de trabajo distribuidas
GráficoLas entidades son nodos y las relaciones son aristasRutas de fraude, relaciones sociales, recomendaciones.

Resumen del tema

es una familia de modelos; haga coincidir el almacenamiento de clave-valor, documento, familia de columnas o gráficos con el patrón de consulta dominante.

15. Procesamiento transaccional, OLTP y

Una transacción es un evento comercial pequeño y discreto, como pagar un pedido o transferir dinero. Los sistemas de procesamiento de transacciones en línea (OLTP) admiten aplicaciones de línea de negocios en vivo y pueden manejar millones de eventos mientras mantienen los datos disponibles con baja latencia.

Las bases de datos OLTP están optimizadas tanto para lectura como para escritura. Las aplicaciones crean, recuperan, actualizan y eliminan registros (las operaciones ) mientras que la base de datos protege la integridad bajo actividad concurrente. Los esquemas a menudo están normalizados para que cada transacción toque una pequeña cantidad de registros precisos.

Resumen del tema

OLTP registra eventos comerciales actuales mediante lecturas y escrituras rápidas y confiables.

16. Garantías de transacciones ACID

Considere transferir $40 de la cuenta A, inicialmente $100, a la cuenta B, inicialmente $50. El resultado correcto es $60 y $90, y ningún observador debería ver una transferencia parcial permanente.

PropiedadGarantía en el traslado
AtomicidadEl débito y el crédito se realizan juntos o ambos se revierten
ConsistenciaLas reglas siguen siendo válidas y el saldo total permanece en $150
AislamientoLos lectores simultáneos no combinan valores de antes y después
DurabilidadDespués de la confirmación, los nuevos saldos sobreviven a un reinicio
Transferencia bancaria que ilustra atomicidad, consistencia, aislamiento y durabilidad.
Figura 4: ACID evita estados de transacciones parciales, no válidas, mixtas o perdidas.

Resumen del tema

ACID hace que una transacción sea indivisible, válida, aislada de interferencias y permanente después de la confirmación.

17. Procesamiento analítico, ETL y ELT

Los sistemas analíticos son principalmente de lectura y contienen datos históricos o métricas de negocio. Pueden analizar una sola instantánea o una serie temporal de instantáneas. Los datos operativos suelen extraerse, transformarse y cargarse (ETL), o extraerse y cargarse antes de aplicar las transformaciones (ELT), un patrón común en los lakehouses modernos.

  1. Ingerir archivos operativos, eventos y registros de bases de datos.
  2. Limpiar, estandarizar, unir y enriquecer los datos antes o después de la carga.
  3. Organice los datos en tablas de lago o almacén.
  4. Construir agregaciones y definiciones semánticas.
  5. Entregue informes, visualizaciones, paneles, ciencia de datos y cargas de trabajo de IA.
Fuentes operativas que pasan a través de ETL o ELT hacia el lago, la lakehouse, el almacén, el modelo semántico y los informes.
Figura 5: Analytics separa la captura operativa del análisis histórico.

Resumen del tema

ETL se transforma antes de cargar; ELT se carga primero y utiliza la plataforma de destino para la transformación.

18. , almacén y

TiendaCaracterística principalUso típico
Almacenamiento escalable basado en archivos para datos sin procesar y seleccionadosExploración, ciencia de datos, diversos formatos.
Almacén de datosEsquema relacional y motor SQL optimizados para lecturasInformes gobernados e inteligencia empresarial
La de datosFlexibilidad del lago más tablas confiables y semántica de consultas relacionalesIngeniería, análisis e inteligencia artificial unificados

Los esquemas analíticos a menudo desnormalizan los datos de las fuentes OLTP. Algunas duplicaciones pueden reducir las uniones y mejorar el rendimiento de lectura. Se trata de una compensación deliberada: los modelos transaccionales optimizan las actualizaciones y la integridad, mientras que los modelos analíticos optimizan análisis, agregaciones e informes amplios.

Resumen del tema

Los lagos priorizan los archivos flexibles, los almacenes priorizan el análisis relacional y los lakehouses combinan ambos enfoques.

19. OLAP, modelos semánticos, hechos, dimensiones y usuarios

Un modelo de procesamiento analítico en línea (OLAP), ahora comúnmente llamado modelo semántico e históricamente llamado cubo, almacena o define agregaciones para un análisis rápido. Las medidas numéricas de las tablas de hechos se evalúan en tablas de dimensiones como fecha, cliente, producto y geografía. Las jerarquías permiten profundizar de región a ciudad para abordar y profundizar en la dirección opuesta.

Los modelos semánticos son un ejemplo común. Los científicos de datos pueden explorar archivos directamente en un lago, los analistas de datos pueden consultar tablas de almacén y crear visualizaciones, y los usuarios empresariales suelen consumir métricas seleccionadas a través de informes y paneles.

Resumen del tema

Los modelos semánticos traducen los datos almacenados en medidas, dimensiones, jerarquías y análisis consistentes listos para el negocio.

20. Plataformas modernas y la arquitectura del medallón.

es una plataforma de análisis unificada que ofrece almacenamiento, ingeniería de datos, almacenamiento, ciencia de datos, capacidades en tiempo real e informes en un entorno compartido. admite ingeniería y ciencia de datos a gran escala y utiliza Delta Lake como formato de tabla estándar. proporciona seguridad, gobernanza y cumplimiento de datos unificados en todas las fuentes. proporciona experiencias de modelado semántico, visualización e inteligencia empresarial.

Una arquitectura medallón crea límites de calidad explícitos. Bronze conserva registros de fuentes sin procesar para su trazabilidad y reprocesamiento. Silver contiene datos limpios y conformados, con duplicados eliminados y tipos estandarizados. Gold contiene modelos agregados y listos para el negocio para informes y análisis. y también brindan experiencias Copilot para la exploración del lenguaje natural.

Capas de datos Bronce, Plata y Oro conectadas a Microsoft Fabric, Azure Databricks, Microsoft Purview y Power BI.
Figura 6: Las plataformas modernas aplican ingeniería, gobernanza y consumo en torno a capas de calidad medallón.

Resumen del tema

Análisis de procesos de Fabric y Databricks, Purview gobierna los datos, brinda información empresarial y las capas de medallón hacen explícita la progresión de la calidad.

21. Escenario minorista integrado

Un minorista registra pedidos y cambios de inventario en una base de datos relacional normalizada OLTP. Las imágenes de productos se guardan en el almacenamiento de blobs, los atributos de catálogo flexibles en documentos y los eventos de aplicaciones en Avro. La plataforma analítica incorpora estas fuentes en Bronze, estandariza clientes y productos en Silver y publica medidas de ventas e inventario en Gold.

Parquet y Delta Lake admiten mesas de lago eficientes. Un modelo semántico define ingresos, margen, unidades, fechas, tiendas y productos para . Los científicos de datos pueden utilizar archivos para realizar pronósticos, mientras que los usuarios empresariales ven paneles. ayuda a descubrir, clasificar, proteger y gobernar las fuentes participantes.

Resumen del tema

Las soluciones reales combinan modelos de almacenamiento: OLTP para eventos actuales, almacenamiento de objetos para archivos, datos de documentos para mayor flexibilidad y una plataforma analítica gobernada para tendencias.

22. Evaluación del módulo con explicaciones.

  1. Recuperación de documentos en lenguaje natural: elija una base de datos vectorial porque busca inserciones vectoriales por similitud semántica.
  2. Imágenes y vídeos de gran tamaño: elija el almacenamiento de blobs en lugar de una base de datos relacional o de familia de columnas.
  3. Lecturas y escrituras transaccionales de gran volumen: elija una base de datos relacional OLTP cuando las relaciones y la integridad de ACID sean fundamentales.
  4. Ventaja de Parquet: el almacenamiento en columnas permite una compresión, codificación y lecturas selectivas eficientes.
  5. Flujo de trabajo minorista: use OLTP para transacciones en vivo y OLAP o un modelo semántico para análisis de tendencias.
  6. Distinción clave-valor: cada registro se recupera mediante una clave única asociada con un valor arbitrario.
  7. Transacciones de inventario y clientes: elija OLTP, no un sistema de archivos ni un motor OLAP.
  8. Consultas lentas de inteligencia empresarial: optimice la capa analítica o OLAP en lugar del sistema transaccional.
  9. Rasgo único de Parquet entre los formatos enumerados: almacenamiento en columnas.

Resumen del tema

Las preguntas de evaluación comprueban si puede relacionar la forma de los datos, el almacén, el modelo de base de datos y la carga de procesamiento con un requisito concreto.

23. Revisión final y mapa de memoria.

  • Representación: estructurada, semiestructurada, no estructurada y vectorial.
  • Archivos: texto delimitado, , , BLOB, Parquet, Avro y Delta Lake.
  • Bases de datos: modelos relacionales más clave-valor, de documentos, de familia de columnas, de gráficos y vectoriales.
  • Transacciones: OLTP, y ACID.
  • Análisis: ETL o ELT en lago, almacén o ; Los modelos semánticos aceleran el consumo.
  • Plataformas: , , y ; Bronce, Plata y Oro organizan la calidad de los datos.
PlazoDefinición lista para el examen
EsquemaReglas que definen campos, tipos y organización
BLOBBinary Large Object interpretado por una aplicación
OLTPProcesamiento operativo rápido de transacciones en vivo
OLAPAnálisis multidimensional o semántico optimizado para lectura
HechoEvento empresarial u observación medible
DimensiónContexto utilizado para dividir y agrupar medidas
ETL / ELTTransformar antes de cargar / transformar después de cargar
La Almacenamiento en con tablas confiables y semántica de consultas analíticas

Resumen del tema

Para DP-900, conecte siempre el requisito a cuatro decisiones: representación, almacenamiento, patrón de procesamiento y consumidor.

24. Referencias oficiales

  • Microsoft Learn: describe conceptos básicos de datos.
  • Microsoft Learn: documentación de .
  • Microsoft Learn: documentación de .
  • Microsoft Learn: documentación de .
  • Microsoft Learn: documentación de .

Resumen del tema

Utilice la documentación oficial para confirmar las capacidades actuales del servicio después de dominar los conceptos duraderos de este capítulo.