Servicios de Azure Storage: Blob, Data Lake, OneLake, Archivos y Tablas
Volver a Learn
DP-900Capítulo 5

Preparación para la Certificación Microsoft DP-900

Servicios de Azure Storage: Blob, Data Lake, OneLake, Archivos y Tablas

Tipos de blob, niveles de acceso, ciclo de vida, redundancia, espacios jerárquicos, archivos compartidos y particiones NoSQL

Tiempo de estudio sugerido: 90 minutos • Nivel principiante • Alineado con la guía DP-900 y la documentación oficial de Microsoft Learn

Escudo neón de Azure Data Fundamentals rodeado de servicios blob, data lake, archivos y tablas

1. Almacenamiento para cargas no relacionales

Las bases relacionales imponen un esquema y organizan datos en tablas. Muchas aplicaciones guardan documentos, medios, registros, archivos analíticos, carpetas compartidas o registros semiestructurados con campos variables.

ofrece servicios de objetos, archivos y clave/valor. OneLake ofrece un lago lógico para todo el inquilino de . La elección depende de protocolo, organización, latencia, escala, gobierno y análisis.

Resumen del tema

y OneLake cubren distintos patrones no relacionales; elija según cómo deban organizarse, accederse, protegerse y analizarse los datos.

2. Cuentas de almacenamiento, contenedores y acceso

mantiene grandes volúmenes de datos binarios no estructurados como blobs. Las aplicaciones usan la de Blob para leer y escribir objetos. La cuenta de almacenamiento es el límite administrativo y los contenedores agrupan blobs relacionados.

Los permisos pueden asignarse al contenedor. La autenticación con y el control de acceso basado en roles de ( de ) se recomiendan para conceder acciones precisas sin distribuir secretos.

Una barra en el nombre crea carpetas virtuales. En el plano predeterminado solo son prefijos; no admiten acceso ni operaciones masivas en la carpeta.

Cuentas de almacenamiento, contenedores y acceso
Figura 1 - Cuentas de almacenamiento, contenedores y acceso

Resumen del tema

Una cuenta contiene contenedores y blobs; los contenedores agrupan y protegen objetos, mientras las carpetas virtuales son prefijos.

3. Blobs en bloques, en páginas y de anexión

Un blob en bloques se forma con bloques transferidos por separado. Cada bloque alcanza 4.000 MiB y hasta 50.000 bloques suman unos 190,7 TiB. Sirve para objetos discretos grandes con pocos cambios.

Un blob en páginas usa páginas fijas de 512 bytes y acceso aleatorio. Su máximo es 8 TiB y lo utiliza para discos de máquinas virtuales.

Un blob de anexión agrega bloques solo al final; no modifica ni elimina los existentes. Cada bloque alcanza 4 MiB y el total supera ligeramente 195 GiB, ideal para registros continuos.

Tipo de blobPatrón de escrituraUso típico
BloquesBloques reemplazados o confirmadosArchivos y medios
PáginasPáginas aleatorias de 512 bytesDiscos virtuales
AnexiónSolo al finalRegistros
Blobs en bloques, en páginas y de anexión
Figura 2 - Blobs en bloques, en páginas y de anexión

Resumen del tema

Use bloques para objetos, páginas para discos aleatorios y anexión para flujos que solo crecen.

4. Niveles de acceso y ciclo de vida

Frecuente es el nivel predeterminado para datos consultados a menudo. Esporádico reduce almacenamiento, aumenta acceso y espera 30 días. Frío sirve para acceso raro con recuperación en milisegundos y espera 90 días.

Archivo ofrece el menor coste para datos históricos y espera 180 días. El blob queda sin conexión; rehidratarlo a Frecuente, Esporádico o Frío puede tardar hasta 15 horas. El borrado anticipado puede generar cargos.

Las directivas de ciclo de vida usan la edad desde la modificación para cambiar niveles y eliminar datos vencidos automáticamente.

NivelAcceso típicoPermanencia esperada
FrecuenteFrecuenteNinguna
EsporádicoPoco frecuente30 días
FríoRaro, recuperación rápida90 días
ArchivoMuy raro, sin conexión180 días
Niveles de acceso y ciclo de vida
Figura 3 - Niveles de acceso y ciclo de vida

Resumen del tema

Equilibre almacenamiento, acceso, latencia y permanencia; el ciclo de vida automatiza transiciones y eliminación.

5. Redundancia y resistencia regional

El almacenamiento con redundancia local (LRS) conserva tres copias en un . El almacenamiento con redundancia de zona (ZRS) las distribuye entre tres zonas de la región primaria.

El almacenamiento con redundancia geográfica (GRS) replica de forma asíncrona a una región secundaria distante. El almacenamiento con redundancia de zona geográfica (GZRS) combina zonas primarias y región secundaria.

RA-GRS y RA-GZRS permiten leer la copia secundaria antes de la conmutación. La elección considera disponibilidad, desastre, lectura, retraso y coste.

LRSZRSGRS / RA-GRSGZRS / RA-GZRS
Tres copias localesTres zonas primariasLocal más región secundariaZonas primarias más región secundaria
Redundancia y resistencia regional
Figura 4 - Redundancia y resistencia regional

Resumen del tema

LRS protege en un centro, ZRS entre zonas y GRS/GZRS agregan otra región; las variantes RA exponen lectura secundaria.

6. Gen2

Gen2 es un lago a escala de nube integrado en . Conserva la economía y capacidades de Blob , incluidos niveles y ciclo de vida, y agrega un sistema jerárquico compatible con motores analíticos.

Plataformas como montan el sistema distribuido para procesar enormes conjuntos de datos. aprovisiona OneLake sobre esta base.

Resumen del tema

Gen2 agrega jerarquía analítica a la base escalable y económica de Blob .

7. jerárquico y permisos

Con el espacio jerárquico, los directorios son recursos reales y no prefijos con barras. Cambiar nombre, mover, eliminar y controlar directorios puede ser atómico, algo útil para análisis con muchos archivos.

Las listas de control de acceso (ACL) compatibles con POSIX conceden lectura, escritura y ejecución en archivos y directorios y complementan de .

Active jerárquico al crear la cuenta o actualice una elegible. La conversión es unidireccional y no vuelve al modelo plano.

Espacio de nombres jerárquico y permisos
Figura 5 - jerárquico y permisos

Resumen del tema

El espacio jerárquico habilita directorios y ACL detalladas, pero la conversión no puede revertirse.

8. Microsoft OneLake en Fabric

Cada inquilino de recibe OneLake automáticamente. Es un lago lógico unificado para toda la organización y centraliza datos analíticos estructurados o no. Varios motores reutilizan los datos sin copiarlos ni moverlos.

Los espacios de trabajo delegan propiedad a los equipos y organizan elementos de Fabric con límites de gobierno. OneLake, basado en Gen2, admite sus y y usa Delta Parquet abierto.

El explorador de archivos de OneLake permite navegar desde Windows, combinando lago compartido, administración distribuida, compatibilidad abierta y acceso familiar.

Microsoft OneLake en Fabric
Figura 6 - Microsoft OneLake en Fabric

Resumen del tema

OneLake ofrece un lago organizativo; los espacios de trabajo distribuyen la administración y los formatos abiertos permiten reutilizar datos.

9. y recursos compartidos en la nube

Los recursos compartidos locales funcionan en una LAN, pero escalan mal entre sedes. hospeda recursos compartidos de red administrados y reduce hardware y mantenimiento con disponibilidad y capacidad de nube.

Los recursos viven en una cuenta y pueden montarse. La capacidad se divide entre múltiples recursos con cuotas. En la referencia, un archivo alcanza 4 TiB y cada archivo o directorio admite hasta 2.000 identificadores simultáneos.

La referencia indica hasta 256 TiB en cuentas SSD y más en HDD. Como los límites cambian, confirme los actuales antes de implementar.

Azure Files y recursos compartidos en la nube
Figura 7 - y recursos compartidos en la nube

Resumen del tema

sustituye o amplía recursos compartidos de red con almacenamiento administrado, cuotas y montaje familiar.

10. Protocolos, medios, carga y sincronización

admite SMB en Windows, Linux y macOS. NFS sirve a Linux con kernel 4.3 o posterior y no admite clientes Windows o macOS. NFS exige cuenta SSD y una red virtual para controlar acceso.

HDD cuesta menos; SSD ofrece mayor rendimiento por mayor precio. Los archivos se cargan mediante Portal o .

centraliza datos en y sincroniza cachés de Windows Server local, combinando escala de nube y rendimiento local entre sedes.

OpciónRequisito
SMBWindows, Linux o macOS
NFSLinux 4.3+, cuenta SSD, red virtual
HDDMenor coste
SSDMayor rendimiento
Protocolos, medios, carga y sincronización
Figura 8 - Protocolos, medios, carga y sincronización

Resumen del tema

Elija SMB o NFS por cliente, HDD o SSD por coste y rendimiento, y para cachés locales sincronizadas.

11. y forma de la entidad

es un servicio de clave/valor. Cada fila es una entidad y sus propiedades pueden variar, por lo que la tabla es semiestructurada y no relacional.

Toda entidad tiene clave compuesta por PartitionKey y RowKey, además de Timestamp. No hay claves externas, relaciones, procedimientos ni vistas. Los datos suelen desnormalizarse para reunir todo el registro lógico.

for Table usa el mismo modelo y añade rendimiento y disponibilidad global; la orientación de referencia lo recomienda para cargas nuevas.

PartitionKeyRowKeyTimestamp
Agrupa la particiónÚnica en la particiónÚltima modificación
Table Storage y forma de la entidad
Figura 9 - y forma de la entidad

Resumen del tema

guarda entidades flexibles y desnormalizadas identificadas por PartitionKey y RowKey.

12. Particiones, consultas puntuales y de intervalo

PartitionKey agrupa entidades almacenadas juntas. Las particiones crecen de forma independiente y una tabla puede tener cualquier cantidad; la clave debe reflejar el acceso.

Incluir PartitionKey reduce las lecturas. Dentro de la partición, RowKey ordena entidades. La clave completa permite consulta puntual y un intervalo de RowKey recupera filas contiguas.

Un mal diseño concentra tráfico u obliga a examinar demasiado. Modele claves desde consultas y distribución esperadas.

Resumen del tema

PartitionKey orienta distribución y búsqueda; RowKey identifica y ordena entidades para consultas puntuales y por intervalo.

13. Exploración práctica de

El ejercicio requiere una suscripción de con acceso administrativo. Un flujo útil crea grupo y cuenta, inspecciona redundancia y configuración y prueba recursos Blob, Files o Table.

Valide autenticación y autorización, cree datos, observe puntos de conexión y elimine el grupo para evitar costes. Registre acceso y de cada servicio.

Resumen del tema

La práctica conecta conceptos con configuración, seguridad, puntos de conexión, operaciones, costes y limpieza.

14. Razonamiento de la evaluación

Los protocolos distinguen de Blob : Files usa SMB/NFS y los blobs la de Blob. El ciclo de vida automatiza niveles.

Una anexión falla si el blob alcanzó su tamaño máximo; los blobs de anexión sirven para registros que crecen sin reescritura.

Las preguntas de Gen2 dependen del espacio jerárquico. Para imágenes raras, Archivo minimiza coste si la rehidratación y permanencia son aceptables.

Resumen del tema

Asocie el escenario con protocolo, ciclo de vida, escritura del blob, espacio jerárquico o economía del nivel.

15. Repaso del capítulo y lista para el examen

Describa Blob , compare bloques/páginas/anexión, elija Frecuente/Esporádico/Frío/Archivo, explique ciclo de vida y redundancia y distinga espacio plano de jerárquico.

Explique también OneLake, protocolos y sincronización de , claves y particiones de y aprovisionamiento básico de una cuenta. Reconozca requisitos en vez de memorizar pantallas.

Resumen del tema

Para DP-900, relacione cada servicio con forma de datos, acceso, jerarquía, rendimiento, protección y decisiones operativas.