Preparación para la Certificación Microsoft AZ-305
Diseña soluciones de integración y análisis de datos en Azure
Convierte requisitos de lotes, streaming, almacenamiento, transformación, latencia, seguridad y análisis en una arquitectura de datos defendible en Azure.
Tiempo de estudio sugerido: 86 minutos • Nivel intermedio • Reescritura original completa con resumen conciso de cada tema
Por João Ricardo Dutra••Contenido original completo
1. Comienza por el resultado de integración y el comportamiento de los datos
Un arquitecto de debe recomendar cómo ingerir, mover, transformar, almacenar, consultar y presentar datos durante una migración a la nube. El diseño debe admitir volúmenes y complejidad superiores a los de una base tradicional, con seguridad, cumplimiento, disponibilidad y costo controlado.
Considera Tailwind Traders, fabricante y minorista global ficticio. Inventario, ventas históricas, registros de producción, sitios web, puntos de venta, redes sociales y flujos de de control de calidad deben combinarse y conservarse para consultas, informes, aprendizaje automático y visualización.
Diseñar integración con .
Diseñar un lago con .
Diseñar ingeniería y análisis con .
Diseñar análisis empresarial con .
Seleccionar rutas de datos caliente, tibia y fría.
Diseñar tiempo real con .
El módulo supone conocimientos conceptuales y experiencia práctica en integración. Las decisiones corresponden a las aptitudes AZ-305 para diseñar almacenamiento y recomendar integración y análisis.
Resumen del tema
Documenta fuentes, velocidad, volumen, formatos, latencia, consumidores, retención, seguridad y operación antes de seleccionar un servicio.
2. Separa integración, almacenamiento, procesamiento y consumo
Una plataforma sostenible separa responsabilidades. La ingesta recibe archivos, cambios de bases, y eventos. La orquestación coordina dependencias. El almacenamiento conserva datos sin procesar y depurados. El proceso transforma y modela. La capa de consumo entrega resultados a paneles, aplicaciones, analistas y sistemas de aprendizaje automático.
Responsabilidades de arquitectura.
Capa
Pregunta
Opciones representativas
Ingerir y orquestar
¿Cómo llegan los datos y qué pasos se ejecutan?
,,.
Almacenar
¿Qué formato, , retención y acceso se requieren?
,,,.
Procesar y analizar
¿El trabajo es relacional, Spark, o mixto?
,,.
Consumir y actuar
¿Quién usa el resultado y con qué latencia?
, SQL, aplicaciones, alertas y .
Trata la plataforma como responsabilidades conectadas, no como un producto universal.
Resumen del tema
Elige cada componente para una responsabilidad clara y define contratos, seguridad y fallos entre capas.
3. orquesta ETL y ELT híbridos
es un servicio administrado para ETL, ELT, movimiento y orquestación híbrida. Sus canalizaciones recopilan datos locales y de nube, coordinan transformaciones a escala y publican datos preparados en destinos analíticos.
Un flujo habitual conecta y recopila en una ubicación central; transforma con flujos de datos de asignación o proceso externo como ; publica mediante control de versiones y CI/CD; y supervisa programaciones, ejecuciones, dependencias y errores.
Data Factory no tiene que ser el almacén ni el motor de transformación. Puede copiar a , iniciar un cuaderno o procedimiento y cargar , conservando el control operativo.
Resumen del tema
Usa cuando el requisito principal sea mover y orquestar de forma administrada entre sistemas heterogéneos e híbridos.
4. Canalizaciones, actividades, conjuntos de datos y servicios vinculados describen el flujo
Objetos principales de .
Objeto
Responsabilidad
Implicación
Canalización
Contenedor lógico de actividades.
Define secuencia, parámetros, control, reintentos e implementación.
Actividad
Paso de movimiento, transformación o control.
Puede copiar, ejecutar un procedimiento, cuaderno, búsqueda o validación.
Conjunto de datos
Vista con nombre de una entrada o salida.
Describe estructura o ubicación sin incrustar toda la conexión.
Servicio vinculado
Conexión a almacenamiento o proceso.
Centraliza , autenticación y entorno de ejecución de integración.
Flujo de datos
Grafo visual ejecutado en Spark administrado.
Transformación de poco código con programación y supervisión.
Conexión, forma de datos, paso, proceso y orquestación son objetos separados.
Resumen del tema
Separa conexión, datos, trabajo, proceso y orquestación para proteger y cambiar cada objeto independientemente.
5. El entorno de ejecución de integración determina dónde se trabaja
El entorno de ejecución de integración conecta actividades y servicios vinculados. Mueve datos, despacha transformaciones, ejecuta flujos o paquetes SSIS. Su ubicación afecta conectividad, residencia, rendimiento y costo.
Tipos de entorno de integración.
Tipo
Uso principal
Límite de red
Copia entre nubes, flujos administrados y despacho.
públicos o red virtual administrada y privados compatibles.
Autohospedado
Movimiento entre redes privadas/locales y nube.
Host Windows del cliente con conectividad saliente.
Ejecución administrada de paquetes SQL Server Integration Services.
Clúster administrado que puede unirse a una red virtual.
Las canalizaciones de Synapse admiten entornos y autohospedados, pero no . Coloca el proceso cerca de los datos y fija región cuando la residencia impida la selección automática.
Resumen del tema
Elige el entorno por conectividad, transformación, compatibilidad SSIS, geografía, rendimiento y cumplimiento.
6. Data Factory encaja en preparación y movimiento híbridos
En Tailwind Traders, los servicios vinculados conectan almacenes locales y de nube; un entorno autohospedado llega a sistemas privados; los conjuntos describen estructuras; las actividades copian y ejecutan procedimientos; y la canalización publica datos para o aprendizaje automático.
Usa autoría y supervisión visual si poco código acelera la entrega.
Valida conectores actuales para ,, AWS, Google Cloud, , bases y archivos.
Prefiere infraestructura administrada para elasticidad y menos servidores.
Adopta Git, CI/CD, parámetros, secretos, alertas y canalizaciones reejecutables.
En proyectos nuevos compara Data Factory en , documentado como la próxima generación de .
Resumen del tema
Data Factory destaca cuando muchas fuentes, red híbrida, orquestación repetible y operación importan más que un único motor analítico.
7. es Blob optimizado para análisis
Un lago centraliza datos estructurados, semiestructurados y no estructurados en formato nativo. no es un servicio separado: son capacidades analíticas sobre activadas mediante el jerárquico.
Combina economía, niveles, replicación, durabilidad, ciclo de vida y recuperación de objetos con semántica de archivos, acceso Hadoop, directorios y seguridad por archivo. Gen1 se retiró el 29 de febrero de 2024; los diseños nuevos usan Gen2.
Resumen del tema
Usa Gen2 cuando un repositorio de blobs escalable también necesite directorios, protocolos y acceso granular para análisis.
8. El espacio jerárquico y ABFS optimizan operaciones analíticas
Con espacio jerárquico, los contenedores actúan como sistemas de archivos y los datos se organizan en directorios reales. Cambiar el nombre o eliminar un directorio es una operación atómica de en lugar de enumerar todos los blobs con el mismo prefijo.
Blob File System expone los esquemas abfs y abfss a motores compatibles con HDFS. Apache Spark accede sin una copia separada. Aun así, demasiados archivos pequeños o particiones incorrectas degradan el rendimiento.
El espacio jerárquico agrega operaciones reales de directorio sobre blobs.
Resumen del tema
Activa HNS para semántica de directorios y ABFS y diseña particiones y tamaño de archivo para los motores consumidores.
9. y ACL similares a POSIX resuelven ámbitos distintos
El control de acceso basado en rol de concede acciones amplias heredables por ámbitos de . Las listas de control de acceso similares a POSIX asignan lectura, escritura y ejecución a usuarios, grupos, entidades de servicio e identidades administradas en archivos y directorios. Las ACL predeterminadas afectan nuevos hijos; los existentes requieren cambios recursivos.
Usa grupos de y combina mínimo privilegio, identidades administradas, privados, firewall, cifrado con claves de Microsoft o del cliente, registros y ciclo de vida. Selecciona redundancia de según recuperación y residencia.
Resumen del tema
Usa para ámbitos amplios y ACL para detalle de archivos, junto con identidad, red, cifrado, auditoría y redundancia.
10. Ingerir, acceder y autorizar son operaciones distintas del lago
Los archivos masivos entran por , CLI de , PowerShell, o Explorador de . Las fuentes relacionales pueden usar desde , y . Los eventos pueden llegar por , y .
Los consumidores usan Explorador de , PowerShell, CLI, HDFS, o . La herramienta no sustituye la autorización: todo llamador necesita una identidad o credencial compatible y la decisión o ACL correcta.
Resumen del tema
Diseña rutas separadas de ingesta, consumo y autorización; la herramienta que llega al lago no decide quién puede usarlo.
11. Un lago separa el crecimiento del almacenamiento del proceso analítico
Tailwind Traders puede reunir sitios, puntos de venta, redes sociales, ,,, CSV, imágenes y otros formatos en un repositorio gobernado. Después se elige ,, u otro motor sin acoplar retención a un clúster.
Escenarios de lago.
Requisito
Por qué encaja
Historial analítico masivo
Almacenamiento independiente del proceso y detalle sin procesar.
Muchos formatos y productores
Repositorio común que reduce silos y conserva formato nativo.
Destino por lotes y
Archivos y salidas de eventos comparten un lago duradero.
Análisis Hadoop y Spark
ABFS y HNS admiten patrones de big data.
Resumen del tema
Elige un lago cuando datos sin procesar diversos requieran retención central y motores con escalado independiente.
12. Compara blobs comunes con una cuenta habilitada para lago correctamente
se construye sobre . Una cuenta de uso general v2 o blobs en bloques Premium obtiene capacidades de lago al activar HNS. Ambas conservan durabilidad, replicación, niveles, ciclo de vida y según la matriz de compatibilidad.
Comparación de almacenamiento.
Criterio
Sin HNS
Con capacidades de lago
Objetos planos y carpetas simuladas.
Directorios jerárquicos y operaciones atómicas.
Autorización
, SAS y claves.
más ACL similares a POSIX.
Acceso analítico
de blobs y conectores; ABFS puede dirigirse al .
de blobs y lago con comportamiento ABFS consciente de HNS.
Mejor ajuste
Multimedia, copias, archivos y blobs de aplicaciones.
Lagos analíticos con directorios y acceso granular.
Resumen del tema
Un lago es una cuenta de blobs con capacidades jerárquicas; elige HNS por semántica de workload y compatibilidad.
13. unifica ingeniería, análisis e IA
es una plataforma administrada centrada en Apache Spark y patrones . Admite lotes y a escala, SQL, cuadernos colaborativos, ingeniería y ciclo de aprendizaje automático. Los proyectos actuales suelen usar Python y SQL, con más lenguajes según la característica.
El combina almacenamiento de objetos flexible con tablas confiables y gobierno. Delta Lake agrega transacciones y Unity Catalog puede centralizar permisos, y descubrimiento.
Resumen del tema
Usa cuando ingeniería Spark, , colaboración, SQL o flujos integrados de IA sean centrales.
14. Plano de control y plano de proceso definen el límite de confianza
El plano de control aloja aplicación web, , coordinación de trabajos, controles y . El procesamiento ocurre en un plano de proceso. El proceso clásico usa recursos en la suscripción del cliente; el proceso usa un plano administrado por Databricks.
El material original ubica todos los clústeres en la suscripción del cliente, válido para proceso clásico, pero no para toda opción actual. Documenta tipo de proceso, ubicación de datos, conectividad privada y controles de salida.
La elección de proceso cambia el límite de red y operación.
Resumen del tema
Trata el proceso clásico y como límites distintos y valida red, acceso, gobierno y región.
15. Las experiencias de Databricks atienden a personas distintas
Experiencias de .
Experiencia
Usuarios
Trabajo típico
Analistas y BI.
Almacenes SQL, consultas, paneles y .
Ingeniería y ciencia de datos
Ingenieros y científicos.
Cuadernos, lotes y , Spark y exploración.
Aprendizaje automático e IA
Científicos e ingenieros ML.
Experimentos, características, entrenamiento, servicio, supervisión y MLOps.
Los datos pueden llegar por , Apache Kafka, o y permanecer en . Separa proceso interactivo y producción, aplica escalado y políticas y evita secretos en cuadernos.
Resumen del tema
Selecciona experiencia y política de proceso por persona y ciclo de vida, no solo por preferencia de cuadernos.
16. Databricks destaca cuando coinciden colaboración y Spark a escala
En fabricación, Tailwind Traders necesita combinar lotes y , usar Python o SQL, acceder a almacenes y entregar resultados a . Un área de ingeniería es mejor que una experiencia solo SQL o ML cuando la necesidad inmediata es transformación colaborativa.
Preparar datos complejos y no estructurados.
Crear recomendaciones, abandono, intrusión y mantenimiento predictivo.
Crear canalizaciones reutilizables.
Separar trabajos y proceso de producción.
Aplicar gobierno, costo, observabilidad y ciclo de vida.
Resumen del tema
Elige Databricks para ingeniería Spark colaborativa y proceso flexible; agrega SQL o ML cuando realmente se requieran.
17. combina SQL, Spark e integración
reúne almacén empresarial, big data, integración y autoría. Synapse SQL ofrece T-SQL distribuido; Apache Spark atiende ingeniería y ML; las canalizaciones orquestan ETL/ELT; centraliza desarrollo y supervisión.
Un grupo SQL dedicado usa procesamiento paralelo masivo. Un nodo de control recibe T-SQL y coordina nodos de proceso sobre datos distribuidos. PolyBase lee y carga datos externos relacionales o de archivos para virtualización y movimiento entre lago y SQL.
Resumen del tema
Usa Synapse cuando un área coordinada de SQL distribuido, Spark, lago e integración sea preferible a herramientas separadas.
18. Los componentes de Synapse cubren varios motores analíticos
Componentes de .
Componente
Finalidad
Cuándo elegir
Grupo SQL dedicado
Almacén MPP reservado con tablas persistidas.
Rendimiento previsible y capacidad aprovisionada.
Grupo SQL
T-SQL bajo demanda sobre archivos del lago.
Exploración y consultas ocasionales sin clúster.
Grupo Apache Spark
Spark administrado para ingeniería y ML.
Código distribuido en Python, Scala, SQL o C#.
Canalizaciones Synapse
Movimiento, control y transformación sin código.
Orquestación dentro del área Synapse.
Análisis casi en tiempo real de almacenes operativos.
Minimizar impacto en origen transaccional.
IDE web para datos, desarrollo, integración y supervisión.
Una experiencia y superficie CI/CD comunes.
Synapse es un área con varios motores.
Resumen del tema
Selecciona cada motor por workload y coordínalos bajo el mismo modelo de seguridad y desarrollo.
19. El análisis descriptivo, diagnóstico, predictivo y prescriptivo necesita motores distintos
Preguntas analíticas.
Modo
Pregunta
Diseño posible
Descriptivo
¿Qué sucede?
Almacén dedicado o SQL sobre archivos depurados.
Diagnóstico
¿Por qué sucedió?
Exploración interactiva con SQL o Spark.
Predictivo
¿Qué sucederá probablemente?
Spark con o .
Prescriptivo
¿Qué acción tomar?
Modelos SQL/Spark con y .
Resumen del tema
Empieza por la pregunta y latencia y después elige el motor Synapse y servicio auxiliar.
20. Data Factory y Canalizaciones Synapse comparten conceptos, pero sirven a plataformas distintas
Canalizaciones Synapse comparte canalizaciones, actividades, servicios vinculados, conjuntos, entornos y autohospedados y flujos con . Synapse agrega orquestación nativa de SQL y Spark; Data Factory sigue siendo un servicio dedicado con y patrones independientes.
No dependas de comparaciones estáticas. Microsoft posiciona Data Factory en como experiencia de próxima generación. Compara , inversiones actuales, migración, capacidad y gobierno de Fabric y disponibilidad regional.
Resumen del tema
Usa Data Factory como plataforma independiente, Canalizaciones Synapse dentro de Synapse y evalúa Fabric Data Factory para diseños unificados nuevos.
21. Una ruta tibia analiza un flujo reciente casi en tiempo real
La ruta tibia procesa eventos en tránsito, conserva un subconjunto reciente y envía resultados oportunos. agrega, filtra, une referencia y aplica ventanas; almacena eventos; reacciona; o sirven resultados recientes.
En , señales brutas pueden no indicar utilización. La ruta tibia las combina con material, turno o equipo y aplica reglas variables. El resultado es información casi en tiempo real con una vista operacional.
Resumen del tema
Usa la ruta tibia para agregación casi en tiempo real y almacenamiento reciente cuando segundos o minutos sean suficientes.
22. Una ruta fría conserva historial y crea vistas por lotes
La ruta fría contiene almacenamiento duradero, capa por lotes y vistas de consumo. Mensajes originales quedan en o mientras orquesta , Apache Spark, u otro motor.
Agregados precalculados aceleran consultas históricas y se combinan con la ruta tibia. Sirve para retención legal, datos raros, entrenamiento y análisis retrospectivo. Niveles de acceso y ciclo de vida controlan costo.
Resumen del tema
Usa la ruta fría para historial inmutable, retención larga, recomputación por lotes, cumplimiento y aprendizaje automático.
23. Una ruta caliente impulsa alertas y acciones inmediatas
La ruta caliente procesa o presenta eventos sensibles en segundos o menos. Atiende alertas, fraude, portales, seguridad y flotas. Debe ser corta, particionable, observable y resistente porque cada dependencia añade latencia y riesgo.
Selección de rutas.
Ruta
Latencia y alcance
Necesidad
Caliente
Acción evento a evento, segundos o menos.
Alertar o actualizar una experiencia en vivo.
Tibia
Ventanas casi en tiempo real y subconjunto reciente.
Panel operativo o agregado móvil.
Fría
Lotes sobre historial completo.
Retención, análisis histórico y entrenamiento.
Una fuente puede alimentar las tres rutas.
Resumen del tema
Selecciona rutas por latencia, historial, consulta, retención y acción; muchas arquitecturas combinan las tres.
24. ofrece procesamiento administrado de eventos complejos
es un motor administrado que consume eventos de aplicaciones, sensores, clics, redes sociales y dispositivos, aplica lógica temporal similar a SQL y dirige resultados a acciones, paneles o almacenes.
Los eventos necesitan semántica temporal. Las serializaciones incluyen , CSV y Avro. Un trabajo contiene al menos una entrada de , consulta y una o más salidas. El editor sin código complementa las consultas.
Resumen del tema
Usa para procesar eventos temporales con SQL y mínima administración de infraestructura.
25. Las entradas de y referencia cumplen funciones diferentes
Las entradas de son secuencias ilimitadas. Las fuentes actuales incluyen ,,, Gen2 y Apache Kafka. es un ingestor general; Hub agrega identidad y mensajería de dispositivos.
Los datos de referencia son estáticos o cambian lentamente para búsquedas. Blob , Gen2 y son fuentes compatibles. Así, coordenadas de camiones reciben contexto de depósito, ruta y conductor.
Resumen del tema
Usa flujo para eventos cambiantes y referencia para enriquecer; elige ingesta por protocolo, escala y requisitos de dispositivo.
26. Las consultas transforman eventos mediante ventanas temporales
El lenguaje filtra, proyecta, agrega, une, reconoce patrones y usa funciones geoespaciales. Las ventanas de saltos de tamaño constante son fijas y no se superponen; las de salto pueden solaparse; las deslizantes emiten al cambiar; las de sesión siguen ráfagas; las instantáneas agrupan el mismo timestamp.
Usa TIMESTAMP BY si el tiene el tiempo autoritativo. Diseña para eventos tardíos y desordenados, tamaño de referencia, particiones y salida determinista. Prueba con datos realistas.
El tiempo y particionamiento forman parte del diseño.
Resumen del tema
Elige ventana y política temporal por la pregunta y prueba orden, retraso, partición y estado con carga realista.
27. Las salidas sirven paneles, almacenamiento, análisis o automatización
Salidas representativas.
Resultado
Salidas posibles
Nota
Flujo o lago duradero
, Blob , Gen2.
Conservar para repetición, lotes o consumidores.
Consumo operativo
,,.
Ajustar tasa, clave, idempotencia y consulta.
Análisis y visualización
,,.
Separar vista en vivo del historial completo.
Acción
, colas o temas de .
Diseñar reintentos, duplicados, límites y errores.
Un trabajo admite múltiples salidas con INTO. Particiona cuando sea compatible y evita un escritor único. Avro y Parquet requieren esquemas estables.
Resumen del tema
Dirige cada resultado al destino adecuado y diseña partición, idempotencia y error para cada salida.
28. Analytics admite varios patrones empresariales en tiempo real
Escenarios en tiempo real.
Requisito
Patrón
Telemetría de edificios
Agregar temperatura, humedad y ventilación.
Registros web y clics
Generar recomendaciones inmediatas.
Geoespacial
Rastrear flotas y geocercas.
Supervisión remota
Detectar anomalías y mantenimiento predictivo.
Fraude en punto de venta
Detectar monto, lugar o conducta inusual.
En Tailwind Traders, GPS de camiones entra por o Hub, se enriquece en Analytics, aparece en , genera acciones y llega al lago para análisis posterior.
Resumen del tema
Analytics encaja cuando telemetría continua debe convertirse en panel, alerta, registro enriquecido o evento.
29. Capacidad, partición, confiabilidad, seguridad y perímetro completan el diseño
Las Unidades de representan CPU y memoria. Escala y particiona entrada, consulta y escritores. Supervisa eventos, retraso de marca de agua, errores, utilización y contrapresión; prueba el pico y la limitación del destino.
Costo: paga por Unidades de y elimina capacidad ociosa.
Confiabilidad: usa puntos de control y entiende procesamiento exactamente una vez y entrega.
Seguridad: 1.2, identidades administradas, mínimo privilegio y red privada.
Ubicación: nube para escala; Edge o Stack para escenarios híbridos compatibles.
Operación: versiona consultas e infraestructura, automatiza y gobierna esquemas y retrasos.
Resumen del tema
Un diseño productivo combina lógica SQL con capacidad, particiones, entrega, seguridad, supervisión, esquema y recuperación.
30. Aplica los requisitos a la evaluación del módulo
Razonamiento de la evaluación.
Requisito
Mejor respuesta
Motivo
Combinar referencia local con de fabricación en nube y ejecutar procedimientos.
.
Servicios híbridos, entorno autohospedado y actividades cubren movimiento y control.
Ingerir y almacenar datos en tiempo real de múltiples fuentes para análisis.
.
El lago recibe datos diversos a escala y salidas de .
Retener 5 TB raramente usados por motivos legales a bajo costo.
Ruta fría y nivel frío/archivo apropiado.
Retención larga y acceso raro favorecen almacenamiento duradero económico.
transforma y procesa eventos, pero no sustituyen el requisito dominante de integración o retención en estas preguntas.
Resumen del tema
Identifica la responsabilidad dominante - orquestar, almacenar, procesar o servir - antes de elegir servicio.
31. Usa una matriz de decisión en lugar de comenzar por el producto
Matriz de recomendación.
Servicio
Recomienda cuando
No lo trates como
Movimiento híbrido, ETL/ELT, poco código, SSIS y supervisión predominan.
Almacén analítico o único motor de proceso.
Archivos crudos y depurados requieren escala, jerarquía y proceso independiente.
Motor de consulta u orquestador.
Spark, ,, ciencia de datos o ML predominan.
Sustituto de todo almacén o copia simple.
SQL distribuido, Spark, integración y área unificada se requieren.
Motor único o predeterminado para todo proyecto nuevo.
Eventos administrados y baja latencia se requieren.
Sistema de registro a largo plazo o motor por lotes.
Los servicios se componen; la respuesta puede ser una arquitectura.
Resumen del tema
Recomienda el menor conjunto que cubra movimiento, almacenamiento, proceso, latencia, gobierno y consumo.
32. Consolida el capítulo y amplía el diseño con seguridad
Ya puedes separar integración y análisis, diseñar objetos y entornos de Data Factory, crear un lago gobernado, ubicar Spark y SQL, combinar rutas caliente/tibia/fría y dirigir . Antes de implementar, valida regiones, cuotas, conectores, precios, red, seguridad y migración en documentación actual.
Pide a Copilot comparar servicios para una carga, explicar casos o proponer una arquitectura segura por lotes y tiempo real con SQL, e . Trata la respuesta como hipótesis y verifícala en fuentes autoritativas.