Preparación para la Certificación Microsoft DP-900
Roles de Datos y Servicios de Datos de Microsoft Azure
Roles de bases de datos, ingeniería, análisis e IA; PaaS y SaaS; Azure SQL, almacenamiento, integración, Microsoft Fabric, análisis en tiempo real, gobernanza, BI y servicios de IA
Tiempo de estudio sugerido: 85 minutos • Nivel principiante • Alineado con la guía de estudio DP-900 y la documentación oficial de Microsoft Learn
Por João Ricardo Dutra••Material completo
1. Por qué son importantes las funciones y servicios de datos
El volumen y la variedad de datos producidos por aplicaciones, dispositivos y procesos empresariales continúan creciendo. Por lo tanto, las organizaciones dividen el trabajo con datos en especialidades: operar bases de datos, integrar datos, interpretarlos, gobernarlos y construir experiencias inteligentes. Una asignación clara de responsabilidades reduce las brechas operativas y ayuda a los equipos a seleccionar la tecnología según la carga de trabajo, no solo por familiaridad.
Los nombres de roles no son universales. Un equipo pequeño puede combinar varias responsabilidades en una sola persona, mientras que una empresa grande puede separarlas en grupos especializados. El examen DP-900 se centra en las responsabilidades recurrentes detrás de los títulos y en las categorías de servicio que requieren esas responsabilidades.
Resumen del tema
Primero comprenda la responsabilidad y luego asóciela con la categoría de servicio que la cumple.
2. Cuatro roles principales y cómo colaboran
Rol
Resultado primario
Colaboradores típicos
Administrador de base de datos
Bases de datos disponibles, seguras y con buen rendimiento
Equipos de aplicaciones e ingenieros de datos.
Ingeniero de datos
Movimiento, limpieza, transformación y almacenamiento analítico de datos confiables
Administradores de bases de datos, analistas e ingenieros de IA
Analista de datos
Modelos, informes, visualizaciones y conclusiones de negocio
Partes interesadas del negocio e ingenieros de datos
Ingeniero de IA
Capacidades de IA responsable y flujos de trabajo inteligentes
Ingenieros de datos, analistas y desarrolladores de aplicaciones
Figura 1: El trabajo de datos es colaborativo: cada rol produce un resultado que otro rol puede consumir.
Los límites son intencionalmente permeables. Un administrador de base de datos puede aprovisionar una base de datos operativa y luego actuar como ingeniero de datos para mover sus registros a un almacén de datos. Asimismo, un analista podrá validar un modelo semántico mientras un ingeniero de IA incorpora sus resultados a una aplicación.
Resumen del tema
Los roles se diferencian por su resultado principal, pero las soluciones prácticas dependen de la colaboración y, a veces, de la propiedad compartida.
3. Responsabilidades del administrador de la base de datos
Un administrador de bases de datos diseña, implementa, mantiene y opera sistemas de bases de datos locales y en la nube. La función protege la disponibilidad y el rendimiento constante a través de la configuración, el monitoreo, el ajuste, la planificación de la capacidad, las copias de seguridad y la recuperación. Los planes de recuperación ante desastres deben abarcar tanto los fenómenos naturales como los errores humanos.
La seguridad es igualmente importante. El administrador concede o deniega el acceso, asigna privilegios, aplica políticas y mantiene protegidas las copias de recuperación. La asistencia de IA puede redactar consultas o ayudar a investigar síntomas de rendimiento en lenguaje natural, pero la aprobación, la evaluación de riesgos y el juicio operativo siguen siendo responsabilidades humanas.
Resumen del tema
Los administradores de bases de datos mantienen las plataformas de bases de datos disponibles, seguras, recuperables y con buen rendimiento.
4. Responsabilidades del ingeniero de datos
Un ingeniero de datos trabaja con las partes interesadas para diseñar e implementar canalizaciones de ingesta, rutinas de limpieza y transformación, y almacenamiento para cargas de trabajo analíticas. La función abarca bases de datos relacionales y no relacionales, almacenes de archivos y flujos, por lo que las opciones arquitectónicas están determinadas por la forma, la escala, la latencia y las necesidades del consumidor de los datos.
Los ingenieros operan y supervisan las canalizaciones para que los datos lleguen cuando se esperan y con la calidad requerida. También protegen la privacidad a través de rutas híbridas desde sistemas locales hasta almacenes en la nube y aplican reglas de gobernanza durante el movimiento. Las herramientas de IA pueden proponer código y configuraciones de transformación, pero el ingeniero sigue siendo responsable de la arquitectura, la privacidad y la calidad.
Resumen del tema
Los ingenieros de datos convierten datos de origen distribuidos en productos de datos confiables, gobernados y listos para análisis.
5. Responsabilidades del analista de datos
Un analista de datos convierte datos sin procesar en información comercial relevante. El rol explora tendencias y relaciones, traduce requisitos en modelos analíticos, define cálculos y comunica hallazgos a través de informes, paneles y visualizaciones. El contexto empresarial es importante porque un análisis técnicamente correcto puede seguir siendo irrelevante si responde a la pregunta equivocada.
La asistencia de IA puede resumir un informe, sugerir una imagen, generar expresiones analíticas o crear una narrativa. El analista aún valida el resultado, selecciona la comparación correcta, explica la incertidumbre y comunica una conclusión procesable a las partes interesadas.
Resumen del tema
Los analistas de datos conectan los datos con las decisiones a través de modelos, medidas, visualizaciones y una comunicación empresarial clara.
6. Responsabilidades del ingeniero de IA
Un ingeniero de IA crea e integra capacidades impulsadas por IA en aplicaciones y flujos de trabajo de datos. La función funciona con grandes modelos de lenguaje, canales de aprendizaje automático y fuentes de datos empresariales para ofrecer escenarios como chat sobre datos organizacionales, generación de contenido y clasificación automatizada.
Los ingenieros de IA dependen de los ingenieros de datos para obtener datos preparados y gobernados y colaboran con los analistas cuando los conocimientos generados por IA aparecen en informes o aplicaciones. Su trabajo diario puede incluir generar código, evaluar modelos, explicar comportamientos y proponer arquitecturas. La responsabilidad humana sigue siendo esencial para las decisiones de diseño, la evaluación, la seguridad y el despliegue responsable.
Resumen del tema
Los ingenieros de IA combinan modelos, datos, evaluación e integración de aplicaciones para ofrecer experiencias inteligentes responsables.
7. Roles adicionales y responsabilidad compartida
Los cuatro roles son una base útil más que un organigrama completo. Los científicos de datos experimentan con modelos estadísticos y de aprendizaje automático; los arquitectos de datos definen estructuras y estándares multiplataforma; los desarrolladores de aplicaciones y los ingenieros de software crean sistemas que producen y consumen datos. Los equipos de seguridad, cumplimiento y negocios también influyen en los requisitos.
Un rol describe un conjunto de responsabilidades, no necesariamente un empleado. La separación de funciones aclara la responsabilidad, mientras que la colaboración evita que la optimización local dañe la solución de un extremo a otro.
Resumen del tema
Utilice los roles como límites de responsabilidad, reconociendo al mismo tiempo que las organizaciones pueden combinarlos, cambiarles el nombre o especializarlos aún más.
8. Elección de servicios y comprensión de y
ofrece muchos servicios de datos para cargas de trabajo operativas y analíticas. Los principiantes no necesitan memorizar todo el catálogo; deben reconocer la categoría de carga de trabajo, el grado de control requerido y qué función normalmente opera o consume el servicio.
Modelo de entrega
Microsoft gestiona
El cliente se centra en
Servidores, infraestructura central, parches y gran parte del mantenimiento de la plataforma
Datos, configuración, opciones de seguridad y aplicaciones
El producto completo listo para usar y su infraestructura.
Espacios de trabajo, contenido, gobernanza y uso empresarial
Figura 2: comience con la categoría de carga de trabajo, luego elija el servicio y el modelo de entrega.
Resumen del tema
reduce obra de infraestructura; ofrece un producto completo. En ambos modelos, los clientes siguen siendo responsables de sus datos y opciones de configuración.
9. Familia y el espectro de responsabilidad
es el nombre colectivo de los servicios relacionales basados en el motor Microsoft SQL Server. es una base de datos totalmente administrada. proporciona una instancia alojada de SQL Server con mantenimiento automatizado y una compatibilidad más amplia a nivel de instancia, junto con una mayor responsabilidad de configuración. ofrece el máximo control del sistema operativo y del motor de base de datos, pero el cliente administra la máquina virtual y la instalación de SQL Server.
Figura 3: Una mayor capacidad de configuración conlleva una mayor responsabilidad administrativa.
Los administradores de bases de datos aprovisionan y operan estos sistemas para aplicaciones de línea de negocio que almacenan datos transaccionales. Los ingenieros de datos los utilizan como fuentes de canalización y los analistas pueden consultarlos directamente para obtener informes más pequeños. La analítica empresarial suele combinar sus datos con otras fuentes en un almacén analítico. Las funciones integradas de IA pueden ayudar a generar consultas e investigar el rendimiento a través del lenguaje natural.
Resumen del tema
Elija entre las opciones de equilibrando la compatibilidad y el control con la cantidad de administración que el equipo desea tener.
10. Bases de datos relacionales de código abierto administradas
también proporciona servicios relacionales administrados para motores de código abierto ampliamente utilizados. es común en aplicaciones creadas con la pila Linux, Apache, MySQL y PHP. admite tablas relacionales, así como tipos de datos personalizados con características relacionales y no relacionales de objetos.
Los administradores de bases de datos gestionan la disponibilidad, la seguridad y el rendimiento de las aplicaciones transaccionales. Los ingenieros de datos consumen estas bases de datos como fuentes de canalización y los analistas pueden usar sus datos directamente o después de que se hayan consolidado en una plataforma analítica.
Resumen del tema
Los servicios administrados de MySQL y PostgreSQL preservan los motores familiares de código abierto al tiempo que reducen la administración de la infraestructura.
11. para datos distribuidos globalmente
es una base de datos no relacional distribuida globalmente diseñada para aplicaciones escalables y de alta disponibilidad. Sus admiten múltiples modelos de datos, incluidos documentos , pares clave-valor, datos de familias de columnas y gráficos. Esta flexibilidad lo hace adecuado cuando los patrones de acceso a las aplicaciones no se ajustan a un esquema relacional fijo.
Un administrador de base de datos puede administrar el servicio, pero los desarrolladores de aplicaciones a menudo poseen el diseño como parte de la arquitectura de la aplicación. Los ingenieros de datos integran registros de Cosmos DB en soluciones analíticas y los analistas consumen los modelos e informes resultantes. Las capacidades del lenguaje natural IA pueden ayudar con la exploración y las consultas.
Resumen del tema
Utilice cuando una aplicación necesite almacenamiento de alta disponibilidad y distribuido globalmente en todos los modelos de datos compatibles.
12. y lagos de datos
es un servicio fundamental de almacenamiento en la nube. Los contenedores de blobs proporcionan almacenamiento económico y escalable para objetos binarios; los recursos compartidos de archivos exponen los recursos compartidos de archivos de la red; y las tablas proporcionan un almacenamiento rápido de valores-clave para las aplicaciones.
Los ingenieros de datos utilizan el almacenamiento de blobs con un jerárquico para crear lagos de datos. El organiza archivos en directorios dentro de un sistema de archivos distribuido, lo que permite que grandes motores analíticos procesen datos preservando una estructura de carpetas familiar.
Resumen del tema
cubre objetos, archivos compartidos y tablas de valores-clave; el almacenamiento de blobs jerárquico puede servir como .
13. y Fabric Data Factory
define y programa canalizaciones que mueven y transforman datos. Una canalización puede leer desde fuentes locales o en la nube, invocar la computación en la nube para su procesamiento y conservar el resultado en otro almacén. Los ingenieros de datos lo utilizan para implementar soluciones ETL que llenan repositorios analíticos desde sistemas transaccionales.
Fabric Data Factory incorpora capacidades de Data Factory a . Es la elección natural cuando la ingesta, la transformación, el almacenamiento, el análisis y los informes pertenecen a la misma solución y de Fabric. sigue siendo útil para una integración más amplia de y patrones de orquestación independientes.
Resumen del tema
Data Factory organiza el movimiento y la transformación de datos repetibles; Elija la experiencia Fabric para obtener una solución integrada de análisis de Fabric.
14. y OneLake
es una plataforma de análisis unificada . Combina ingeniería de datos, almacenamiento de datos, análisis en tiempo real, ciencia de datos, bases de datos, gobernanza y en espacios de trabajo basados en navegador. Microsoft opera la infraestructura, por lo que los equipos crean y gobiernan elementos en lugar de administrar servidores o clústeres.
OneLake es el lógico compartido que sustenta Fabric. Una capa de almacenamiento común reduce las copias innecesarias y permite que varias cargas de trabajo funcionen con los mismos datos gobernados. Los ingenieros pueden crear una solución integral que combine canalizaciones, lakehouses, almacenes de datos, , inteligencia empresarial y conclusiones basadas en IA.
Figura 4: Fabric unifica experiencias analíticas sobre un lógico compartido.
Resumen del tema
proporciona análisis integrados de y OneLake proporciona una base de almacenamiento compartido para sus cargas de trabajo.
15. Cargas de trabajo de Fabric, asistencia de lenguaje natural y Fabric IQ
Fabric Data Factory maneja la ingesta y ETL; admite análisis con el patrón ; admite análisis en un almacén de datos relacional; Real-Time Intelligence se encarga del ; ofrece visualización; y Fabric también incluye ciencia de datos, aprendizaje automático, bases de datos SQL, Cosmos DB en Fabric y capacidades de gobernanza.
La asistencia integrada IA puede ayudar a crear canalizaciones, escribir SQL, generar código de cuaderno y explorar datos utilizando lenguaje natural. IQ agrega un vocabulario empresarial compartido sobre los datos en OneLake para que las herramientas, los equipos, los usuarios empresariales y los agentes de IA interpreten entidades como Cliente, Pedido o Producto de forma coherente. Fabric IQ es actualmente una funcionalidad en , por lo que su comportamiento y disponibilidad pueden evolucionar.
Resumen del tema
Las cargas de trabajo de Fabric cubren el ciclo de vida del análisis; IQ agrega significado de negocio compartido y acceso en lenguaje natural a los datos de OneLake.
16. y modelos semánticos
es la plataforma de visualización de datos e inteligencia empresarial de Microsoft. Los analistas se conectan a fuentes, crean informes y paneles interactivos y distribuyen información. Está disponible como servicio independiente y como carga de trabajo de Fabric integrada junto con elementos de ingeniería y almacén.
En Fabric, comúnmente accede a datos a través de modelos semánticos: capas analíticas gobernadas que definen medidas, relaciones, jerarquías y lógica empresarial. Las funciones de IA pueden resumir informes, recomendar visualizaciones, generar medidas de DAX y producir narrativas escritas, sujetas a la validación de los analistas.
Resumen del tema
convierte los modelos gobernados en análisis interactivos, mientras que los modelos semánticos mantienen consistentes los cálculos y las definiciones comerciales.
17. para análisis de con código primero
es una plataforma de análisis de nube administrada construida sobre Apache Spark. Admite ingeniería de datos, ciencia de datos y análisis SQL a gran escala en formatos abiertos, especialmente Delta Lake. Se ejecuta dentro de una suscripción de y es adecuado para equipos que prefieren Spark, cuadernos y flujos de trabajo que priorizan el código.
Los ingenieros de datos crean almacenes y canalizaciones analíticas con las habilidades de Spark existentes. Los analistas pueden consultar y visualizar datos en cuadernos web. La asistencia de IA puede generar código Spark y SQL y explicar la lógica compleja del cuaderno, mientras que el equipo sigue siendo responsable de la corrección y el diseño operativo.
Resumen del tema
es la opción administrada de Spark y notebooks para cargas de trabajo de ingeniería, ciencia de datos y lakehouses abiertos a gran escala.
18. Canalizaciones por lotes, procesamiento de flujos y análisis de telemetría
Servicio
Patrón de procesamiento
Uso representativo
Orquestación por lotes programada o basada en eventos
Mover y transformar datos entre tiendas
Procesamiento continuo de flujo en tiempo real
Leer un flujo de entrada, consultarlo y escribir una salida
Análisis de telemetría y registros de alto rendimiento
Consulta de registros con marca de tiempo y telemetría de
Figura 5: La latencia y la forma de los datos ayudan a distinguir la orquestación, el procesamiento de flujo y la exploración de telemetría.
puede alimentar una visualización en tiempo real o ingerir eventos procesados en un almacén analítico. es una plataforma de análisis de big data independiente y totalmente administrada, optimizada para consultas rápidas sobre registros y telemetría, donde los atributos de marca de tiempo son especialmente comunes.
Resumen del tema
Utilice Data Factory para la orquestación de canalizaciones, Analytics para el procesamiento continuo de eventos y Data Explorer para la investigación de telemetría y registros de alta velocidad.
19. para gobernanza y descubribilidad
admite el descubrimiento y la en toda la empresa. Los equipos pueden mapear datos entre fuentes, clasificar información confidencial, seguir el entre sistemas y ayudar a los analistas a localizar datos confiables. Estas capacidades hacen posible la aplicación de políticas y el análisis de impacto en todas las plataformas en lugar de hacerlo dentro de una única base de datos.
Los ingenieros de datos utilizan Purview para aplicar la gobernanza y proteger la integridad de la información que alimenta las cargas de trabajo analíticas. Las etiquetas de clasificación y confidencialidad ayudan a las organizaciones a mantener controles en todas las regiones y plataformas; el identifica cómo los datos se movieron y cambiaron. Purview no reemplaza las copias de seguridad ni un servicio de sincronización en tiempo real.
Resumen del tema
hace que los datos sean detectables y gobernados mediante mapeo, clasificación, información de sensibilidad y entre sistemas.
20. para soluciones empresariales IA
es el unificado de Microsoft para operaciones empresariales IA, creadores de modelos y desarrollo de aplicaciones inteligentes. Proporciona acceso a modelos, herramientas, capacidades de evaluación e infraestructura para diseñar, probar e implementar soluciones IA.
Los ingenieros y desarrolladores de IA lo utilizan para aplicaciones de chat sobre sus datos, flujos de trabajo de múltiples agentes y canalizaciones automatizadas de IA que se integran con los servicios de datos de . Los datos preparados, el control de acceso, la evaluación, el seguimiento y la implementación responsable siguen siendo partes esenciales de la solución.
Resumen del tema
proporciona la plataforma administrada y las herramientas utilizadas para crear, evaluar e implementar experiencias empresariales IA conectadas a datos organizacionales.
21. Matriz de decisión de rol a servicio
Requisito
Rol principal
Servicio probable
Operar y recuperar una base de datos relacional
Administrador de base de datos
Familia o base de datos administrada de código abierto
Integrar y transformar fuentes empresariales
Ingeniero de datos
o Fabric Data Factory
Crear informes y medidas comerciales.
Analista de datos
y modelos semánticos
Cree una aplicación distribuida globalmente
Desarrollador o administrador de base de datos
Procesar un flujo de eventos continuo
Ingeniero de datos
Analizar telemetría con marca de tiempo
Analista de datos o ingeniero de datos
del mapa y datos confidenciales
Ingeniero de datos o equipo de gobierno
Cree una aplicación IA conectada a tierra
Ingeniero de IA
con fuentes de datos gobernadas
Figura 6: Un servicio puede admitir varios roles, pero cada rol lo aborda con una responsabilidad diferente.
Resumen del tema
Haga coincidir el requisito comercial con el resultado de una función y el patrón de carga de trabajo antes de seleccionar un servicio.
22. Revisión de evaluaciones y razonamiento de exámenes
La evaluación del módulo prueba la responsabilidad y la selección de servicios en lugar de la sintaxis del comando. Los siguientes patrones de razonamiento cubren los nueve escenarios sin reproducir las preguntas originales.
El diseño de la tubería de pertenece principalmente al ingeniero de datos; La seguridad, la disponibilidad y el rendimiento de la base de datos pertenecen principalmente al administrador de la base de datos.
Para un control total de una instalación SQL Server y su entorno operativo, seleccione ; es un servicio de integración, no un host de base de datos.
La creación de informes y visualizaciones es fundamental para la función de analista de datos, mientras que la arquitectura de ingesta y ETL son preocupaciones de ingeniería de datos.
La integración de fuentes y la operación de procesos ETL es una responsabilidad de ingeniería de datos; configurar copias de seguridad es la administración de la base de datos.
Para grandes transformaciones diarias entre sistemas locales y en la nube, es el servicio de canalización entre las opciones enumeradas.
admite el control basado en regulaciones mediante la clasificación y el monitoreo de datos confidenciales.
El de Purview rastrea los datos a través de fuentes y transformaciones, ayudando a los equipos a proteger la integridad y comprender el impacto.
Las etiquetas de clasificación y sensibilidad mantienen el contexto de gobernanza en todas las plataformas; la eliminación frecuente no establece la integridad.
es la opción de alta disponibilidad y distribución global entre , y .
Resumen del tema
Para preguntas sobre DP-900, identifique el verbo de carga de trabajo (operar, integrar, analizar, gobernar, transmitir o construir IA) y eliminar los servicios de la categoría incorrecta.
Resumen del capítulo final
Los administradores de bases de datos operan y protegen bases de datos. Los ingenieros de datos integran, transforman y gobiernan datos. Los analistas de datos modelan y comunican conocimientos. Los ingenieros de IA crean funciones inteligentes responsables. , las bases de datos administradas de código abierto, y proporcionan bases operativas; Data Factory, Fabric, Databricks, Analytics y Data Explorer procesan y analizan información; lo comunica; El ámbito lo gobierna; y Foundry permite soluciones empresariales IA basadas en esos datos.