Preparación para la Certificación Microsoft AZ-305
Arquitectura HADR para plataformas de bases de datos: RTO, RPO, SQL Server, PaaS y soluciones híbridas
Convierte los objetivos empresariales de recuperación en diseños de alta disponibilidad y recuperación ante desastres para SQL Server en Azure Virtual Machines, servicios de Azure SQL y entornos híbridos.
Tiempo de estudio sugerido: 82 minutos • Nivel intermedio • Reescritura original completa con resumen conciso de cada tema
Por João Ricardo Dutra••Contenido original completo
1. HADR comienza con los requisitos, no con un producto
La alta disponibilidad y recuperación ante desastres (HADR) de una plataforma de bases de datos es una estrategia arquitectónica, no una casilla aislada. Antes de elegir funciones de SQL Server o , determina la interrupción tolerable, los datos que pueden perderse, el alcance del error que debe resistirse y quién operará la respuesta.
Una característica puede ser técnicamente válida y aun así incumplir el objetivo empresarial. El diseño debe conectar metas de recuperación, dependencias, protección de datos, conmutación por error, red y validación periódica.
Resumen del tema
Comienza con los requisitos de recuperación y el alcance del error; elige tecnología cuando el estado deseado sea medible.
2. El RTO limita la duración aceptable de la interrupción
El objetivo de tiempo de recuperación (RTO) es el máximo tiempo permitido para devolver un recurso o solución al servicio. Superarlo puede detener el trabajo, incumplir un compromiso, generar pérdidas o sanciones.
Registra RTO por componente y de extremo a extremo. Si SQL Server vuelve en cinco minutos, pero los servidores de aplicaciones tardan 20, el usuario espera 20 minutos; la dependencia crítica más lenta gobierna el tiempo efectivo.
Resumen del tema
El RTO responde cuánto tiempo puede permanecer indisponible el servicio y debe medirse en toda la cadena de dependencias.
3. El RPO limita la pérdida de datos aceptable
El objetivo de punto de recuperación (RPO) define el punto más reciente aceptable y, por tanto, la antigüedad máxima de los datos que pueden perderse. Si el incidente ocurre a las 10:00 y el RPO es 15 minutos, la recuperación debe alcanzar las 09:45 o después.
El RPO es un objetivo de datos, no una promesa del nombre de un producto. Retraso de replicación, frecuencia de copia del registro, tiempo de copia, restauración, ritmo de carga y consistencia del punto determinan si se logra.
El RPO mira hacia atrás hasta el punto de datos aceptable; el RTO mira hacia adelante hasta el plazo de restauración.
Resumen del tema
El RPO responde hasta dónde pueden retroceder los datos; cada intervalo de protección y transferencia debe caber en esa pérdida.
4. Establece objetivos mediante negociación empresarial y técnica
Cero tiempo de inactividad y cero pérdida de datos son atractivos, pero suelen ser caros o inviables. Negocio, aplicaciones, bases de datos, infraestructura, seguridad y finanzas deben acordar metas con los mismos datos.
Cuantifica el costo de la inactividad y de las transacciones perdidas.
Haz proporcional la inversión HADR a la pérdida evitada.
Incluye habilidades operativas, automatización, cobertura y tiempo de dependencias.
Documenta metas por componente y para la solución completa.
Revísalas cuando cambien la carga y las consecuencias empresariales.
Resumen del tema
RTO y RPO son requisitos negociados respaldados por costo, riesgo, capacidad operativa y evidencia de dependencias.
5. Las programaciones y pruebas deben respaldar los objetivos
Una directiva puede contradecir su meta. Una copia del registro cada 30 minutos no satisface de forma fiable un RPO de 15, y una copia que tarda tres horas no cabe en un RTO de dos. Frecuencia, ancho de banda, automatización y capacidad deben bastar.
Copias y réplicas solo sirven si se recuperan. Ensaya conmutación planeada y no planeada, restauración, conmutación por recuperación, reconexión y dependencias; registra los valores observados.
Resumen del tema
Alinea intervalos y transferencias con las metas y demuéstralo mediante ejercicios recurrentes.
6. Alta disponibilidad y recuperación ante desastres necesitan metas distintas
Alcances de disponibilidad y respuesta.
Dimensión
Alta disponibilidad
Recuperación ante desastres
Error típico
Nodo, proceso, host, bastidor o zona local
Región, , sitio o dependencia amplia
Recuperación
Conmutación rápida a una réplica o nodo local activo
Activar otra ubicación y restablecer dependencias
Escala
Segundos o minutos
Minutos, horas o más
Objetivo
Mantener continuidad local
Restablecer el servicio tras un evento amplio
Un diseño puede ayudar a ambos, pero HA local no equivale a DR regional. Documenta RTO y RPO independientes.
Resumen del tema
HA atiende interrupciones locales; DR restaura tras fallos amplios, por lo que cada alcance requiere metas y pruebas propias.
7. y reparten control y responsabilidad de forma distinta
SQL Server en es : sistema operativo e instancia son visibles y se combinan funciones del motor, clúster, almacenamiento, red y plataforma. La flexibilidad aumenta la responsabilidad.
y son . Microsoft opera los nodos y expone menos controles de disponibilidad y recuperación. El diseño prioriza configuración del servicio, resiliencia del cliente y topología regional.
Resumen del tema
ofrece máximo control con mayor operación; integra recuperación de infraestructura y expone opciones administradas.
8. La protección de instancia y de base de datos cubre objetos diferentes
Alcance de protección de SQL Server.
Característica
Unidad protegida
Consecuencia
Instancia de clúster de conmutación por error (FCI)
Instancia completa
Bases y objetos de instancia se mueven juntos; requiere almacenamiento compartido
Grupo de disponibilidad (AG)
Bases seleccionadas
Cada réplica mantiene copia; objetos de instancia requieren sincronización
Trasvase de registros
Bases seleccionadas
Copia, transferencia y restauración protegen datos; abstracción y objetos externos son manuales
Inicios de sesión, trabajos del Agente SQL Server, servidores vinculados y otros objetos externos no acompañan automáticamente la protección de base. Inclúyelos en runbooks.
Resumen del tema
Conoce la unidad protegida: las tecnologías de base de datos no reproducen automáticamente todos los objetos de instancia.
9. Los AG y las FCI dependen de un clúster subyacente
En Windows Server, AG y FCI usan el Clúster de conmutación por error de Windows Server (WSFC); en Linux, el administrador común es Pacemaker. Cuórum y ubicación del testigo forman parte del diseño, sobre todo entre sitios.
y deben estar disponibles donde dependan las identidades y nombres del clúster. Una topología regional o híbrida exige más que réplicas SQL.
Resumen del tema
Salud del clúster, cuórum, testigos, directorio y son dependencias HADR de primer nivel.
10. Una FCI protege toda la instalación
La FCI se crea al instalar SQL Server; una instancia independiente existente no puede convertirse sin más. Recibe nombre y dirección distintos de nodos y clúster. Los clientes usan esa identidad estable. En un diseño tradicional de una subred, un equilibrador de carga interno enruta al nodo activo.
En la conmutación, la instancia completa se detiene e inicia en otro nodo. Se pierden sesiones, las bases se recuperan, se revierten transacciones incompletas y los clientes resilientes reconectan. Una copia compartida mantiene consistencia de datos confirmados.
Resumen del tema
La FCI reinicia la instancia completa en otro nodo tras una identidad estable y protege el estado de instancia.
11. El almacenamiento compartido de FCI habilita y concentra riesgo
Cada nodo accede al mismo almacenamiento. Las opciones pueden incluir recursos compartidos de archivos Premium de , iSCSI, Shared Disk, Spaces Direct o productos compatibles como SIOS DataKeeper. La elección cambia latencia, cuórum, soporte, costo y fallo.
Una copia evita multiplicación, pero crea dependencia. Standard Edition admite hasta dos nodos FCI. Réplica de almacenamiento de Windows Server puede extender ciertos diseños; trasvase de registros o AG pueden proteger una FCI en otro sitio.
Resumen del tema
Las FCI simplifican la protección de instancia, pero exigen almacenamiento compartido y clúster cuidadosamente compatibles.
12. Los grupos de disponibilidad protegen copias independientes
Un AG tiene réplica principal de lectura/escritura y secundarias que reciben cambios del registro. El movimiento puede ser sincrónico para mínima pérdida o asincrónico cuando distancia y latencia lo exigen. Un agente de escucha ofrece destino estable.
Standard Edition admite un AG básico de una base y dos réplicas. Enterprise Edition permite varias bases y hasta nueve réplicas, incluidas secundarias legibles para informes, copias o comprobaciones. Se inicializan desde copia o propagación automática.
Resumen del tema
Los AG replican bases seleccionadas en copias independientes y usan un agente de escucha para desacoplar al cliente de la principal.
13. Los AG intercambian costo de almacenamiento por flexibilidad
Cada réplica guarda su copia, así que los AG evitan almacenamiento compartido y suelen conmutar más rápido que FCI, pero consumen más espacio. Cinco réplicas de una base de 1 TB requieren unos 5 TB sin sobrecarga.
La nueva principal necesita inicios de sesión, trabajos, servidores vinculados y credenciales sincronizados. Autenticación de Windows, bases independientes, infraestructura como código y sincronización controlada reducen la brecha.
Resumen del tema
Los AG eliminan almacenamiento compartido y añaden réplicas útiles, pero multiplican espacio y exigen atender dependencias de instancia.
14. El trasvase de registros es un patrón sencillo de espera
Comienza con una copia completa restaurada en la secundaria como STANDBY o NORECOVERY. Trabajos programados respaldan el registro principal, copian el archivo y lo restauran. Es simple y tolera redes débiles.
Suele servir para DR, no HA instantánea. La activación imprevista puede perder transacciones posteriores al último registro aplicado y no hay agente de escucha. Un alias puede reducir el cambio de nombre.
Resumen del tema
El trasvase ofrece DR económico mediante copia, transferencia y restauración, con intervalo de pérdida medible y activación manual.
15. Los conjuntos de disponibilidad reducen fallos correlacionados del host
Un conjunto aplica antiafinidad y distribuye VM por dominios de error y actualización. Los primeros separan alimentación y red; los segundos separan grupos que puede reiniciar juntos durante mantenimiento. El módulo representa hasta tres dominios de error en un .
Los conjuntos de disponibilidad separan VM por dominios de error y actualización en un .
Resumen del tema
Los conjuntos protegen réplicas de VM frente a eventos correlacionados de hardware y mantenimiento dentro de un .
16. La colocación de plataforma no corrige errores del invitado
Conjuntos y zonas no entienden transacciones SQL ni recuperan fallos del sistema operativo o motor. Combina colocación con AG, FCI, trasvase, copia de seguridad u otra protección consciente de la carga.
En una aplicación multicapa, aísla cada capa: web, base y VM de , por ejemplo. Una VM no puede estar simultáneamente en conjunto y zona.
Resumen del tema
La colocación limita el radio de infraestructura; los fallos del invitado y datos requieren protección de carga.
17. Las zonas de disponibilidad protegen frente al fallo del
Una zona es una ubicación física separada dentro de una región admitida. Distribuir réplicas en zonas 1, 2 y 3 puede resistir la pérdida de un centro. Los números son lógicos por suscripción; dos “zona 1” no prueban colocación física.
La distancia añade latencia. Prueba la carga antes de asumir que la confirmación sincrónica cumplirá; suele ser inferior a un milisegundo, pero el camino real decide. también admite redundancia de zona.
Resumen del tema
Las zonas amplían aislamiento al , pero su latencia debe validarse contra replicación y rendimiento.
18. replica la VM, no el protocolo de la base
replica continuamente una VM entre regiones y orquesta conmutación y recuperación. Protege muchas cargas y sirve si el método centrado en VM satisface los objetivos.
No interpreta límites transaccionales de SQL Server. La VM puede cumplir RTO y sus datos incumplir RPO. El material proporcionado citaba un RTO mensual de dos horas; la documentación actual de indica un de RTO de una hora para conmutación de VM. Trata estas cifras como datos sujetos a cambio y valida la recuperación completa.
Resumen del tema
Site Recovery ofrece recuperación regional de VM; consistencia de base y RPO requieren validación de la carga.
19. incluye alta disponibilidad local
ofrece de 99,99% en configuraciones admitidas y conmutación de nodo integrada. Las transacciones confirmadas persisten sincrónicamente. Si un nodo falla, el servicio activa otro proceso y adjunta almacenamiento.
Conexiones y transacciones en curso pueden interrumpirse. Las aplicaciones requieren reintentos limitados, idempotencia cuando proceda y control de tiempo de espera para errores transitorios.
Resumen del tema
oculta el reemplazo del nodo, pero la aplicación debe tolerar conexiones interrumpidas y errores transitorios.
20. La replicación geográfica y los grupos de conmutación resuelven DR regional
admite replicación geográfica activa; los grupos de conmutación por error coordinan bases de o . Réplicas legibles descargan informes y mantienen copia regional.
El agente de escucha conserva de lectura/escritura y solo lectura durante la conmutación. Región, retraso, directiva, dependencias y retorno siguen perteneciendo al diseño.
Resumen del tema
Usa replicación geográfica activa o grupos de conmutación para extender entre regiones con estable.
21. La recuperación acelerada de bases de datos acorta la recuperación del motor
y no exponen OFFLINE o EMERGENCY como SQL Server autoadministrado. opera el servicio; RESTRICTED_USER y conexión de administrador dedicada siguen disponibles donde se admiten.
Accelerated Database Recovery (ADR) usa un almacén de versiones persistente y truncamiento agresivo para hacer predecible la reversión y el reinicio. Está habilitada por defecto y contribuye a disponibilidad.
Resumen del tema
ADR reduce la penalización de transacciones largas y apoya el modelo de disponibilidad administrado.
22. Los controles administrados de consistencia complementan la redundancia
mantiene copias y respaldos locales y regionales, valida copia/restauración y detecta lecturas obsoletas o escrituras perdidas. CHECKSUM está activo, DBCC CHECKDB puede ejecutarse sin reparación y se intenta reparar páginas automáticamente.
La plataforma repara sin aviso si no hay impacto y notifica proactivamente si lo hay. Reduce riesgo, pero no elimina validación de aplicación y ejercicios.
Resumen del tema
Redundancia, integridad, reparación de páginas y alertas protegen juntas la consistencia en servicios .
23. Un AG de región única es un diseño común de HA
VM de SQL Server principal y secundaria pueden estar en límites separados, unirse a WSFC y exponerse con agente de escucha. Copias independientes protegen datos y permiten mantenimiento con cambio controlado.
Un AG regional combina colocación de VM y replicación de base de datos.
Varias copias reducen el fallo de almacenamiento único.
Confirmación sincrónica puede minimizar pérdida confirmada.
El agente de escucha normaliza el acceso.
No requiere almacenamiento de base compartido.
Resumen del tema
Un AG regional es sólido cuando se necesitan copias independientes, conmutación rápida y escucha estable.
24. Una FCI regional favorece la integridad de la instancia
Una FCI en dos VM puede usar Spaces Direct u otra opción compatible, WSFC, red virtual y enrutamiento. Es útil cuando proteger la instancia completa importa más que copias independientes.
La FCI mantiene una copia compartida y mueve la instancia entre nodos.
Las aplicaciones usan una identidad en clúster.
El mantenimiento puede mover el servicio.
Cumple muchas metas HA, pero no DR regional por sí sola.
Almacenamiento compartido y soporte son críticos.
Resumen del tema
Elige FCI cuando continuidad de instancia y copia compartida encajen, y añade un mecanismo separado de DR.
25. Un AG multirregional o híbrido puede ofrecer HA y DR
Un AG tradicional puede abarcar regiones o conectar el entorno local con mientras las réplicas permanecen en un WSFC. Se parece a un AG entre dos centros y funciona en Standard y Enterprise según sus límites.
El AG extendido usa un clúster y un grupo entre regiones o entornos híbridos.
Conectividad, cuórum, testigo, y en cada ubicación son esenciales. Una partición de red convierte el clúster extendido en riesgo central.
Resumen del tema
El AG extendido puede cubrir HA y DR con una función, pero el clúster y las dependencias entre sitios deben permanecer sanos.
26. Un AG distribuido separa dominios de fallo de clúster
Un grupo de disponibilidad distribuido, introducido en SQL Server 2016 Enterprise Edition, une dos AG independientes. La principal global envía cambios al reenviador, que también es principal del segundo AG y sincroniza su secundaria.
Un AG distribuido es un AG de AG y separa cuórum y testigo por ubicación.
Cada clúster conserva cuórum y testigo. La sincronización se reparte, funciona en o híbrido y facilita un retorno planificado sin un WSFC único entre sitios.
Resumen del tema
Los AG distribuidos aíslan clúster y cuórum y extienden replicación Enterprise entre ubicaciones.
27. El trasvase de registros sigue siendo una arquitectura práctica de DR
El servidor principal crea copias del registro, un trabajo las transfiere por un recurso compartido y otros las restauran en servidores en espera. Un monitor sigue estado e historial.
El trasvase es un patrón DR desacoplado basado en copia y restauración nativas.
Tiene larga historia y administración simple.
Tolera redes que no admiten replicación sincrónica.
Frecuencia y demora hacen explícito el RPO.
Puede proteger una FCI en otro sitio.
Resumen del tema
El trasvase es adecuado cuando se aceptan sencillez, tolerancia de red y un RPO distinto de cero.
28. Site Recovery es una alternativa amplia de DR a nivel de VM
Si no se desea una topología específica de SQL Server, Site Recovery orquesta la VM completa y otras cargas admitidas. Forma parte de y puede cumplir cuando los RTO y RPO medidos encajan.
Site Recovery protege la capa de máquina virtual entre regiones.
Los especialistas suelen preferir replicación de base para un RPO menor y transaccional. Decide con objetivos probados.
Resumen del tema
Site Recovery es atractivo para recuperación amplia de VM; un diseño centrado en base puede ofrecer punto transaccional más preciso.
29. HADR híbrido extiende la arquitectura fuera de una nube
Una solución híbrida distribuye recursos entre y el entorno local u otra nube. HADR híbrido tradicional es principalmente porque las funciones de SQL Server abarcan ubicaciones. suele exponer patrones administrados de .
Una excepción es replicación transaccional desde un publicador local o externo hacia un suscriptor , no al revés. Puede apoyar migración, pero suele usar como destino DR de un sistema local.
Resumen del tema
HADR híbrido suele usar como ubicación de recuperación, con excepciones limitadas de integración .
30. La red determina si los objetivos híbridos son creíbles
Una réplica AG en también depende de directorio, , rutas, seguridad y acceso operativo. Poco ancho de banda o latencia inestable amplía el retraso e incumple RTO y RPO.
aporta conectividad privada predecible cuando se justifica. Si no, usa de sitio a sitio segura mediante . No expongas VM de base directamente a Internet.
puede recibir copias de base como destino de recuperación o archivo frío aunque no exista otra topología híbrida.
Resumen del tema
Modela ancho de banda, latencia, rutas, identidad y seguridad; una réplica híbrida depende de su conectividad.
31. Comprobación de conocimientos
Comprueba tu comprensión antes de ver las respuestas.
Pregunta
Opciones
¿Qué describe RPO?
A. Número de nodos · B. Punto hasta el que recuperar datos · C. Restauración parcial
¿Qué hace híbrida una solución?
A. más entorno local u otra nube · B. Dos motores · C. Dos versiones SQL
¿Qué queda tras conmutación a nivel de base?
A. Todos los objetos · B. Bases y trabajos · C. Contenido protegido; objetos externos requieren tratamiento
Respuestas y fundamento
1 — B. RPO es el punto aceptable y la ventana de pérdida.
2 — A. Híbrido describe límites de ubicación, no mezcla de software.
3 — C. Las funciones de base protegen contenido y cambios registrados; objetos de instancia necesitan otro proceso.
Resumen del tema
Recuerda: RPO trata datos, híbrido trata ubicaciones y la protección de base excluye objetos externos.
32. Construye una decisión HADR defendible
Documenta RTO/RPO separados de HA y DR para aplicación y dependencias.
Elige o comprendiendo control y responsabilidad.
Alinea protección de instancia o base con los objetos que deben sobrevivir.
Combina protección SQL y aislamiento de fallos .
Elige alcance local, zonal, regional o híbrido según los fallos.
Diseña , reintentos, cuórum, testigos, identidad, , rutas y capacidad.
Automatiza y ensaya conmutación, restauración y retorno.
Reevalúa costo, riesgo y metas cuando cambie la carga.
Resumen del tema
Una arquitectura HADR sólida relaciona cada producto con un escenario, meta medible, mapa de dependencias y evidencia probada.