Arquitectura HADR para plataformas de bases de datos: RTO, RPO, SQL Server, PaaS y soluciones híbridas
Volver a la ruta AZ-305
AZ-305Capítulo 10

Preparación para la Certificación Microsoft AZ-305

Arquitectura HADR para plataformas de bases de datos: RTO, RPO, SQL Server, PaaS y soluciones híbridas

Convierte los objetivos empresariales de recuperación en diseños de alta disponibilidad y recuperación ante desastres para SQL Server en Azure Virtual Machines, servicios de Azure SQL y entornos híbridos.

Tiempo de estudio sugerido: 82 minutos • Nivel intermedio • Reescritura original completa con resumen conciso de cada tema

Plano neón de la arquitectura HADR AZ-305 que conecta objetivos de recuperación, SQL Server, regiones de Azure e infraestructura híbrida

1. HADR comienza con los requisitos, no con un producto

La alta disponibilidad y recuperación ante desastres (HADR) de una plataforma de bases de datos es una estrategia arquitectónica, no una casilla aislada. Antes de elegir funciones de SQL Server o , determina la interrupción tolerable, los datos que pueden perderse, el alcance del error que debe resistirse y quién operará la respuesta.

Una característica puede ser técnicamente válida y aun así incumplir el objetivo empresarial. El diseño debe conectar metas de recuperación, dependencias, protección de datos, conmutación por error, red y validación periódica.

Resumen del tema

Comienza con los requisitos de recuperación y el alcance del error; elige tecnología cuando el estado deseado sea medible.

2. El RTO limita la duración aceptable de la interrupción

El objetivo de tiempo de recuperación (RTO) es el máximo tiempo permitido para devolver un recurso o solución al servicio. Superarlo puede detener el trabajo, incumplir un compromiso, generar pérdidas o sanciones.

Registra RTO por componente y de extremo a extremo. Si SQL Server vuelve en cinco minutos, pero los servidores de aplicaciones tardan 20, el usuario espera 20 minutos; la dependencia crítica más lenta gobierna el tiempo efectivo.

Resumen del tema

El RTO responde cuánto tiempo puede permanecer indisponible el servicio y debe medirse en toda la cadena de dependencias.

3. El RPO limita la pérdida de datos aceptable

El objetivo de punto de recuperación (RPO) define el punto más reciente aceptable y, por tanto, la antigüedad máxima de los datos que pueden perderse. Si el incidente ocurre a las 10:00 y el RPO es 15 minutos, la recuperación debe alcanzar las 09:45 o después.

El RPO es un objetivo de datos, no una promesa del nombre de un producto. Retraso de replicación, frecuencia de copia del registro, tiempo de copia, restauración, ritmo de carga y consistencia del punto determinan si se logra.

Línea temporal con una interrupción, la ventana de pérdida de datos RPO anterior y la ventana de restauración RTO posterior.
El RPO mira hacia atrás hasta el punto de datos aceptable; el RTO mira hacia adelante hasta el plazo de restauración.

Resumen del tema

El RPO responde hasta dónde pueden retroceder los datos; cada intervalo de protección y transferencia debe caber en esa pérdida.

4. Establece objetivos mediante negociación empresarial y técnica

Cero tiempo de inactividad y cero pérdida de datos son atractivos, pero suelen ser caros o inviables. Negocio, aplicaciones, bases de datos, infraestructura, seguridad y finanzas deben acordar metas con los mismos datos.

  • Cuantifica el costo de la inactividad y de las transacciones perdidas.
  • Haz proporcional la inversión HADR a la pérdida evitada.
  • Incluye habilidades operativas, automatización, cobertura y tiempo de dependencias.
  • Documenta metas por componente y para la solución completa.
  • Revísalas cuando cambien la carga y las consecuencias empresariales.

Resumen del tema

RTO y RPO son requisitos negociados respaldados por costo, riesgo, capacidad operativa y evidencia de dependencias.

5. Las programaciones y pruebas deben respaldar los objetivos

Una directiva puede contradecir su meta. Una copia del registro cada 30 minutos no satisface de forma fiable un RPO de 15, y una copia que tarda tres horas no cabe en un RTO de dos. Frecuencia, ancho de banda, automatización y capacidad deben bastar.

Copias y réplicas solo sirven si se recuperan. Ensaya conmutación planeada y no planeada, restauración, conmutación por recuperación, reconexión y dependencias; registra los valores observados.

Resumen del tema

Alinea intervalos y transferencias con las metas y demuéstralo mediante ejercicios recurrentes.

6. Alta disponibilidad y recuperación ante desastres necesitan metas distintas

Alcances de disponibilidad y respuesta.
DimensiónAlta disponibilidadRecuperación ante desastres
Error típicoNodo, proceso, host, bastidor o zona localRegión, , sitio o dependencia amplia
RecuperaciónConmutación rápida a una réplica o nodo local activoActivar otra ubicación y restablecer dependencias
EscalaSegundos o minutosMinutos, horas o más
ObjetivoMantener continuidad localRestablecer el servicio tras un evento amplio

Un diseño puede ayudar a ambos, pero HA local no equivale a DR regional. Documenta RTO y RPO independientes.

Resumen del tema

HA atiende interrupciones locales; DR restaura tras fallos amplios, por lo que cada alcance requiere metas y pruebas propias.

7. y reparten control y responsabilidad de forma distinta

SQL Server en es : sistema operativo e instancia son visibles y se combinan funciones del motor, clúster, almacenamiento, red y plataforma. La flexibilidad aumenta la responsabilidad.

y son . Microsoft opera los nodos y expone menos controles de disponibilidad y recuperación. El diseño prioriza configuración del servicio, resiliencia del cliente y topología regional.

Resumen del tema

ofrece máximo control con mayor operación; integra recuperación de infraestructura y expone opciones administradas.

8. La protección de instancia y de base de datos cubre objetos diferentes

Alcance de protección de SQL Server.
CaracterísticaUnidad protegidaConsecuencia
Instancia de clúster de conmutación por error (FCI) Instancia completaBases y objetos de instancia se mueven juntos; requiere almacenamiento compartido
Grupo de disponibilidad (AG) Bases seleccionadasCada réplica mantiene copia; objetos de instancia requieren sincronización
Trasvase de registrosBases seleccionadasCopia, transferencia y restauración protegen datos; abstracción y objetos externos son manuales

Inicios de sesión, trabajos del Agente SQL Server, servidores vinculados y otros objetos externos no acompañan automáticamente la protección de base. Inclúyelos en runbooks.

Resumen del tema

Conoce la unidad protegida: las tecnologías de base de datos no reproducen automáticamente todos los objetos de instancia.

9. Los AG y las FCI dependen de un clúster subyacente

En Windows Server, AG y FCI usan el Clúster de conmutación por error de Windows Server (WSFC); en Linux, el administrador común es Pacemaker. Cuórum y ubicación del testigo forman parte del diseño, sobre todo entre sitios.

y deben estar disponibles donde dependan las identidades y nombres del clúster. Una topología regional o híbrida exige más que réplicas SQL.

Resumen del tema

Salud del clúster, cuórum, testigos, directorio y son dependencias HADR de primer nivel.

10. Una FCI protege toda la instalación

La FCI se crea al instalar SQL Server; una instancia independiente existente no puede convertirse sin más. Recibe nombre y dirección distintos de nodos y clúster. Los clientes usan esa identidad estable. En un diseño tradicional de una subred, un equilibrador de carga interno enruta al nodo activo.

En la conmutación, la instancia completa se detiene e inicia en otro nodo. Se pierden sesiones, las bases se recuperan, se revierten transacciones incompletas y los clientes resilientes reconectan. Una copia compartida mantiene consistencia de datos confirmados.

Resumen del tema

La FCI reinicia la instancia completa en otro nodo tras una identidad estable y protege el estado de instancia.

11. El almacenamiento compartido de FCI habilita y concentra riesgo

Cada nodo accede al mismo almacenamiento. Las opciones pueden incluir recursos compartidos de archivos Premium de , iSCSI, Shared Disk, Spaces Direct o productos compatibles como SIOS DataKeeper. La elección cambia latencia, cuórum, soporte, costo y fallo.

Una copia evita multiplicación, pero crea dependencia. Standard Edition admite hasta dos nodos FCI. Réplica de almacenamiento de Windows Server puede extender ciertos diseños; trasvase de registros o AG pueden proteger una FCI en otro sitio.

Resumen del tema

Las FCI simplifican la protección de instancia, pero exigen almacenamiento compartido y clúster cuidadosamente compatibles.

12. Los grupos de disponibilidad protegen copias independientes

Un AG tiene réplica principal de lectura/escritura y secundarias que reciben cambios del registro. El movimiento puede ser sincrónico para mínima pérdida o asincrónico cuando distancia y latencia lo exigen. Un agente de escucha ofrece destino estable.

Standard Edition admite un AG básico de una base y dos réplicas. Enterprise Edition permite varias bases y hasta nueve réplicas, incluidas secundarias legibles para informes, copias o comprobaciones. Se inicializan desde copia o propagación automática.

Resumen del tema

Los AG replican bases seleccionadas en copias independientes y usan un agente de escucha para desacoplar al cliente de la principal.

13. Los AG intercambian costo de almacenamiento por flexibilidad

Cada réplica guarda su copia, así que los AG evitan almacenamiento compartido y suelen conmutar más rápido que FCI, pero consumen más espacio. Cinco réplicas de una base de 1 TB requieren unos 5 TB sin sobrecarga.

La nueva principal necesita inicios de sesión, trabajos, servidores vinculados y credenciales sincronizados. Autenticación de Windows, bases independientes, infraestructura como código y sincronización controlada reducen la brecha.

Resumen del tema

Los AG eliminan almacenamiento compartido y añaden réplicas útiles, pero multiplican espacio y exigen atender dependencias de instancia.

14. El trasvase de registros es un patrón sencillo de espera

Comienza con una copia completa restaurada en la secundaria como STANDBY o NORECOVERY. Trabajos programados respaldan el registro principal, copian el archivo y lo restauran. Es simple y tolera redes débiles.

Suele servir para DR, no HA instantánea. La activación imprevista puede perder transacciones posteriores al último registro aplicado y no hay agente de escucha. Un alias puede reducir el cambio de nombre.

Resumen del tema

El trasvase ofrece DR económico mediante copia, transferencia y restauración, con intervalo de pérdida medible y activación manual.

15. Los conjuntos de disponibilidad reducen fallos correlacionados del host

Un conjunto aplica antiafinidad y distribuye VM por dominios de error y actualización. Los primeros separan alimentación y red; los segundos separan grupos que puede reiniciar juntos durante mantenimiento. El módulo representa hasta tres dominios de error en un .

Tres dominios de error de Azure con máquinas virtuales distribuidas entre dominios de actualización.
Los conjuntos de disponibilidad separan VM por dominios de error y actualización en un .

Resumen del tema

Los conjuntos protegen réplicas de VM frente a eventos correlacionados de hardware y mantenimiento dentro de un .

16. La colocación de plataforma no corrige errores del invitado

Conjuntos y zonas no entienden transacciones SQL ni recuperan fallos del sistema operativo o motor. Combina colocación con AG, FCI, trasvase, copia de seguridad u otra protección consciente de la carga.

En una aplicación multicapa, aísla cada capa: web, base y VM de , por ejemplo. Una VM no puede estar simultáneamente en conjunto y zona.

Resumen del tema

La colocación limita el radio de infraestructura; los fallos del invitado y datos requieren protección de carga.

17. Las zonas de disponibilidad protegen frente al fallo del

Una zona es una ubicación física separada dentro de una región admitida. Distribuir réplicas en zonas 1, 2 y 3 puede resistir la pérdida de un centro. Los números son lógicos por suscripción; dos “zona 1” no prueban colocación física.

La distancia añade latencia. Prueba la carga antes de asumir que la confirmación sincrónica cumplirá; suele ser inferior a un milisegundo, pero el camino real decide. también admite redundancia de zona.

Resumen del tema

Las zonas amplían aislamiento al , pero su latencia debe validarse contra replicación y rendimiento.

18. replica la VM, no el protocolo de la base

replica continuamente una VM entre regiones y orquesta conmutación y recuperación. Protege muchas cargas y sirve si el método centrado en VM satisface los objetivos.

No interpreta límites transaccionales de SQL Server. La VM puede cumplir RTO y sus datos incumplir RPO. El material proporcionado citaba un RTO mensual de dos horas; la documentación actual de indica un de RTO de una hora para conmutación de VM. Trata estas cifras como datos sujetos a cambio y valida la recuperación completa.

Resumen del tema

Site Recovery ofrece recuperación regional de VM; consistencia de base y RPO requieren validación de la carga.

19. incluye alta disponibilidad local

ofrece de 99,99% en configuraciones admitidas y conmutación de nodo integrada. Las transacciones confirmadas persisten sincrónicamente. Si un nodo falla, el servicio activa otro proceso y adjunta almacenamiento.

Conexiones y transacciones en curso pueden interrumpirse. Las aplicaciones requieren reintentos limitados, idempotencia cuando proceda y control de tiempo de espera para errores transitorios.

Resumen del tema

oculta el reemplazo del nodo, pero la aplicación debe tolerar conexiones interrumpidas y errores transitorios.

20. La replicación geográfica y los grupos de conmutación resuelven DR regional

admite replicación geográfica activa; los grupos de conmutación por error coordinan bases de o . Réplicas legibles descargan informes y mantienen copia regional.

El agente de escucha conserva de lectura/escritura y solo lectura durante la conmutación. Región, retraso, directiva, dependencias y retorno siguen perteneciendo al diseño.

Resumen del tema

Usa replicación geográfica activa o grupos de conmutación para extender entre regiones con estable.

21. La recuperación acelerada de bases de datos acorta la recuperación del motor

y no exponen OFFLINE o EMERGENCY como SQL Server autoadministrado. opera el servicio; RESTRICTED_USER y conexión de administrador dedicada siguen disponibles donde se admiten.

Accelerated Database Recovery (ADR) usa un almacén de versiones persistente y truncamiento agresivo para hacer predecible la reversión y el reinicio. Está habilitada por defecto y contribuye a disponibilidad.

Resumen del tema

ADR reduce la penalización de transacciones largas y apoya el modelo de disponibilidad administrado.

22. Los controles administrados de consistencia complementan la redundancia

mantiene copias y respaldos locales y regionales, valida copia/restauración y detecta lecturas obsoletas o escrituras perdidas. CHECKSUM está activo, DBCC CHECKDB puede ejecutarse sin reparación y se intenta reparar páginas automáticamente.

La plataforma repara sin aviso si no hay impacto y notifica proactivamente si lo hay. Reduce riesgo, pero no elimina validación de aplicación y ejercicios.

Resumen del tema

Redundancia, integridad, reparación de páginas y alertas protegen juntas la consistencia en servicios .

23. Un AG de región única es un diseño común de HA

VM de SQL Server principal y secundaria pueden estar en límites separados, unirse a WSFC y exponerse con agente de escucha. Copias independientes protegen datos y permiten mantenimiento con cambio controlado.

Topología de una región con dos réplicas SQL Server en grupo de disponibilidad, agente de escucha, directorio y límites separados.
Un AG regional combina colocación de VM y replicación de base de datos.
  • Varias copias reducen el fallo de almacenamiento único.
  • Confirmación sincrónica puede minimizar pérdida confirmada.
  • El agente de escucha normaliza el acceso.
  • No requiere almacenamiento de base compartido.

Resumen del tema

Un AG regional es sólido cuando se necesitan copias independientes, conmutación rápida y escucha estable.

24. Una FCI regional favorece la integridad de la instancia

Una FCI en dos VM puede usar Spaces Direct u otra opción compatible, WSFC, red virtual y enrutamiento. Es útil cuando proteger la instancia completa importa más que copias independientes.

Dos máquinas virtuales SQL Server en una instancia de clúster de conmutación por error con almacenamiento compartido y equilibrador Azure.
La FCI mantiene una copia compartida y mueve la instancia entre nodos.
  • Las aplicaciones usan una identidad en clúster.
  • El mantenimiento puede mover el servicio.
  • Cumple muchas metas HA, pero no DR regional por sí sola.
  • Almacenamiento compartido y soporte son críticos.

Resumen del tema

Elige FCI cuando continuidad de instancia y copia compartida encajen, y añade un mecanismo separado de DR.

25. Un AG multirregional o híbrido puede ofrecer HA y DR

Un AG tradicional puede abarcar regiones o conectar el entorno local con mientras las réplicas permanecen en un WSFC. Se parece a un AG entre dos centros y funciona en Standard y Enterprise según sus límites.

Un clúster de conmutación por error de Windows Server entre dos ubicaciones con réplicas principal y secundarias.
El AG extendido usa un clúster y un grupo entre regiones o entornos híbridos.

Conectividad, cuórum, testigo, y en cada ubicación son esenciales. Una partición de red convierte el clúster extendido en riesgo central.

Resumen del tema

El AG extendido puede cubrir HA y DR con una función, pero el clúster y las dependencias entre sitios deben permanecer sanos.

26. Un AG distribuido separa dominios de fallo de clúster

Un grupo de disponibilidad distribuido, introducido en SQL Server 2016 Enterprise Edition, une dos AG independientes. La principal global envía cambios al reenviador, que también es principal del segundo AG y sincroniza su secundaria.

Dos clústeres independientes con grupos de disponibilidad conectados mediante principal global y reenviador.
Un AG distribuido es un AG de AG y separa cuórum y testigo por ubicación.

Cada clúster conserva cuórum y testigo. La sincronización se reparte, funciona en o híbrido y facilita un retorno planificado sin un WSFC único entre sitios.

Resumen del tema

Los AG distribuidos aíslan clúster y cuórum y extienden replicación Enterprise entre ubicaciones.

27. El trasvase de registros sigue siendo una arquitectura práctica de DR

El servidor principal crea copias del registro, un trabajo las transfiere por un recurso compartido y otros las restauran en servidores en espera. Un monitor sigue estado e historial.

Flujo de trasvase con trabajo de copia principal, recurso compartido, trabajos de copia y restauración, secundarias y monitor.
El trasvase es un patrón DR desacoplado basado en copia y restauración nativas.
  • Tiene larga historia y administración simple.
  • Tolera redes que no admiten replicación sincrónica.
  • Frecuencia y demora hacen explícito el RPO.
  • Puede proteger una FCI en otro sitio.

Resumen del tema

El trasvase es adecuado cuando se aceptan sencillez, tolerancia de red y un RPO distinto de cero.

28. Site Recovery es una alternativa amplia de DR a nivel de VM

Si no se desea una topología específica de SQL Server, Site Recovery orquesta la VM completa y otras cargas admitidas. Forma parte de y puede cumplir cuando los RTO y RPO medidos encajan.

Azure Site Recovery replicando una carga de la región principal a otra con prueba, conmutación y recuperación.
Site Recovery protege la capa de máquina virtual entre regiones.

Los especialistas suelen preferir replicación de base para un RPO menor y transaccional. Decide con objetivos probados.

Resumen del tema

Site Recovery es atractivo para recuperación amplia de VM; un diseño centrado en base puede ofrecer punto transaccional más preciso.

29. HADR híbrido extiende la arquitectura fuera de una nube

Una solución híbrida distribuye recursos entre y el entorno local u otra nube. HADR híbrido tradicional es principalmente porque las funciones de SQL Server abarcan ubicaciones. suele exponer patrones administrados de .

Una excepción es replicación transaccional desde un publicador local o externo hacia un suscriptor , no al revés. Puede apoyar migración, pero suele usar como destino DR de un sistema local.

Resumen del tema

HADR híbrido suele usar como ubicación de recuperación, con excepciones limitadas de integración .

30. La red determina si los objetivos híbridos son creíbles

Una réplica AG en también depende de directorio, , rutas, seguridad y acceso operativo. Poco ancho de banda o latencia inestable amplía el retraso e incumple RTO y RPO.

aporta conectividad privada predecible cuando se justifica. Si no, usa de sitio a sitio segura mediante . No expongas VM de base directamente a Internet.

puede recibir copias de base como destino de recuperación o archivo frío aunque no exista otra topología híbrida.

Resumen del tema

Modela ancho de banda, latencia, rutas, identidad y seguridad; una réplica híbrida depende de su conectividad.

31. Comprobación de conocimientos

Comprueba tu comprensión antes de ver las respuestas.
PreguntaOpciones
¿Qué describe RPO?A. Número de nodos · B. Punto hasta el que recuperar datos · C. Restauración parcial
¿Qué hace híbrida una solución?A. más entorno local u otra nube · B. Dos motores · C. Dos versiones SQL
¿Qué queda tras conmutación a nivel de base?A. Todos los objetos · B. Bases y trabajos · C. Contenido protegido; objetos externos requieren tratamiento

Respuestas y fundamento

  • 1 — B. RPO es el punto aceptable y la ventana de pérdida.
  • 2 — A. Híbrido describe límites de ubicación, no mezcla de software.
  • 3 — C. Las funciones de base protegen contenido y cambios registrados; objetos de instancia necesitan otro proceso.

Resumen del tema

Recuerda: RPO trata datos, híbrido trata ubicaciones y la protección de base excluye objetos externos.

32. Construye una decisión HADR defendible

  • Documenta RTO/RPO separados de HA y DR para aplicación y dependencias.
  • Elige o comprendiendo control y responsabilidad.
  • Alinea protección de instancia o base con los objetos que deben sobrevivir.
  • Combina protección SQL y aislamiento de fallos .
  • Elige alcance local, zonal, regional o híbrido según los fallos.
  • Diseña , reintentos, cuórum, testigos, identidad, , rutas y capacidad.
  • Automatiza y ensaya conmutación, restauración y retorno.
  • Reevalúa costo, riesgo y metas cuando cambie la carga.

Resumen del tema

Una arquitectura HADR sólida relaciona cada producto con un escenario, meta medible, mapa de dependencias y evidencia probada.

Referencias oficiales de Microsoft Learn

  1. Continuidad empresarial, alta disponibilidad y recuperación ante desastres para SQL Server en VM de
  2. Grupos de disponibilidad para SQL Server en
  3. Opciones de disponibilidad para máquinas virtuales de
  4. Acerca de
  5. Información general de grupos de conmutación por error de
  6. Recuperación acelerada de bases de datos
  7. Documentación de
  8. Documentación de

Resumen del tema

Usa la documentación actual de Microsoft Learn para validar soporte, límites, disponibilidad regional e implementación antes del diseño de producción.