Arquitecturas de respaldo (backup) #
Introducción #
Los sistemas de backup permiten grabar en cinta los datos en un determinado instante de tiempo. A diferencia de las copias en tiempo real, los datos no se copian en las cintas a medida que se escriben en los sistemas de almacenamiento “on-line”, sino que se realiza una copia completa con la periodicidad que se desee y con las aplicaciones paradas, sin realizar escrituras en los sistemas de almacenamiento.
Frente a los sistemas de réplica en tiempo real presenta la desventaja de tener una imagen de los datos de un instante fijo anterior en el tiempo, pero tiene como principales ventajas la posibilidad de mantener varias copias de varios instantes de tiempo (por ejemplo, todas las noches del último mes) en distintas cintas y poder recuperar la que se desee y además la de representar un estado coherente de los datos a nivel de aplicación, al detener las aplicaciones antes de hacer el backup.
En el caso de la réplica síncrona en tiempo real se garantiza que el estado de los datos en el centro remoto es idéntico al local a nivel de bloque, pero no a nivel de S.O. o aplicación. Un fallo en el centro local es similar a una parada brusca de un servidor respecto a sus discos internos.
Todo aquello que las aplicaciones y el S.O. tuviesen en caché y no hubiesen volcado aún al disco se pierde y por lo tanto la imagen del disco tanto local como remoto, a pesar de ser idénticos a nivel de bit, pueden no ser coherentes a nivel de aplicación. En cambio, si en un backup se paran las aplicaciones (o se fuerza que escriban todos los datos a disco), la copia que se realiza será consistente a nivel de operación de E/S y a nivel de aplicación.
Sin embargo, el tener que mantener las aplicaciones paradas durante la realización del backup, en lo que se denomina ventana de backup, hace que la duración del mismo sea crítica. Una situación típica es la de parar la producción todas las noches durante el tiempo que dure la realización del backup y volcar todos los datos en cinta. Esta es una de las razones que potencian la existencia de opciones de backup que limitan este problema:
• Por un lado, cada vez más aplicaciones permiten la realización de backup de sus datos “en caliente”, sin necesidad de parar sus servicios, aunque siempre existirá un impacto en su rendimiento.
• Por otro lado, existe la posibilidad de hacer backup a disco (directamente o utilizando los virtualizadores de cinta). Estos dispositivos reciben el backup como si fuesen cintas pero en realidad lo están enviando a disco, con lo que el tiempo de respuesta es mucho mayor. Cuando acaba el backup se reanuda la producción y a partir de ese momento el virtualizador puede volcar los datos a cinta sin restricciones temporales.
Para la realización automática de backups de dispositivos NAS o de servidores de ficheros existe un protocolo estándar denominado NDMP (Network Data Management Protocol) que permite separación de los caminos de control y de datos, de forma que el backup puede ser gestionado desde un servidor central de backup mientras que los datos viajan directamente del servidor de ficheros a las unidades de cinta, pudiendo pasar directamente por la SAN sin tener que hacer uso de la LAN, como ocurriría en el caso de que el servidor de backup tuviese que recabar los datos de los servidores de ficheros para posteriormente enviarlos a las unidades de cinta.
Figura 71. Arquitectura general de solución de backup.
Las cintas presentan un modo secuencial de acceso a los datos frente al modo aleatorio de los discos, por lo que la tecnología de cintas es intrínsecamente más lenta que la de disco, aunque si la aplicación solamente requiere acceso secuencia (por ejemplo, un backup) esa diferencia puede verse reducida. Las unidades de cinta pueden estar agrupadas en librerías, de forma que un servidor dispone de varias unidades sobre las que cargar los cartuchos.
Las librerías manuales están en desuso en los centros de datos, siendo sustituidas por librerías automáticas, o robots, en los que un brazo mecánico selecciona las cintas y las introduce o saca de las unidades de cinta. También está la opción de Librería de Cintas Virtual, que realmente son discos de bajo coste como soporte intermedio para un backup más rápido.
Políticas de backup #
La política de backup es la definición de los diferentes aspectos de las copias de seguridad: ¿de qué se debe hacer backup? ¿Cada cuánto se realiza la copia de seguridad? ¿Qué retención deben tener? ¿Dónde se guardan las copias? ¿Cuánto tiempo es aceptable que se pueda tardar en recuperar datos? En los sucesivos apartados se analizarán los puntos clave que requieren concretarse para estableces una política de backup adecuada a las necesidades de cada sistema.
Tipos de backup En forma general y a grandes rasgos, existen 4 tipos distintos de backups. Uno de los mecanismos más extendidos para informar de los cambios de los ficheros respecto a algún backup anterior es la utilización de un bit de control. Utilizando éste u otro mecanismo equivalente, se pueden realizar los siguientes tipos de backup:
• Copia de seguridad completa: copia de seguridad total de todos los archivos y directorios seleccionados. En el caso de la copia completa, el programa borra el bit de modificado de cada archivo. Es la base para futuras tareas que solo realizan copias de seguridad de los archivos modificados.
• Copia de seguridad incremental: el programa examina el bit de modificado y hace una copia de seguridad solo de los archivos que han cambiado desde la última copia de seguridad incremental o normal. Esta tarea borrar el bit de modificado de cada archivo que copia. Utilizan la mínima cantidad de cinta y ahorran tiempo, sin embargo, realizar una restauración es un inconveniente
• Copia de seguridad diferencial: es lo mismo que una copia de seguridad incremental exceptuando que el programa no elimina el bit de modificación. Requiere más espacio en cinta y tiempo que las incrementales pero su ventaja radica en que cuando se
realiza una restauración se necesitan solo las cintas que contengan la copia de seguridad normal y la más reciente diferencial.
• Copia de seguridad intermedia: equivalente a una copia de seguridad normal, excepto que el programa no desactiva el bit de modificado. Como caso especial de copia normal se puede hacer una copia de seguridad diaria: solo copia los archivos que han sido modificados en el día en que se ejecuta la tarea sin tener en cuenta el estado del bit de modificación. Tampoco borra el bit de modificación.
Útiles cuando se quiere realizar una copia de seguridad extra en un día determinado, sin afectar a la estrategia de copia de seguridad establecida.
Figura 72. Tipos de backup.
Rotación de medios Un esquema de rotación de medios dicta cuantas cintas se usan para realizar las copias de seguridad. Un esquema popular es el método del abuelo-padre-hijo, utiliza tres generaciones de cintas que representan copias de seguridad mensual, semanal y diaria.
• Se realiza una copia de seguridad completa cada mes y se guarda la cinta durante un año (abuelo).
• Se realiza una copia de seguridad completa semanalmente y se guarda durante un mes (padre).
• Las copias de seguridad hijo se realizan diariamente y se guardan durante una semana (12+4+7=23 cintas). Las tareas diarias pueden ser copias de seguridad completa, incremental o diferencial.
Figura 73. Rotación de medios en backup.
En función de la criticidad de los datos, del espacio y del tiempo disponible, y una vez concretado el tipo de backup y la rotación de medios, se podrá establecer la política de backup correspondiente. En este momento se ha de tener en cuenta aspectos legales de retención, entorno que se salvaguarda y, en general, criticidad de la información a respaldar En la figura se muestra un ejemplo de una política de backup en función del entorno (productivo, preproductivo, test…).
Figura 74. Ejemplo de política de backup.
Tendencias #
A continuación se detallan las tendencias y novedades dentro la categoría soluciones de almacenamiento y backup:
• Las nubes híbridas predominarán. Las organizaciones comenzarán a adoptar soluciones híbridas mayoritariamente en sus infraestructuras, acabando así con las tensiones previas producidas por la elección del entorno cloud más adecuado. Además, la nube híbrida será cada vez más funcional. Las empresas trabajan tanto con almacenamiento en sus propias instalaciones como fuera de ellas (cloud híbrido).
Este será un problema mayor ya que los administradores son cada vez más conscientes de lo práctica que es la utilización de la nube para las cargas de trabajo. El almacenamiento en las propias instalaciones se suele destinar a almacenar datos orientados a las transacciones de la propia empresa. Sin embargo, la nube todavía se utiliza sobre todo para los datos inactivos, copias de seguridad y recuperación de los datos en caso de desastre en el sistema, debido a las velocidades de internet.
Sin embargo, es una tendencia que no se impondrá en las empresas cuyos sistemas son críticos, como los bancos, empresas de servicios y compañías financieras. Este tipo de organizaciones, en lugar de confiar sus activos de información a terceros, está construyendo sitios alternativos de almacenamiento -también llamados sites de contingencia- donde mantienen el nivel de operaciones en caso de que ocurra un desastre en el sistema principal.
• Almacenamiento definido por software. Durante los próximos años veremos una clara tendencia a abandonar las políticas basadas en los componentes de la infraestructura tradicional para pasar a entornos dominados por componentes de infraestructura virtual (controladores de red y de almacenamiento).
• Resurgimiento de las SMV. Las Storage Virtual Machine (máquinas virtuales de almacenamiento) ofrecerán soluciones adaptadas a los nuevos requerimientos, tanto a nivel de movilidad en los datos como en lo que se refiere a rendimiento en aplicaciones. En este sentido, las SMV simplificarán la migración de cargas de trabajo entre clústeres de almacenamiento y proporcionarán la posibilidad de contar con clústeres de almacenamiento altamente disponibles en áreas metropolitanas.
• 40 Gb, la nueva Ethernet. La siguiente evolución de las redes Ethernet – los 40 Gb –, comenzará a adoptarse en los centros de datos, aportando mayores anchos de banda y propiciando sistemas más ágiles, con mayor capacidad para mover datos entre sistemas.
• Consolidación del Big Data. Dentro del ámbito del Big Data, las empresas comenzarán a obtener datos nuevos datos que les permitan saber más sobre el comportamiento de sus consumidores, así como los procesos industriales o naturales por los que pasa. Estas medidas abrirán la puerta a nuevos entornos analíticos que extenderán el conocimiento de las compañías.
• Tecnologías:
- Deduplicación: Esta tecnología elimina de la copia todos los bloques de datos que estén repetidos, almacenando una sola copia y estableciendo enlaces a ella. Esta opción también está disponible en cabinas de almacenamiento, pero la ganancia es habitualmente mayor a la hora de realizar backups, ya que los datos se suelen repetir
con mayor frecuencia.
Figura 75. Deduplicación de datos.
- Auto-tiering: consiste en que una cabina de almacenamiento presenta un disco a los servidores y adapta su rendimiento según se lo vaya demandando cada aplicación. Crea una capa virtual que está conformado por discos de una determinada calidad (tier o capa).
La carga requerida por una determinada aplicación puede cambiar y es cuando entra en funcionamiento el auto-tiering, un mecanismo en tiempo real que continuamente posiciona los datos en la clase de almacenamiento apropiado según la frecuencia de acceso a los mismos.
Figura 76. Auto-tiering por parte de una cabina de almacenamiento.





