Récupération d'un MetroCluster

De wiki.nexiat.fr
Aller à la navigation Aller à la recherche
Fiche express
Domaine Reprise après sinistre
Fonctionnalité MetroCluster
Contexte NetApp ONTAP
Voir aussi MetroCluster · Tester la configuration du Metrocluster

Procédures de reprise d'un MetroCluster après bascule ou incident — à adapter selon le scénario rencontré.

Restreindre l'accès au vFiler défaillant

S'assurer que le vfiler impacté est bien isolé de l'autre node : soit en l'éteignant, soit en utilisant le mode fencing (déconnecter le cluster interconnect ainsi que les câbles FC adaptateur sur les nodes du site survivant).

Selon la configuration :

  • application failover : basculer les applications
  • IP failover : s'assurer que les interfaces réseau sont bien isolées du réseau public

Forcer la reprise du traitement par le node survivant

cf forcetakeover -d

Cette commande force l'état "broken" du mirror sur l'agrégat — on parle de « splitting the mirrored aggregates ».

Remonter les volumes sur le node survivant (file access : CIFS/NFS)

Depuis un client NFS sur le site survivant :

mount toaster:/vol/vol0/home /n/toaster/home

Forcer la reprise sur un vfiler en bloc access (FC/iSCSI)

  • Identifier les LUN impactées
  • Vérifier quelles LUN ne sont pas attachées :
igroup show
  • Sur la LUN survivante :
lun online /vol/vol1/lun0

Réparer les erreurs liées à la création du DR

  1. S'assurer que l'alimentation est UP
  2. S'assurer que les cartes FC, VI cluster adapters, et les ports switch sont bien UP

Rétablir le MetroCluster

Deux cas de figure possibles.

Cas typique : l'un des clusters a récupéré le takeover

# valider l'accès à l'agrégat
aggr status -r

# réallumer le node coupé, puis attendre le giveback
# déterminer quelles LUN ont survécu
aggr status

# si les agrégats sont online, les passer offline
aggr offline disaster_aggr

# recréation des agrégats
aggr mirror aggr_name -v disaster_aggr

# rétablir le contrôle
cf giveback

Rétablir la configuration du cluster à un niveau 0

Si l'agrégat mirroré avait un état de resynchronisation initial (level 0) avant le forçage du takeover, il n'est pas possible de rejoindre les deux agrégats directement — il faut recréer la synchronisation des mirroirs :

# validation de l'accès
aggr status -r

# réallumer le node coupé, puis attendre le giveback
# si les agrégats sont online, les passer offline
aggr offline disaster_aggr

# refaire la synchronisation
aggr destroy plex_name

# recréation du plex mirror
aggr mirror plex_name

# rétablir le contrôle
cf giveback

Voir aussi