Récupération d'un MetroCluster
| Fiche express | |
|---|---|
| Domaine | Reprise après sinistre |
| Fonctionnalité | MetroCluster |
| Contexte | NetApp ONTAP |
| Voir aussi | MetroCluster · Tester la configuration du Metrocluster |
Procédures de reprise d'un MetroCluster après bascule ou incident — à adapter selon le scénario rencontré.
Restreindre l'accès au vFiler défaillant
S'assurer que le vfiler impacté est bien isolé de l'autre node : soit en l'éteignant, soit en utilisant le mode fencing (déconnecter le cluster interconnect ainsi que les câbles FC adaptateur sur les nodes du site survivant).
Selon la configuration :
- application failover : basculer les applications
- IP failover : s'assurer que les interfaces réseau sont bien isolées du réseau public
Forcer la reprise du traitement par le node survivant
cf forcetakeover -d
Cette commande force l'état "broken" du mirror sur l'agrégat — on parle de « splitting the mirrored aggregates ».
Remonter les volumes sur le node survivant (file access : CIFS/NFS)
Depuis un client NFS sur le site survivant :
mount toaster:/vol/vol0/home /n/toaster/home
Forcer la reprise sur un vfiler en bloc access (FC/iSCSI)
- Identifier les LUN impactées
- Vérifier quelles LUN ne sont pas attachées :
igroup show
- Sur la LUN survivante :
lun online /vol/vol1/lun0
Réparer les erreurs liées à la création du DR
- S'assurer que l'alimentation est UP
- S'assurer que les cartes FC, VI cluster adapters, et les ports switch sont bien UP
Rétablir le MetroCluster
Deux cas de figure possibles.
Cas typique : l'un des clusters a récupéré le takeover
# valider l'accès à l'agrégat
aggr status -r
# réallumer le node coupé, puis attendre le giveback
# déterminer quelles LUN ont survécu
aggr status
# si les agrégats sont online, les passer offline
aggr offline disaster_aggr
# recréation des agrégats
aggr mirror aggr_name -v disaster_aggr
# rétablir le contrôle
cf giveback
Rétablir la configuration du cluster à un niveau 0
Si l'agrégat mirroré avait un état de resynchronisation initial (level 0) avant le forçage du takeover, il n'est pas possible de rejoindre les deux agrégats directement — il faut recréer la synchronisation des mirroirs :
# validation de l'accès
aggr status -r
# réallumer le node coupé, puis attendre le giveback
# si les agrégats sont online, les passer offline
aggr offline disaster_aggr
# refaire la synchronisation
aggr destroy plex_name
# recréation du plex mirror
aggr mirror plex_name
# rétablir le contrôle
cf giveback
Voir aussi
- MetroCluster — présentation et architecture
- Tester la configuration du Metrocluster — valider le fonctionnement après une reprise