Tout le monde prétend avoir un plan de reprise.
La différence, c’est de savoir s’il fonctionne un vendredi quelconque, quand la moitié de l’équipe est absente, que les routes sont impraticables et que l’enfant de quelqu’un est malade à la maison. Une résilience qui ne fonctionne que dans des conditions idéales, c’est juste du marketing. Un beau dépliant, probablement plastifié.
Il s’agit de passer de « nous pensons pouvoir récupérer » à « nous avons fait l’exercice et nous avons les preuves ».
Comment ça échoue réellement
La résilience ne fait pas de bruit quand elle échoue. Pas au début.
Elle échoue comme une fuite lente en janvier. Silencieusement, dans l’ombre, pendant que tout le monde est occupé à autre chose. Des sauvegardes qui s’exécutent « habituellement ». Des procédures de restauration qui n’ont pas été testées depuis que la personne qui les a rédigées a déménagé à Vancouver. Des dépendances que personne n’a cartographiées parce que le projet dépassait déjà son budget avant même que quelqu’un ne pense à poser la question.
Puis, l’échec devient bruyant. Quelqu’un trébuche dessus lors d’un incident réel et, soudain, trente personnes se retrouvent en conférence téléphonique, dont la moitié lit le manuel d’exploitation pour la première fois. Le manuel suppose que Gary est aux commandes. Gary est à Kelowna. Le manuel est une fiction.
Nous avons vu ce scénario se répéter assez souvent pour nous lasser. L’échec n’est jamais exotique. C’est toujours la même chose : ennuyeux. La dépendance que personne n’a documentée. Le test que personne n’a effectué. L’hypothèse que les mêmes personnes seraient toujours là.
Ce qui change la donne
Testez comme si c’était réel
Si vous n’avez pas testé votre reprise, vous n’avez pas de reprise. Vous avez une hypothèse. La plateforme d’orchestration de la résilience de Kyndryl exécute le basculement automatisé, la détection d’anomalies et les tests de reprise par simple bouton.[source] Voilà pour les outils. Le principe est plus ancien : les équipes entraînées récupèrent en quelques heures. Les équipes non entraînées passent la première heure à débattre de l’ordre des opérations, ce qui est une bien mauvaise façon de découvrir que votre plan comporte des lacunes.
Maîtrisez la séquence
La reprise n’est pas une question d’effort, mais d’ordre. Quels systèmes redémarrent en premier ? Qu’est-ce qui dépend de quoi ? Qui déclenche le basculement et qui confirme qu’il a réussi ? Chaque minute passée à se demander « qui fait quoi » est une minute de moins consacrée à « l’action ».
Kyndryl sauvegarde plus de 3,5 exaoctets par an pour plus de 9 000 clients répartis dans plus de 300 centres de résilience dans 60 pays.[source] Vous n’achetez pas un chiffre. Vous achetez la mémoire musculaire acquise en faisant cela des milliers de fois. La mémoire musculaire ne panique pas à 3 h du matin.
Utilisez ce qui a fait ses preuves
Des architectures de reprise basées sur Dell, Veritas, Microsoft Azure ou Cohesity, selon ce qui convient, déployées via le cadre de reprise après incident cybernétique de Kyndryl.[source] Le rôle d’ISM est d’adapter ces modèles à votre environnement spécifique. Les outils sont mondiaux. Le jugement sur la manière de les appliquer ici, avec vos transporteurs, vos exigences de conformité et votre fenêtre de maintenance du deuxième jeudi de chaque mois à 16 h, cela reste local.
Sachez où résident vos données de reprise
Voici ce qui prend les gens au dépourvu. Si vos sauvegardes sont répliquées dans une installation régie par des lois étrangères, votre plan de reprise a un problème de juridiction. Vous le découvrirez au pire moment possible. La souveraineté en matière de reprise après sinistre n’est pas une note de bas de page. C’est une décision architecturale qui détermine si votre posture de conformité survit au même incident que vos systèmes.
Le centre des opérations de sécurité (SOC) de Kyndryl à Barrie, en Ontario, signifie que les personnes qui gèrent votre incident de sécurité opèrent sous le même cadre réglementaire que vous.[source] Cet alignement est plus important lors d’un incident qu’à tout autre moment. Quand il est 2 h du matin et que tout va de travers, vous voulez que l’équipe soit dans le même pays et que les données soient dans la même juridiction. Point final.
Ce qui s’améliore
Quand la résilience est mise à l’épreuve, plutôt que tenue pour acquise :
Les pannes sont plus courtes parce que l’intervention est répétée. Les audits sont simplifiés parce que les tests sont documentés. La direction gère des risques prévisibles plutôt que des surprises. Votre équipe n’a plus à craindre chaque changement, car le rétablissement est fiable, et non théorique.
Et voici l’avantage insoupçonné : des données de rétablissement propres et gouvernées servent de base à la reconnaissance de formes et aux opérations prédictives. La même discipline qui rend la reprise après sinistre fiable est celle qui permet l’intégration future de charges de travail en IA. Faire d’une pierre deux coups, sans fla-fla.
Par quoi commencer
Répertoriez vos actifs Cartographiez les services, les dépendances et ce que signifie réellement « restaurer » pour chaque système. Pas ce qui est écrit dans la documentation technique, mais ce qui se passe un vendredi soir.
Intégrez la confidentialité au quotidien Les artefacts de rétablissement contiennent des données sensibles, parfois même des copies intégrales de la production. Traitez-les en conséquence.
Opérationnalisez la gouvernance Qui approuve un changement lié au rétablissement? Qui est responsable des tests? Où sont consignées les preuves? Centralisez le tout dans un système.
Sécurisez les données elles-mêmes Chiffrez, contrôlez les accès et surveillez les mouvements. Les sauvegardes et les répliques sont des cibles, pas des éléments secondaires.
ISM conçoit et teste le rétablissement dans des environnements sous contrôle canadien, en s’appuyant sur l’orchestration de la résilience de Kyndryl et sur des équipes locales qui connaissent parfaitement ce que « restaurer » signifie pour vos systèmes. En cas d’incident, l’intervention est répétée, les experts sont sur place et les preuves sont déjà dans le système.
Pneus d’hiver. Éprouvés sur chaussée sèche. Prêts pour les conditions difficiles.
