Sauvegarde et continuité

Si le courriel, les fichiers ou le serveur arrêtent demain

Beaucoup d’entreprises savent qu’elles ont des sauvegardes, mais ne savent pas clairement ce qui se passerait si un service essentiel cessait demain matin.

La bonne préparation ne consiste pas à imaginer chaque catastrophe possible. Elle consiste à comprendre les dépendances les plus importantes, les personnes responsables et le délai acceptable avant le rétablissement.

Voici un exercice simple à faire avec la direction et la personne responsable de la TI.

Commencer par les activités, pas par les appareils

Au lieu de demander « quel serveur avons-nous? », demandez :

  • comment les employés communiquent-ils;
  • où les documents actifs sont-ils conservés;
  • comment les factures sont-elles émises;
  • comment les commandes sont-elles reçues;
  • quelles applications sont nécessaires pour servir les clients;
  • quels systèmes contrôlent les horaires, la paie ou l’accès aux locaux;
  • quelles informations doivent être disponibles aujourd’hui, demain ou cette semaine.

Un ordinateur peut être remplacé. Une dépendance mal comprise est plus difficile à récupérer.

Scénario 1 : le courriel ne fonctionne plus

Une panne de courriel peut être une interruption de fournisseur, un problème de domaine, un compte compromis ou une mauvaise configuration.

Demandez :

  • les employés savent-ils comment signaler le problème sans courriel;
  • existe-t-il une liste de contacts hors du système principal;
  • les clients ont-ils un autre moyen de joindre l’entreprise;
  • les responsables peuvent-ils consulter l’état du service;
  • les mots de passe et comptes administratifs sont-ils accessibles;
  • les messages importants sont-ils seulement dans les boîtes personnelles;
  • les personnes clés ont-elles un canal de secours convenu.

Une entreprise qui utilise le courriel comme seul moyen de coordination doit prévoir une méthode temporaire : téléphone, messagerie secondaire, liste d’appels ou autre canal approuvé.

Scénario 2 : les fichiers partagés ne sont plus accessibles

La première question est de savoir si les fichiers sont absents, supprimés, chiffrés, verrouillés ou simplement inaccessibles à cause du réseau.

La réponse dépendra de l’emplacement : serveur local, SharePoint, OneDrive, stockage infonuagique, NAS ou application métier.

Vérifiez :

  • quelles équipes sont arrêtées;
  • quels documents sont réellement critiques;
  • si des copies récentes existent;
  • si les permissions et versions peuvent être restaurées;
  • qui autorise la récupération;
  • combien de données peuvent être perdues;
  • combien de temps la restauration peut prendre;
  • comment éviter d’écraser de bonnes données pendant l’urgence.

Une copie n’est utile que si elle est protégée, accessible aux bonnes personnes et testée.

Scénario 3 : le serveur ou l’application principale tombe en panne

Le serveur peut héberger des fichiers, une base de données, un logiciel comptable, une application spécialisée ou plusieurs rôles à la fois.

L’impact dépend davantage de ce qu’il fait que de son âge ou de sa marque.

Documentez :

  • les applications hébergées;
  • les utilisateurs dépendants;
  • les fournisseurs impliqués;
  • les licences nécessaires;
  • les comptes administratifs;
  • les sauvegardes disponibles;
  • la dernière restauration testée;
  • le matériel ou environnement de remplacement;
  • l’ordre de remise en service;
  • les vérifications à faire avant de rouvrir l’accès.

Un serveur restauré n’est pas nécessairement un service prêt. Les applications, permissions, imprimantes, intégrations et accès doivent aussi fonctionner.

Scénario 4 : Internet ou le réseau interne cesse de fonctionner

Une connexion Internet rapide ne garantit pas que le réseau est résilient.

Demandez :

  • y a-t-il un seul fournisseur ou lien;
  • les téléphones dépendent-ils d’Internet;
  • le paiement, les caméras ou l’accès aux bâtiments sont-ils touchés;
  • un partage de connexion cellulaire est-il réaliste;
  • quelles applications peuvent fonctionner hors ligne;
  • qui peut accéder au pare-feu et au fournisseur;
  • les employés savent-ils distinguer une panne locale d’une panne générale.

La solution temporaire doit être proportionnelle. Toutes les entreprises n’ont pas besoin d’une deuxième connexion, mais elles doivent connaître les conséquences de l’absence de solution de rechange.

Sauvegarde, disponibilité et continuité ne sont pas la même chose

Une sauvegarde est une copie qui peut servir à récupérer des données ou des systèmes.

Elle ne prouve pas automatiquement :

  • que le service restera disponible pendant une panne;
  • que tous les composants nécessaires sont inclus;
  • que les comptes administratifs sont accessibles;
  • que le fournisseur d’application coopérera;
  • que la restauration respecte le délai attendu;
  • que les employés savent quoi faire pendant l’attente;
  • que les données restaurées seront suffisamment récentes.

La continuité comprend les personnes, communications, procédures, fournisseurs et solutions temporaires en plus de la technologie.

Deux délais à clarifier en langage simple

Les spécialistes utilisent souvent les termes RTO et RPO. La direction peut commencer avec deux questions plus simples.

Combien de temps pouvons-nous attendre?

C’est le délai maximal acceptable avant que l’activité soit rétablie.

La réponse peut varier :

  • quelques minutes pour le paiement ou une application clinique;
  • quelques heures pour les fichiers actifs;
  • un jour pour une archive rarement utilisée.

Combien de travail pouvons-nous perdre?

C’est l’écart acceptable entre la dernière copie récupérable et le moment de l’incident.

Une sauvegarde quotidienne peut impliquer presque une journée de travail perdu. Une copie plus fréquente peut réduire cette perte, mais elle doit être testée et protégée.

Feuille d’impact rapide

Pour chaque activité importante, remplir :

| Activité | Système dépendant | Responsable | Temps acceptable sans service | Données qu’on peut perdre | Solution temporaire | Dernière preuve de récupération | | — | — | — | — | — | — | — | | Facturation | Logiciel comptable | Direction/finance | 4 heures | 1 heure | Saisie manuelle limitée | Date/test | | Documents clients | Serveur ou SharePoint | Opérations | 2 heures | 30 minutes | Copies locales approuvées | Date/test | | Courriel | Microsoft 365 | Direction/TI | 2 heures | Selon fournisseur | Téléphone/canal secondaire | Date/exercice |

Les valeurs doivent être décidées par l’entreprise, pas inventées par le fournisseur TI.

Ce qu’une preuve utile devrait montrer

Une revue sérieuse devrait produire des preuves simples :

  • liste des systèmes essentiels;
  • emplacement des sauvegardes;
  • historique récent des alertes;
  • résultat d’une restauration testée;
  • durée observée;
  • personnes qui peuvent déclencher la récupération;
  • accès administratifs récupérables;
  • ordre de remise en service;
  • dépendances externes;
  • actions correctives et responsables.

Le Centre canadien pour la cybersécurité recommande d’identifier les données critiques, de définir les rôles et de tester régulièrement les procédures de sauvegarde et de continuité.

Commencer petit, mais commencer avant l’urgence

Une PME n’a pas besoin d’un manuel de cent pages.

Elle a besoin d’une première version utilisable :

1. cinq activités essentielles; 2. les systèmes qui les soutiennent; 3. une personne responsable et une personne de relève; 4. les coordonnées des fournisseurs; 5. le temps d’arrêt acceptable; 6. la dernière preuve de restauration; 7. les trois lacunes prioritaires.

Une évaluation de sauvegarde et de reprise peut transformer ces réponses en une liste de travaux et de décisions à portée définie.

Si la reprise dépend de plusieurs fournisseurs, comptes, sauvegardes et personnes, une revue des TI gérées et cogérées peut clarifier qui garde le fil après l’urgence.

Communiquer avec Montréal TI pour examiner les dépendances, sauvegardes et priorités de reprise.

Ressources liées