04 28 29 40 72 Devis gratuit
Explicatif · Stockage

Qu'est-ce que le RAID ?

Définition, comparaison des niveaux, ce qui se passe réellement pendant une reconstruction. Et surtout la mise au point qui évite les sinistres : le RAID protège d'une panne de disque, pas de la perte de données. Ce sont deux problèmes différents.

Par , fondateur d'Infranat Publié le

Définition

Le RAID, pour Redundant Array of Independent Disks, est une technique qui regroupe plusieurs disques pour qu'ils se comportent comme un seul volume, en répartissant les données entre eux. Selon la méthode de répartition choisie, l'objectif est d'augmenter la capacité, d'accélérer les accès, de survivre à la panne d'un disque, ou une combinaison des trois.

Sa raison d'être est la disponibilité : qu'un disque puisse mourir sans que le serveur s'arrête. Ce n'est pas de conserver une copie de vos données dans le temps.

Cette distinction entre disponibilité et conservation paraît théorique. Elle est en réalité à l'origine de la majorité des pertes de données définitives que nous constatons en intervention. Un dirigeant nous dit « nous sommes en RAID, nous sommes protégés », et il a raison sur un point précis et faux sur tous les autres.

Les deux mécanismes à comprendre

Tous les niveaux de RAID se construisent à partir de deux idées, parfois combinées :

  • Le miroir. La même donnée est écrite intégralement sur deux disques. Si l'un tombe, l'autre contient tout. C'est simple, sûr, et coûteux : vous payez deux disques pour la capacité d'un.
  • La parité. La donnée est découpée en tranches réparties sur plusieurs disques, auxquelles on ajoute une information de contrôle calculée à partir des autres. Si un disque disparaît, son contenu peut être recalculé depuis ce qui reste. On sacrifie l'équivalent d'un disque au lieu de la moitié de l'espace.

C'est tout. La variété des niveaux n'est qu'un arbitrage entre l'espace utile, la vitesse, et le nombre de disques dont on accepte la perte simultanée.

Les niveaux de RAID, comparés

Cinq niveaux couvrent la quasi-totalité des cas en PME. Les autres sont des variantes ou des curiosités historiques.

Niveau Disques minimum Capacité utile Pannes tolérées Usage typique
RAID 0 2 100 % Aucune Jamais pour des données qui comptent. La panne d'un seul disque détruit l'ensemble du volume, et le risque augmente avec le nombre de disques.
RAID 1 2 50 % 1 disque Disque système d'un serveur, petit NAS. Simple et robuste, reconstruction rapide et peu risquée.
RAID 5 3 (n−1)/n 1 disque Le plus répandu historiquement. À éviter aujourd'hui avec de gros disques, pour la raison expliquée plus bas.
RAID 6 4 (n−2)/n 2 disques Le choix raisonnable pour un stockage de volume avec des disques de grande capacité.
RAID 10 4 50 % 1 par miroir Bases de données et machines virtuelles. Le plus performant en écriture, et la reconstruction la plus sûre.

Dans la colonne capacité, n désigne le nombre de disques. Six disques en RAID 6 offrent donc l'espace utile de quatre.

Le moment critique : la reconstruction

Un disque tombe, le voyant passe au rouge, le serveur continue de fonctionner. On remplace le disque et le système reconstruit les données manquantes. C'est le scénario attendu, et il se déroule souvent ainsi. Mais c'est aussi le moment où un RAID est le plus fragile, et c'est contre-intuitif.

Pourquoi RAID 5 a cessé d'être recommandé

Pendant la reconstruction d'un RAID 5, le contenu du disque disparu est recalculé à partir de tous les autres disques, intégralement lus. Deux conséquences se cumulent.

D'abord la durée. Avec des disques de plusieurs téraoctets, une reconstruction se compte en heures, souvent en dizaines d'heures, d'autant plus si le serveur continue de travailler pendant ce temps. Pendant toute cette fenêtre, le volume n'a plus aucune redondance : la panne d'un deuxième disque signifie la perte totale.

Ensuite la sollicitation. Les disques restants sont lus de bout en bout, sans répit, alors qu'ils ont le même âge, viennent souvent du même lot et ont subi la même charge que celui qui vient de mourir. C'est précisément le moment où un deuxième est le plus susceptible de céder. S'y ajoute le risque d'une erreur de lecture irrécupérable sur un secteur : sur un RAID 5 dégradé, un seul secteur illisible peut suffire à faire échouer la reconstruction.

La recommandation que nous appliquons

Au-delà de disques de 2 To, nous ne déployons plus de RAID 5. Nous utilisons RAID 6 pour le stockage de volume, qui survit à une seconde panne pendant la reconstruction, et RAID 10 pour tout ce qui demande des performances en écriture, dont la reconstruction consiste à recopier un seul disque plutôt qu'à relire l'ensemble.

Le disque de secours, et le piège du lot identique

Un spare, disque de secours déjà présent dans la machine, permet à la reconstruction de démarrer dans la minute au lieu d'attendre l'intervention humaine. Sur un RAID 5, ce gain de temps change réellement les probabilités.

En revanche, acheter tous les disques dans le même lot au même moment concentre les défaillances : des disques issus de la même série, mis en service le même jour et soumis à la même charge ont tendance à tomber dans la même période. Mélanger les lots, voire les références, est un détail qui ne coûte rien et qui écarte une corrélation.

Les cinq sinistres contre lesquels le RAID ne protège pas

Dans chacun de ces cas, le RAID fonctionne parfaitement et les données sont perdues quand même. C'est tout le problème.

  • La suppression. Un fichier effacé par erreur est effacé sur tous les disques en même instant. Le miroir reproduit fidèlement la suppression : c'est son travail.
  • Le rançongiciel. Le chiffrement des fichiers est une écriture légitime du point de vue du RAID, qui la réplique consciencieusement. Un RAID 6 vous garantit de disposer de vos données chiffrées en haute disponibilité.
  • La corruption applicative. Une base de données qui se corrompt, une mise à jour qui détruit une structure : le RAID écrit ce qu'on lui donne, sans jamais juger du contenu.
  • Le sinistre physique. Incendie, dégât d'eau, vol, surtension. Tous les disques sont dans le même boîtier, dans la même pièce. Aucune redondance interne ne résiste à la disparition du contenant.
  • La défaillance de la carte RAID elle-même. Les disques sont intacts mais leur organisation était connue du seul contrôleur. Sans contrôleur identique ou compatible, le volume peut devenir illisible alors qu'aucun disque n'a lâché.

À cette liste s'ajoute un sixième cas, le plus banal : le besoin de revenir en arrière. Retrouver la version d'un document telle qu'elle était la semaine dernière est une demande quotidienne, et le RAID n'a aucune notion d'historique. Il ne connaît que l'état présent.

La formule à retenir

Le RAID répond à la question « que se passe-t-il si un disque tombe ? ». La sauvegarde répond à la question « que se passe-t-il si les données sont perdues, abîmées ou chiffrées ? ». Les deux sont nécessaires, et aucune ne remplace l'autre. Notre guide de la sauvegarde en entreprise détaille la règle 3-2-1 qui répond à la seconde question.

RAID matériel, logiciel, et faux RAID

Trois implémentations coexistent, et la distinction a des conséquences très concrètes le jour d'une panne.

Le RAID matériel repose sur une carte contrôleur dédiée, avec son propre processeur et souvent une mémoire cache protégée par batterie. Il décharge le système, tient la charge, et permet le remplacement d'un disque à chaud. Sa limite est la dépendance : la configuration vit dans le contrôleur, et perdre celui-ci sans pièce équivalente peut rendre le volume inexploitable.

Le RAID logiciel est assuré par le système d'exploitation. Les implémentations modernes sont fiables et, surtout, indépendantes du matériel : les disques peuvent être déplacés vers une autre machine et le volume réassemblé. Les systèmes de fichiers qui intègrent la gestion du stockage y ajoutent la détection des corruptions silencieuses, ce qu'un contrôleur classique ne sait pas faire.

Le faux RAID, enfin, est la fonction présente dans les cartes mères d'entrée de gamme. Elle annonce du RAID matériel mais fait tout exécuter par le processeur, via un pilote, avec les inconvénients des deux approches et les avantages d'aucune. À éviter sur un serveur de production.

Les six points à vérifier sur votre RAID

Ce que nous contrôlons sur chaque serveur lors d'un audit informatique.

  • Quelqu'un voit-il l'alerte ? C'est le premier point, et le plus souvent défaillant. Un disque mort depuis des mois avec un voyant rouge que personne ne regarde transforme la redondance en illusion. L'état du RAID doit remonter dans une supervision, pas sur une façade dans un local technique.
  • Le niveau est-il adapté à la taille des disques ? Un RAID 5 de disques de 8 To est un risque assumé, et il est rarement assumé en connaissance de cause.
  • Existe-t-il un disque de secours ? Et un disque de rechange disponible physiquement, pas seulement commandable sous huit jours.
  • La batterie du cache du contrôleur est-elle vivante ? Elle a une durée de vie limitée. Morte, elle expose à une corruption en cas de coupure brutale, ce qui renvoie au dimensionnement de l'onduleur.
  • Une vérification périodique est-elle programmée ? Le contrôleur doit relire l'ensemble du volume régulièrement, pour découvrir un secteur illisible pendant que la redondance existe encore, plutôt qu'au milieu d'une reconstruction.
  • Une sauvegarde existe-t-elle, hors de la machine, et a-t-elle été restaurée pour de vrai ? Le RAID n'y change rien.

Questions fréquentes

Qu'est-ce que le RAID en informatique ?

Le RAID est une technique qui regroupe plusieurs disques pour qu'ils se comportent comme un seul volume, en répartissant les données entre eux. Selon la méthode choisie, l'objectif est d'augmenter la capacité, d'accélérer les accès ou de survivre à la panne d'un disque. L'acronyme signifie Redundant Array of Independent Disks.

Le RAID est-il une sauvegarde ?

Non, et c'est la confusion la plus coûteuse en entreprise. Le RAID protège de la panne d'un disque, pas de la perte de données. Il réplique fidèlement une suppression accidentelle, un chiffrement par rançongiciel ou une corruption de base, puisqu'il ne juge jamais du contenu de ce qu'il écrit. Il ne protège pas non plus d'un incendie, d'un vol ou d'une surtension, tous les disques étant dans le même boîtier, et il n'a aucune notion d'historique permettant de revenir à la version de la semaine dernière.

Quel niveau de RAID choisir pour une PME ?

RAID 1 pour le disque système d'un serveur ou un petit NAS. RAID 10 pour les bases de données et les machines virtuelles, qui demandent des performances en écriture. RAID 6 pour le stockage de volume avec des disques de grande capacité. RAID 0 n'a aucune place sur des données qui comptent, et RAID 5 n'est plus recommandé au-delà de disques de 2 To.

Pourquoi éviter le RAID 5 aujourd'hui ?

Parce que la reconstruction impose de relire intégralement tous les disques restants. Avec de gros disques, cela prend des heures voire des dizaines d'heures, pendant lesquelles le volume n'a plus aucune redondance. Les disques sollicités ont le même âge et la même usure que celui qui vient de mourir, ce qui en fait le moment le plus probable pour une seconde panne. Un seul secteur illisible peut en outre faire échouer la reconstruction.

Combien de disques peuvent tomber sans perte de données ?

Aucun en RAID 0. Un en RAID 1 et en RAID 5. Deux en RAID 6. En RAID 10, un disque par miroir, ce qui peut représenter plusieurs disques à condition qu'ils n'appartiennent pas au même miroir.

Combien de temps dure une reconstruction ?

De quelques heures à plusieurs dizaines d'heures selon la capacité des disques, le niveau de RAID et la charge du serveur pendant l'opération. Un RAID 10 reconstruit plus vite parce qu'il recopie un seul disque, là où un RAID 5 ou 6 doit relire l'ensemble du groupe pour recalculer les données manquantes.

Faut-il préférer le RAID matériel ou logiciel ?

Le RAID matériel décharge le système et permet le remplacement à chaud, mais la configuration vit dans le contrôleur : perdre celui-ci sans pièce équivalente peut rendre le volume inexploitable. Le RAID logiciel moderne est fiable et indépendant du matériel, les disques pouvant être déplacés vers une autre machine. À éviter dans tous les cas : le faux RAID des cartes mères d'entrée de gamme, qui cumule les inconvénients des deux approches.

Un NAS en RAID suffit-il à protéger mes données ?

Non. Un NAS en RAID protège de la panne d'un de ses disques, ce qui est utile, mais il reste un équipement unique dans un seul lieu. Un rançongiciel qui atteint les partages réseau chiffre ce qui s'y trouve, et un dégât des eaux emporte l'ensemble. Un NAS est un bon maillon d'une stratégie de sauvegarde, à condition d'être complété par une copie hors site et par une copie qui ne soit pas modifiable depuis le réseau.

Comment savoir si mon RAID est dégradé ?

Par la supervision, et non par un voyant. Un disque mort depuis des mois dans un local technique que personne ne visite est une situation banale, et elle transforme la redondance en illusion : le jour où un second disque tombe, tout est perdu alors que l'alerte était affichée depuis longtemps. L'état du RAID doit remonter dans un outil qui prévient quelqu'un.

Faut-il acheter tous les disques en même temps ?

Plutôt non. Des disques issus du même lot, mis en service le même jour et soumis à la même charge ont tendance à défaillir dans la même période, ce qui concentre le risque précisément pendant une reconstruction. Mélanger les lots, voire les références, ne coûte rien et écarte cette corrélation.

Quelqu'un verrait-il un disque tombé sur votre serveur ?

C'est la question qui compte, bien avant le niveau de RAID choisi. État des lieux de votre stockage et de vos sauvegardes, avec test de restauration réel, offert.

Faire vérifier mon stockage