RAID DEBIAN - RAID 1 alert SMART sir 1 disque

Hello les Zonistes,

Un peu de technique pour changer du climat , voiture électrique et AI .

J’ai un serveur , avec 2 disques nvme pour le system Debian .
Ils sont en RAID1 .

J’ai une alert smart qui remonte sur 1 de mes disques :

Device: /dev/nvme1, SMART/Health value: Percentage Used changed from 97 to 98

Device info:
SAMSUNG MZVL2512HCJQ-00B00, S/N:S675NL0X100111, FW:GXA7801Q, 512 GB

Du coup je regarde sur le serveur . Et ce que je ne comprends pas c’est pourquoi je n’ai qu’une alerte qui remonte

Les 2 disques devraient être en alerte , non ?
lsblk -i

 NAME           MAJ:MIN RM   SIZE RO TYPE  MOUNTPOINTS
 loop0            7:0    0   100G  0 loop  
 loop1            7:1    0    70G  0 loop  
 loop2            7:2    0    30G  0 loop  
 loop3            7:3    0     8G  0 loop  
 nvme0n1        259:0    0 476.9G  0 disk  
 |-nvme0n1p1    259:1    0     1G  0 part  
 | `-md0          9:0    0  1022M  0 raid1 /boot
 |-nvme0n1p2    259:2    0   256M  0 part  
 | `-md1          9:1    0 255.9M  0 raid1 /boot/efi
 `-nvme0n1p3    259:3    0 475.7G  0 part  
   `-md2          9:2    0 475.6G  0 raid1 
     |-vg0-root 252:0    0    50G  0 lvm   /
     |-vg0-swap 252:1    0     4G  0 lvm   [SWAP]
     `-vg0-home 252:2    0 421.6G  0 lvm   /var
 nvme1n1        259:4    0 476.9G  0 disk  
 |-nvme1n1p1    259:5    0     1G  0 part  
 | `-md0          9:0    0  1022M  0 raid1 /boot
 |-nvme1n1p2    259:6    0   256M  0 part  
 | `-md1          9:1    0 255.9M  0 raid1 /boot/efi
 `-nvme1n1p3    259:7    0 475.7G  0 part  
   `-md2          9:2    0 475.6G  0 raid1 
     |-vg0-root 252:0    0    50G  0 lvm   /
     |-vg0-swap 252:1    0     4G  0 lvm   [SWAP]
     `-vg0-home 252:2    0 421.6G  0 lvm   /var

Copy/paste de:

  • smartctl des deux disques
  • contenu de /proc/mdstat

Merci :slight_smile:

cat /proc/mdstat

Personalities : [raid1] [raid0] [raid6] [raid5] [raid4] [raid10] 
md2 : active raid1 nvme1n1p3[1] nvme0n1p3[0]
      498662720 blocks super 1.2 [2/2] [UU]
      bitmap: 4/4 pages [16KB], 65536KB chunk

md0 : active raid1 nvme1n1p1[1] nvme0n1p1[0]
      1046528 blocks super 1.2 [2/2] [UU]
      
md1 : active raid1 nvme1n1p2[1] nvme0n1p2[0]
      262080 blocks super 1.0 [2/2] [UU]
      
unused devices: <none>

mdadm --detail /dev/md2

/dev/md2:
           Version : 1.2
     Creation Time : Mon Mar 24 20:59:56 2025
        Raid Level : raid1
        Array Size : 498662720 (475.56 GiB 510.63 GB)
     Used Dev Size : 498662720 (475.56 GiB 510.63 GB)
      Raid Devices : 2
     Total Devices : 2
       Persistence : Superblock is persistent

     Intent Bitmap : Internal

       Update Time : Thu Sep 10 17:28:40 2026
             State : active 
    Active Devices : 2
   Working Devices : 2
    Failed Devices : 0
     Spare Devices : 0

Consistency Policy : bitmap

              Name : rescue:2
              UUID : 06651516:f66e562e:1598bec8:292d193b
            Events : 10785

    Number   Major   Minor   RaidDevice State
       0     259        3        0      active sync   /dev/nvme0n1p3
       1     259        7        1      active sync   /dev/nvme1n1p3

"Percentage Used" c'est le pourcentage de cellule NAND en rab qui sont utilisées sur ton disque. Sur un SSD tu as en fait plus de capacité que ce qui est affiché, une partie des cellules sont là pour remplacer celle qui meurent après trop d'écriture.
Quand tu es a court de ces cellules ton disque s'approche du moment où il va refuser toute écriture.

Ton modèle à un TBW de 300To, ce qui est faible pour un disque qui va subir de l'écriture régulièrement. Et c'est parfois amplifié par different phénomènes/config.

Edit: fait ces deux commandes pour avoir plus d'info

nvme smart-log  /dev/nvme0
nvme smart-log  /dev/nvme1

Oki doki

nvme smart-log /dev/nvme0

Smart Log for NVME device:nvme0 namespace-id:ffffffff
critical_warning                        : 0
temperature                             : 105 °F (314 K)
available_spare                         : 100%
available_spare_threshold               : 10%
percentage_used                         : 52%
endurance group critical warning summary: 0
Data Units Read                         : 438454601 (224.49 TB)
Data Units Written                      : 418532665 (214.29 TB)
host_read_commands                      : 3014162226
host_write_commands                     : 3951460992
controller_busy_time                    : 62535
power_cycles                            : 6
power_on_hours                          : 5947
unsafe_shutdowns                        : 1
media_errors                            : 0
num_err_log_entries                     : 0
Warning Temperature Time                : 0
Critical Composite Temperature Time     : 0
Temperature Sensor 1                    : 105 °F (314 K)
Temperature Sensor 2                    : 118 °F (321 K)
Thermal Management T1 Trans Count       : 0
Thermal Management T2 Trans Count       : 0
Thermal Management T1 Total Time        : 0
Thermal Management T2 Total Time        : 0

nvme smart-log /dev/nvme1

Smart Log for NVME device:nvme1 namespace-id:ffffffff
critical_warning                        : 0
temperature                             : 105 °F (314 K)
available_spare                         : 100%
available_spare_threshold               : 10%
percentage_used                         : 98%
endurance group critical warning summary: 0
Data Units Read                         : 155762521 (79.75 TB)
Data Units Written                      : 728174999 (372.83 TB)
host_read_commands                      : 1069416920
host_write_commands                     : 6985963108
controller_busy_time                    : 69844
power_cycles                            : 6
power_on_hours                          : 6650
unsafe_shutdowns                        : 1
media_errors                            : 0
num_err_log_entries                     : 0
Warning Temperature Time                : 0
Critical Composite Temperature Time     : 0
Temperature Sensor 1                    : 105 °F (314 K)
Temperature Sensor 2                    : 111 °F (317 K)
Thermal Management T1 Trans Count       : 0
Thermal Management T2 Trans Count       : 0
Thermal Management T1 Total Time        : 0
Thermal Management T2 Total Time        : 0

On le vois sur le 2eme. Il a écrit 372.83 TB. C'est un modèle qui est vendu pour 300. Donc il va probablement crever bientôt.

Merci pour les infos.
Je vais voir auprès du support .

Voici leur retour .

The message 'Critical Warning: 0x04' is caused by "Percentage Used" being above 100%. This only means that the drive's warranty from the manufacturer is over. But as long as 'Available Spare' is greater than 'Available Spare Threshold', you can safely ignore this message.

Unfortunately, tools like smartctl will report the disk as failed, so you might need some custom filters for your monitoring tool.

We have investigated and analyzed this topic with the manufacturers for a very long time. Unfortunately, it is not possible to disable this warning for our use case. If you still really want us to replace the SSD, we can do that for you as a gesture of goodwill. Please let us know if you want us to do that.

Qu’en pensez vous ?

Qu'il faut que tu sautes sur l'ocase!

3 « J'aime »