mono
Septembre 10, 2026, 2:42
1
Hello les Zonistes,
Un peu de technique pour changer du climat , voiture électrique et AI .
J’ai un serveur , avec 2 disques nvme pour le system Debian .
Ils sont en RAID1 .
J’ai une alert smart qui remonte sur 1 de mes disques :
Device: /dev/nvme1, SMART/Health value: Percentage Used changed from 97 to 98
Device info:
SAMSUNG MZVL2512HCJQ-00B00, S/N:S675NL0X100111, FW:GXA7801Q, 512 GB
Du coup je regarde sur le serveur . Et ce que je ne comprends pas c’est pourquoi je n’ai qu’une alerte qui remonte
Les 2 disques devraient être en alerte , non ?
lsblk -i
NAME MAJ:MIN RM SIZE RO TYPE MOUNTPOINTS
loop0 7:0 0 100G 0 loop
loop1 7:1 0 70G 0 loop
loop2 7:2 0 30G 0 loop
loop3 7:3 0 8G 0 loop
nvme0n1 259:0 0 476.9G 0 disk
|-nvme0n1p1 259:1 0 1G 0 part
| `-md0 9:0 0 1022M 0 raid1 /boot
|-nvme0n1p2 259:2 0 256M 0 part
| `-md1 9:1 0 255.9M 0 raid1 /boot/efi
`-nvme0n1p3 259:3 0 475.7G 0 part
`-md2 9:2 0 475.6G 0 raid1
|-vg0-root 252:0 0 50G 0 lvm /
|-vg0-swap 252:1 0 4G 0 lvm [SWAP]
`-vg0-home 252:2 0 421.6G 0 lvm /var
nvme1n1 259:4 0 476.9G 0 disk
|-nvme1n1p1 259:5 0 1G 0 part
| `-md0 9:0 0 1022M 0 raid1 /boot
|-nvme1n1p2 259:6 0 256M 0 part
| `-md1 9:1 0 255.9M 0 raid1 /boot/efi
`-nvme1n1p3 259:7 0 475.7G 0 part
`-md2 9:2 0 475.6G 0 raid1
|-vg0-root 252:0 0 50G 0 lvm /
|-vg0-swap 252:1 0 4G 0 lvm [SWAP]
`-vg0-home 252:2 0 421.6G 0 lvm /var
mono
Septembre 10, 2026, 3:16
3
cat /proc/mdstat
Personalities : [raid1] [raid0] [raid6] [raid5] [raid4] [raid10]
md2 : active raid1 nvme1n1p3[1] nvme0n1p3[0]
498662720 blocks super 1.2 [2/2] [UU]
bitmap: 4/4 pages [16KB], 65536KB chunk
md0 : active raid1 nvme1n1p1[1] nvme0n1p1[0]
1046528 blocks super 1.2 [2/2] [UU]
md1 : active raid1 nvme1n1p2[1] nvme0n1p2[0]
262080 blocks super 1.0 [2/2] [UU]
unused devices: <none>
mdadm --detail /dev/md2
/dev/md2:
Version : 1.2
Creation Time : Mon Mar 24 20:59:56 2025
Raid Level : raid1
Array Size : 498662720 (475.56 GiB 510.63 GB)
Used Dev Size : 498662720 (475.56 GiB 510.63 GB)
Raid Devices : 2
Total Devices : 2
Persistence : Superblock is persistent
Intent Bitmap : Internal
Update Time : Thu Sep 10 17:28:40 2026
State : active
Active Devices : 2
Working Devices : 2
Failed Devices : 0
Spare Devices : 0
Consistency Policy : bitmap
Name : rescue:2
UUID : 06651516:f66e562e:1598bec8:292d193b
Events : 10785
Number Major Minor RaidDevice State
0 259 3 0 active sync /dev/nvme0n1p3
1 259 7 1 active sync /dev/nvme1n1p3
mono:
Percentage Used
"Percentage Used" c'est le pourcentage de cellule NAND en rab qui sont utilisées sur ton disque. Sur un SSD tu as en fait plus de capacité que ce qui est affiché, une partie des cellules sont là pour remplacer celle qui meurent après trop d'écriture.
Quand tu es a court de ces cellules ton disque s'approche du moment où il va refuser toute écriture.
Ton modèle à un TBW de 300To, ce qui est faible pour un disque qui va subir de l'écriture régulièrement. Et c'est parfois amplifié par different phénomènes/config.
Edit: fait ces deux commandes pour avoir plus d'info
nvme smart-log /dev/nvme0
nvme smart-log /dev/nvme1
mono
Septembre 10, 2026, 7:01
5
Oki doki
nvme smart-log /dev/nvme0
Smart Log for NVME device:nvme0 namespace-id:ffffffff
critical_warning : 0
temperature : 105 °F (314 K)
available_spare : 100%
available_spare_threshold : 10%
percentage_used : 52%
endurance group critical warning summary: 0
Data Units Read : 438454601 (224.49 TB)
Data Units Written : 418532665 (214.29 TB)
host_read_commands : 3014162226
host_write_commands : 3951460992
controller_busy_time : 62535
power_cycles : 6
power_on_hours : 5947
unsafe_shutdowns : 1
media_errors : 0
num_err_log_entries : 0
Warning Temperature Time : 0
Critical Composite Temperature Time : 0
Temperature Sensor 1 : 105 °F (314 K)
Temperature Sensor 2 : 118 °F (321 K)
Thermal Management T1 Trans Count : 0
Thermal Management T2 Trans Count : 0
Thermal Management T1 Total Time : 0
Thermal Management T2 Total Time : 0
nvme smart-log /dev/nvme1
Smart Log for NVME device:nvme1 namespace-id:ffffffff
critical_warning : 0
temperature : 105 °F (314 K)
available_spare : 100%
available_spare_threshold : 10%
percentage_used : 98%
endurance group critical warning summary: 0
Data Units Read : 155762521 (79.75 TB)
Data Units Written : 728174999 (372.83 TB)
host_read_commands : 1069416920
host_write_commands : 6985963108
controller_busy_time : 69844
power_cycles : 6
power_on_hours : 6650
unsafe_shutdowns : 1
media_errors : 0
num_err_log_entries : 0
Warning Temperature Time : 0
Critical Composite Temperature Time : 0
Temperature Sensor 1 : 105 °F (314 K)
Temperature Sensor 2 : 111 °F (317 K)
Thermal Management T1 Trans Count : 0
Thermal Management T2 Trans Count : 0
Thermal Management T1 Total Time : 0
Thermal Management T2 Total Time : 0
On le vois sur le 2eme. Il a écrit 372.83 TB. C'est un modèle qui est vendu pour 300. Donc il va probablement crever bientôt.
mono
Septembre 10, 2026, 7:31
7
Merci pour les infos.
Je vais voir auprès du support .
mono
Septembre 10, 2026, 7:51
8
Voici leur retour .
The message 'Critical Warning: 0x04' is caused by "Percentage Used" being above 100%. This only means that the drive's warranty from the manufacturer is over. But as long as 'Available Spare' is greater than 'Available Spare Threshold', you can safely ignore this message.
Unfortunately, tools like smartctl will report the disk as failed, so you might need some custom filters for your monitoring tool.
We have investigated and analyzed this topic with the manufacturers for a very long time. Unfortunately, it is not possible to disable this warning for our use case. If you still really want us to replace the SSD, we can do that for you as a gesture of goodwill. Please let us know if you want us to do that.
Qu’en pensez vous ?
AnA-l
Septembre 10, 2026, 8:57
9
mono:
Qu’en pensez vous ?
Qu'il faut que tu sautes sur l'ocase!
3 « J'aime »