NVMe-Totalausfall um 23:10 — measure, then optimize
Was passierte
Am Abend des 8. August flog eine NVMe nach Timeouts und gescheiterten Controller-Resets aus dem ZFS-Mirror. Das System lief degradiert weiter, alle Gäste waren frisch im Backup — null Datenverlust.
(Volltext folgt: Timeline vom ersten Timeout bis zum Resilver von 133 MB mit 5 korrigierten Checksummen.)
Was ich geprüft habe
Nicht die Platte war der interessante Teil, sondern die Frage danach: Wer schreibt hier eigentlich wie viel? Die Schreiblast wurde pro Container gemessen statt geschätzt — mit einem klaren größten Einzelschreiber als Ergebnis.
Was es geändert hat
autotrim aus, wöchentlicher Trim-Timer, der größte unnötige Schreiber gestoppt. Kein neues Storage, keine Panik-Migration — Messung, dann gezielte Eingriffe.
Was ich als Nächstes tun würde
Der offene Punkt ist ehrlich benannt: ein verifizierter Full-Restore-Test steht noch aus. Ein Backup, dessen Restore nie geprobt wurde, ist eine Hoffnung mit Zeitstempel.