← Notes

NVMe-Totalausfall um 23:10 — measure, then optimize

2026-08-16 :: homelab · zfs · incident :: DRAFT

Was passierte

Am Abend des 8. August flog eine NVMe nach Timeouts und gescheiterten Controller-Resets aus dem ZFS-Mirror. Das System lief degradiert weiter, alle Gäste waren frisch im Backup — null Datenverlust.

(Volltext folgt: Timeline vom ersten Timeout bis zum Resilver von 133 MB mit 5 korrigierten Checksummen.)

Was ich geprüft habe

Nicht die Platte war der interessante Teil, sondern die Frage danach: Wer schreibt hier eigentlich wie viel? Die Schreiblast wurde pro Container gemessen statt geschätzt — mit einem klaren größten Einzelschreiber als Ergebnis.

Was es geändert hat

autotrim aus, wöchentlicher Trim-Timer, der größte unnötige Schreiber gestoppt. Kein neues Storage, keine Panik-Migration — Messung, dann gezielte Eingriffe.

Was ich als Nächstes tun würde

Der offene Punkt ist ehrlich benannt: ein verifizierter Full-Restore-Test steht noch aus. Ein Backup, dessen Restore nie geprobt wurde, ist eine Hoffnung mit Zeitstempel.