Автор блога рассчитал вероятность потери данных на домашнем NAS
Автор личного блога (на Hacker News известен как nosolace) решил хранить свои данные «всю жизнь» и для этого собрал домашнее сетевое хранилище (NAS) из четырёх жёстких дисков по 8 ТБ. Архитектура: диски разбиты на две пары, каждая пара работает как зеркало btrfs RAID1, одна пара стоит у него дома, вторая, в доме отца в другом штате, копии синхронизируются автоматически. Автор выбрал btrfs (или как альтернативу zfs) из-за встроенного контрольного суммирования: файловая система проверяет контрольную сумму каждого блока данных (около 16 КиБ) и умеет автоматически чинить повреждённый блок при чтении, если где-то в массиве сохранилась исправная копия. Дополнительно он опирается на SMART-мониторинг дисков и планирует заменять вышедшие из строя накопители командой «btrfs replace -r».
Далее автор разбирает два способа, которыми диск может подвести: полный отказ (диск умирает целиком, и все данные на нём теряются) и латентная ошибка сектора (LSE), сбой чтения, при котором теряются данные только в одном секторе (обычно 512 байт), а остальной диск продолжает работать. Чтобы оценить вероятность каждого сценария, он обращается к академическим исследованиям: работе Bairavasundaram и соавторов (SIGMETRICS, 2007) об отказах отдельных секторов и работе Schroeder, Damouras и Gill о поведении дисков и секторов. Отдельно он ссылается на публикацию Backblaze за октябрь 2025 года с графиком годовой частоты отказов (AFR): по его наблюдению, этот график больше не похож на классическую «ванну» (высокая смертность в начале и в конце срока службы, низкая, в середине), которую годами использовали как модель отказа железа. Backblaze трактует это как сигнал, что надёжность дисков за последнее десятилетие выросла, а сама природа отказов изменилась.
Чтобы получить актуальные цифры, а не полагаться на паспортные характеристики производителя, автор попросил модель ИИ по имени «opus 4.7» (в тексте не указано, какой компании принадлежит эта модель) выгрузить и разобрать свежий набор данных Backblaze за 2025 год по дискам, похожим на его собственные (Seagate; точная модель в тексте не сохранилась). Дальше он строит вероятностную модель потери данных для массива из N дисков: потеря происходит либо когда один диск отказывает, а во время восстановления массива (ресилвер, автор закладывает на это две недели) на оставшихся дисках тоже возникает ошибка чтения, либо когда сразу все диски массива развивают латентную ошибку в одном и том же секторе. Для расчёта он использует экспоненциальное распределение времени безотказной работы, исходя из допущения, что частота отказов не зависит от возраста диска (то есть кривую-«ванну» он в модели игнорирует), а отказы разных физических дисков считает независимыми друг от друга.
Отдельно автор прикидывает собственную годовую нагрузку на хранилище: домашний каталог занимает 100 ГБ, ночные бэкапы меняют в среднем около 1 ГБ данных; фильмы весят около 100 ГБ и он смотрит один-два в неделю; потоковое прослушивание музыки в lossless-качестве (аналог 24-бит/44,1 кГц FLAC) занимает у него порядка 50 тысяч минут в год. В сумме это даёт около 1,5×10^13 бит в год лично для него и около 3×10^13 бит в год с учётом того, что тем же хранилищем пользуется его партнёр. Также он рассуждает о смысле регулярной «чистки» (scrubbing) массива: паспортные данные производителя не дают ответа, насколько реально магнитные диски подвержены медленной порче данных (bitrot) со временем, в отличие от магнитных лент, где такой эффект хорошо задокументирован. По его выводу, главная практическая польза от периодической чистки, не в борьбе с гипотетическим bitrot, а в том, чтобы заранее убедиться: если один диск массива выйдет из строя, у оставшихся дисков есть подтверждённая рабочая копия каждого потерянного сектора.
Извлечённый текст обрывается в середине вывода формулы для вероятности того, что латентная ошибка совпадёт сразу на нескольких дисках, итоговое числовое значение вероятности потери данных для его конкретного массива в доступном материале не приводится.
Ключевые факты
- Автор собрал домашний NAS из четырёх дисков по 8 ТБ: два зеркала btrfs RAID1, одно из них, удалённо, в доме отца, с автосинхронизацией.
- Модель различает два вида отказа: полная гибель диска и латентная ошибка сектора (LSE), при которой теряется только один сектор данных (обычно 512 байт).
- Для оценки надёжности использованы академические работы Bairavasundaram et al. (SIGMETRICS, 2007) и Schroeder, Damouras & Gill, а также отчёт Backblaze об отказах дисков за октябрь 2025 года.
- Автор отмечает, что классическая «ванна» отказов больше не описывает современные жёсткие диски по данным Backblaze, и просил ИИ-модель «opus 4.7» помочь разобрать датасет Backblaze за 2025 год.
- Собственная оценка нагрузки на хранилище: около 1,5×10^13 бит данных в год лично, около 3×10^13 бит в год с учётом партнёра; вывод модели о резервировании автор строит на экспоненциальном распределении времени жизни диска.
Почему это важно
Домашние NAS обычно строят на интуиции («поставлю RAID и зеркало на всякий случай»), не считая реальную вероятность потери данных. Этот разбор показывает, как перейти от интуиции к числу: взять формулу отказов, подставить туда не паспортные, а актуальные данные о реальных дисках (отчёт Backblaze) и академические результаты по поведению секторов, и получить осмысленную оценку риска для конкретной архитектуры хранения, а не просто «RAID1 надёжнее одного диска».
Кому это важно
Материал адресован тем, кто сам администрирует домашнее или небольшое сетевое хранилище, энтузиастам домашних лабораторий, людям, архивирующим фото, видео и музыку на десятилетия вперёд, и всем, кто хочет заменить общие советы («держите бэкап») количественной оценкой вероятности потери данных для своей конкретной конфигурации дисков.
Как это применить
Из разбора можно взять готовый набор практик: разносить копии данных на два физических зеркала (в том числе географически, как у автора, дома и у родителей), использовать файловую систему с контрольными суммами блоков и автопочинкой (btrfs или zfs), включить SMART-мониторинг дисков, менять вышедший из строя накопитель командой «btrfs replace -r» и закладывать в план резервирования не только вероятность полного отказа диска, но и латентные ошибки секторов, которые не всегда заметны сразу.
Можно ли доверять
Автор опирается на проверяемые источники: рецензируемую работу Bairavasundaram и соавторов (SIGMETRICS, 2007), исследование Schroeder, Damouras и Gill и открытый отчёт Backblaze за октябрь 2025 года, это реальные, а не выдуманные источники. Одновременно это личный блог-пост с самостоятельным математическим выводом, а не рецензируемая публикация: обсуждение на Hacker News собрало всего один комментарий, а сам текст источника обрывается до итоговой числовой оценки вероятности потери данных, то есть проверить финальный результат расчёта по доступному материалу нельзя. Часть работы с датасетом Backblaze автор доверил ИИ-модели, при этом в тексте не указано, чьего производства эта модель.
Риски и подводные камни
Модель делает несколько допущений, которые можно назвать спорными: что отказы разных физических дисков независимы друг от друга (в реальности диски одной партии, купленные вместе и работающие в одинаковых условиях, могут отказывать скоррелированно), и что частота отказов не зависит от возраста диска, хотя классическая кривая-«ванна» как раз описывает рост отказов к концу срока службы. Отдельная неопределённость, эффективность регулярной чистки массива (scrubbing): автор прямо пишет, что не нашёл данных о том, насколько современные магнитные диски подвержены медленной порче данных со временем, в отличие от магнитных лент.