< вернуться назад

Понимание декластеризованного RAID: основы, происхождение, преимущества и недостатки

Понимание декластеризованного RAID: основы, происхождение, преимущества и недостатки
#NVMe #BAUM UDS #RAID Offload #RAID
8 минут
Понимание декластеризованного RAID: основы, происхождение, преимущества и недостатки

В области хранения данных RAID долгое время был краеугольным камнем технологий, предлагая улучшенную надежность и производительность данных. Однако, по мере роста объема хранимых данных и размера жестких дисков, традиционные конфигурации RAID часто сталкиваются с ограничениями в масштабируемости, времени восстановления и надежности.

В этой статье рассматриваются основы декластеризованного RAID, причины его появления, преимущества и недостатки, а также примеры размещения данных и сценарии использования.

Происхождение декластеризованного RAID

Концепция декластеризованного RAID возникла из необходимости устранить недостатки традиционных систем RAID, особенно в масштабных средах хранения данных. Традиционные конфигурации RAID, такие как RAID 5 и RAID 6, сталкиваются с длительным временем восстановления и снижением производительности по мере увеличения емкости дисков. 

Истоки проблемы лежат в том, что производительность жестких дисков за последнее время почти не выросла, в то время, как их объем значительно увеличился. Эта тенденция привела к тому, что время восстановления целостности традиционной RAID-группы при отказе диска неуклонно растет. 

При этом развитие систем хранения идет не только в сторону увеличения емкости. С переходом от HDD к NVMe меняются и требования к производительности RAID: классические подходы к защите данных уже не всегда позволяют эффективно использовать возможности современных накопителей. Подробнее о проблемах традиционного RAID и новых методах повышения производительности мы рассказывали в статье «RAID в эпоху NVMe: необходимость новых методов для повышения производительности».

Для примера возьмем современный диск объемом 20 ТБ и выше. Типичная наработка на отказ такого устройства составляет 2 млн. часов — это соответствует величине годовой вероятности выхода из строя 0.44%. В реальной жизни, с учетом погрешностей логистики, она может вырасти. Крупные дата-центры закладывают 1% AFR как реалистичную величину. Это значит, что из популяции 10000 дисков в год будет выходить из строя 100. То есть один диск в 3-4 дня. При этом время восстановления одного 20ТБ диска под нагрузкой в классической схеме RAID может составлять неделю и больше. 

Вторая характеристика жестких дисков — UBER (uncorrectable bit error rate). Эта величина указывает частоту возникновения «жестких» ошибок чтения, которые приводят к необходимости перестройки RAID. Для современных серверных HDD эта величина 1 на 1015. Несложно посчитать, что при работе с тем же 20 ТБ диском мы статистически столкнемся с «жесткой» ошибкой чтения после (1015)/(20 ТБ = 20 * 1012 * 8 бит) = 6.25 полных прочтений диска. 

Кроме того классические расчеты показателей надежности часто предполагают некоррелированные отказы, что приводит к слишком оптимистичным оценкам среднего времени до потери данных (MTTDL). Рассмотрим основные аспекты и факторы, способствующие этой проблеме:

Коррелированные отказы

  1. Партии с производственными дефектами
    Диски из одной партии могут иметь общие производственные дефекты, что приводит к более высоким уровням отказов в пределах этой партии.
  2. Экологические факторы
    Внешние факторы, такие как колебания температуры, влажность и скачки напряжения, могут одновременно влиять на несколько дисков, вызывая коррелированные отказы.
  3. Эксплуатационные нагрузки
    Высокие нагрузки ввода-вывода и периоды интенсивного использования могут одинаково нагружать несколько дисков, увеличивая вероятность одновременных отказов.

Кривая «ванны» отказов

  1. Ранние отказы
    Новые диски демонстрируют более высокие уровни отказов из-за скрытых производственных дефектов и начальных отказов в процессе обкатки.
  2. Период полезной жизни
    После начальной фазы диски переходят в период относительно низких и стабильных уровней отказов.
  3. Фаза износа
    Ближе к концу их жизненного цикла диски начинают чаще выходить из строя из-за износа.

Понимание декластеризованного RAID: основы, происхождение, преимущества и недостатки - 1

Если совместить теорию с практикой, получается неутешительная картина: в масштабных инсталляциях на жестких дисках большого объема классические RAID-5 и RAID-6 перестают гарантировать сохранность данных на сколь-либо продолжительное время. Это отчасти объясняет популярность технологий локальной репликации.

Именно в попытках решить проблему долгого ребилда, создающего нагрузку на соседние диски, и родилась концепция декластеризованного RAID.

Принцип работы декластеризованного RAID

В основе защиты данных декластерного RAID лежат все те же коды Рида-Соломона, позволяющие исправлять ошибки в блоках данных, что и в классических RAID 5 или 6. Основное отличие в том, что мы отказываемся от привычных RAID-групп («кластеров» данных), привязанных к границам физических дисков, заменяя их логическими декластеризованными RAID-томами, «размазанными» по всем доступным накопителям.

Понимание декластеризованного RAID: основы, происхождение, преимущества и недостатки - 2

В современных системах хранения важна не только схема распределения данных и вычисления четности, но и то, где выполняются сами операции RAID. В случае NVMe часть вычислительной нагрузки, связанной с расчетом паритета, может быть перенесена непосредственно на SSD. Подробнее об этом подходе и технологии RAID Offload мы писали в статье «RAID Offload для NVMe без нагрузки на CPU: Kioxia показала вычисление паритета прямо на SSD».

Для простоты можем посмотреть, как работает восстановление в декластеризованном RAID1:

Понимание декластеризованного RAID: основы, происхождение, преимущества и недостатки - 3

Различия в поведении при отказе диска

Классический RAID-1

  • В традиционной системе RAID-1 данные дублируются между двумя дисками. Если один из этих двух «зеленых» дисков выходит из строя, весь объем чтения данных перекладывается на оставшийся рабочий диск, который теперь имеет 100% нагрузку на чтение.
  • Новые данные записываются на запасной диск, что приводит к 100% нагрузке на запись для этого диска.
  • Дополнительные запросы на ввод-вывод к RAID-1 массиву будут обрабатываться медленнее, что замедлит всю файловую систему.

Декластеризованный RAID-1

  • В случае выхода из строя одного физического диска в декластеризованной системе RAID-1 данные и четность распределяются по большему количеству дисков.
  • Если один из дисков выходит из строя, то оставшиеся данные блоки разбросаны по 6 оставшимся здоровым дискам.
  • Запасные spare блоки также распределены по всем дискам.
  • Это означает, что нагрузка на восстановление может быть распределена между всеми оставшимися здоровыми дисками, а не сосредоточена на одном диске для чтения и другом для записи.

Преимущества декластеризованного RAID

  • Улучшенное время восстановления
    Одним из основных преимуществ декластеризованного RAID является значительное сокращение времени восстановления. Благодаря распределению данных и четности по большему количеству дисков, рабочая нагрузка при восстановлении распределяется, что позволяет быстрее восстанавливать данные после сбоев дисков.
  • Улучшенная масштабируемость
    Декластеризованный RAID по своей природе более масштабируем, чем традиционный RAID. По мере увеличения количества дисков распределение данных и четности становится более эффективным, поддерживая производительность и надежность без узких мест, характерных для традиционных конфигураций RAID.
  • Лучшая отказоустойчивость
    С данными и информацией о четности, распределенными по большему количеству дисков, декластеризованный RAID может более устойчиво переносить множественные отказы дисков. Это повышает общую отказоустойчивость системы хранения.
  • Оптимизированная производительность
    Декластеризованный RAID может предложить улучшенную производительность чтения и записи благодаря более широкому распределению данных. Несколько дисков могут участвовать в операциях с данными, снижая задержки и увеличивая пропускную способность.

Заключение

Основной проблемой для применения декластеризованного RAID является сложность. Алгоритмы и карты распределения данных значительно сложнее, чем в случае классического RAID, поэтому на сегодняшний момент технология декластеризованного RAID используется либо в высокоуровневых СХД от ведущих производителей, либо в коммерческих программных продуктах для высокопроизводительных вычислений. Тем не менее постепенно технология становится более доступной, и в немного упрощенном виде появляется, в том числе, и в ПО с открытым исходным кодом.

Постоянный рост объемов хранимых данных все чаще будет требовать использовать продвинутые технологии для защиты данных, и использование систем декластеризованного RAID будет расти. Инженеры BAUM исследуют возможность применения декластеризованного RAID в крупных инсталляциях BAUM UDS, а также работают над новыми схемами защиты данных в разрабатываемых системах хранения.

Автор: Олег Ларин

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *
Author
Посетитель сайта

Добавить комментарий

Комментариев пока нет

Другие статьи, которые могут быть полезными

Введение В области компьютерного оборудования сложно найти технологию, которая на первый взгляд выглядит более консервативной, чем жесткие диски. Принципы записи и хранения информации на магнитных пластинах были изобретены и внедрены...
308
10
Том (данных) представляет собой именованное пространство, расположенное на пуле. На одном пуле может быть создано несколько томов, имена которых не должны повторяться. Том может быть создан «толстым», сразу занимающим фиксированный...
3788
2
NFS (Network File System): как работает доступ к файлам по сети NFS (Network File System) — это файловый протокол поверх IP (чаще TCP), через который СХД публикует каталоги, а клиенты...
980
8