< вернуться назад

Понимание декластеризованного RAID: основы, происхождение, преимущества и недостатки

Понимание декластеризованного RAID: основы, происхождение, преимущества и недостатки
#NVMe #BAUM UDS #RAID Offload #RAID
8 минут
Понимание декластеризованного RAID: основы, происхождение, преимущества и недостатки

В области хранения данных RAID долгое время был краеугольным камнем технологий, предлагая улучшенную надежность и производительность данных. Однако, по мере роста объема хранимых данных и размера жестких дисков, традиционные конфигурации RAID часто сталкиваются с ограничениями в масштабируемости, времени восстановления и надежности.

В этой статье рассматриваются основы декластеризованного RAID, причины его появления, преимущества и недостатки, а также примеры размещения данных и сценарии использования.

Происхождение декластеризованного RAID

Концепция декластеризованного RAID возникла из необходимости устранить недостатки традиционных систем RAID, особенно в масштабных средах хранения данных. Традиционные конфигурации RAID, такие как RAID 5 и RAID 6, сталкиваются с длительным временем восстановления и снижением производительности по мере увеличения емкости дисков. 

Истоки проблемы лежат в том, что производительность жестких дисков за последнее время почти не выросла, в то время, как их объем значительно увеличился. Эта тенденция привела к тому, что время восстановления целостности традиционной RAID-группы при отказе диска неуклонно растет. 

При этом развитие систем хранения идет не только в сторону увеличения емкости. С переходом от HDD к NVMe меняются и требования к производительности RAID: классические подходы к защите данных уже не всегда позволяют эффективно использовать возможности современных накопителей. Подробнее о проблемах традиционного RAID и новых методах повышения производительности мы рассказывали в статье «RAID в эпоху NVMe: необходимость новых методов для повышения производительности».

Для примера возьмем современный диск объемом 20 ТБ и выше. Типичная наработка на отказ такого устройства составляет 2 млн. часов — это соответствует величине годовой вероятности выхода из строя 0.44%. В реальной жизни, с учетом погрешностей логистики, она может вырасти. Крупные дата-центры закладывают 1% AFR как реалистичную величину. Это значит, что из популяции 10000 дисков в год будет выходить из строя 100. То есть один диск в 3-4 дня. При этом время восстановления одного 20ТБ диска под нагрузкой в классической схеме RAID может составлять неделю и больше. 

Вторая характеристика жестких дисков — UBER (uncorrectable bit error rate). Эта величина указывает частоту возникновения «жестких» ошибок чтения, которые приводят к необходимости перестройки RAID. Для современных серверных HDD эта величина 1 на 1015. Несложно посчитать, что при работе с тем же 20 ТБ диском мы статистически столкнемся с «жесткой» ошибкой чтения после (1015)/(20 ТБ = 20 * 1012 * 8 бит) = 6.25 полных прочтений диска. 

Кроме того классические расчеты показателей надежности часто предполагают некоррелированные отказы, что приводит к слишком оптимистичным оценкам среднего времени до потери данных (MTTDL). Рассмотрим основные аспекты и факторы, способствующие этой проблеме:

Коррелированные отказы

  1. Партии с производственными дефектами
    Диски из одной партии могут иметь общие производственные дефекты, что приводит к более высоким уровням отказов в пределах этой партии.
  2. Экологические факторы
    Внешние факторы, такие как колебания температуры, влажность и скачки напряжения, могут одновременно влиять на несколько дисков, вызывая коррелированные отказы.
  3. Эксплуатационные нагрузки
    Высокие нагрузки ввода-вывода и периоды интенсивного использования могут одинаково нагружать несколько дисков, увеличивая вероятность одновременных отказов.

Кривая «ванны» отказов

  1. Ранние отказы
    Новые диски демонстрируют более высокие уровни отказов из-за скрытых производственных дефектов и начальных отказов в процессе обкатки.
  2. Период полезной жизни
    После начальной фазы диски переходят в период относительно низких и стабильных уровней отказов.
  3. Фаза износа
    Ближе к концу их жизненного цикла диски начинают чаще выходить из строя из-за износа.

Понимание декластеризованного RAID: основы, происхождение, преимущества и недостатки - 1

Если совместить теорию с практикой, получается неутешительная картина: в масштабных инсталляциях на жестких дисках большого объема классические RAID-5 и RAID-6 перестают гарантировать сохранность данных на сколь-либо продолжительное время. Это отчасти объясняет популярность технологий локальной репликации.

Именно в попытках решить проблему долгого ребилда, создающего нагрузку на соседние диски, и родилась концепция декластеризованного RAID.

Принцип работы декластеризованного RAID

В основе защиты данных декластерного RAID лежат все те же коды Рида-Соломона, позволяющие исправлять ошибки в блоках данных, что и в классических RAID 5 или 6. Основное отличие в том, что мы отказываемся от привычных RAID-групп («кластеров» данных), привязанных к границам физических дисков, заменяя их логическими декластеризованными RAID-томами, «размазанными» по всем доступным накопителям.

Понимание декластеризованного RAID: основы, происхождение, преимущества и недостатки - 2

В современных системах хранения важна не только схема распределения данных и вычисления четности, но и то, где выполняются сами операции RAID. В случае NVMe часть вычислительной нагрузки, связанной с расчетом паритета, может быть перенесена непосредственно на SSD. Подробнее об этом подходе и технологии RAID Offload мы писали в статье «RAID Offload для NVMe без нагрузки на CPU: Kioxia показала вычисление паритета прямо на SSD».

Для простоты можем посмотреть, как работает восстановление в декластеризованном RAID1:

Понимание декластеризованного RAID: основы, происхождение, преимущества и недостатки - 3

Различия в поведении при отказе диска

Классический RAID-1

  • В традиционной системе RAID-1 данные дублируются между двумя дисками. Если один из этих двух «зеленых» дисков выходит из строя, весь объем чтения данных перекладывается на оставшийся рабочий диск, который теперь имеет 100% нагрузку на чтение.
  • Новые данные записываются на запасной диск, что приводит к 100% нагрузке на запись для этого диска.
  • Дополнительные запросы на ввод-вывод к RAID-1 массиву будут обрабатываться медленнее, что замедлит всю файловую систему.

Декластеризованный RAID-1

  • В случае выхода из строя одного физического диска в декластеризованной системе RAID-1 данные и четность распределяются по большему количеству дисков.
  • Если один из дисков выходит из строя, то оставшиеся данные блоки разбросаны по 6 оставшимся здоровым дискам.
  • Запасные spare блоки также распределены по всем дискам.
  • Это означает, что нагрузка на восстановление может быть распределена между всеми оставшимися здоровыми дисками, а не сосредоточена на одном диске для чтения и другом для записи.

Преимущества декластеризованного RAID

  • Улучшенное время восстановления
    Одним из основных преимуществ декластеризованного RAID является значительное сокращение времени восстановления. Благодаря распределению данных и четности по большему количеству дисков, рабочая нагрузка при восстановлении распределяется, что позволяет быстрее восстанавливать данные после сбоев дисков.
  • Улучшенная масштабируемость
    Декластеризованный RAID по своей природе более масштабируем, чем традиционный RAID. По мере увеличения количества дисков распределение данных и четности становится более эффективным, поддерживая производительность и надежность без узких мест, характерных для традиционных конфигураций RAID.
  • Лучшая отказоустойчивость
    С данными и информацией о четности, распределенными по большему количеству дисков, декластеризованный RAID может более устойчиво переносить множественные отказы дисков. Это повышает общую отказоустойчивость системы хранения.
  • Оптимизированная производительность
    Декластеризованный RAID может предложить улучшенную производительность чтения и записи благодаря более широкому распределению данных. Несколько дисков могут участвовать в операциях с данными, снижая задержки и увеличивая пропускную способность.

Заключение

Основной проблемой для применения декластеризованного RAID является сложность. Алгоритмы и карты распределения данных значительно сложнее, чем в случае классического RAID, поэтому на сегодняшний момент технология декластеризованного RAID используется либо в высокоуровневых СХД от ведущих производителей, либо в коммерческих программных продуктах для высокопроизводительных вычислений. Тем не менее постепенно технология становится более доступной, и в немного упрощенном виде появляется, в том числе, и в ПО с открытым исходным кодом.

Постоянный рост объемов хранимых данных все чаще будет требовать использовать продвинутые технологии для защиты данных, и использование систем декластеризованного RAID будет расти. Инженеры BAUM исследуют возможность применения декластеризованного RAID в крупных инсталляциях BAUM UDS, а также работают над новыми схемами защиты данных в разрабатываемых системах хранения.

Автор: Олег Ларин

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *
Author
Посетитель сайта

Добавить комментарий

Комментариев пока нет

Другие статьи, которые могут быть полезными

Архитектура и назначение платформы Context Memory Storage NVIDIA Inference Context Memory Storage Platform – это новая архитектура хранения данных, специально разработанная для ускорения инференса крупных моделей за счет эффективной работы...
716
35
В BAUMSTORAGE предусмотрена возможность работы протокола SMB с доменом Active Directory. Перед настройкой протокола необходимо указать имя домена и ввести в него контроллеры BAUMSTORAGE, используя встроенную функцию ввода в домен....
3606
1
В мире современной вычислительной технологии немногие компоненты так прочно занимают свою нишу, как Жесткие Диски (ЖД). С самого зарождения этой технологии, ЖД стали незаменимыми помощниками, надежно хранящими и предоставляющими огромные...
3322
13