Куда переносить терабайты: почему старые подходы к хранению данных больше не работают
Корпоративная инфраструктура подошла к точке кипения. Объемы данных растут лавинообразно: видеонаблюдение высокого разрешения, телеметрия с датчиков, бэкапы виртуальных машин, логи безопасности. Раньше системный архитектор просто заказывал пару полок условного Dell EMC или NetApp, закрывал тикет и спал спокойно. Сегодня этот сценарий превратился в головную боль: лицензии не продлеваются, запчасти идут параллельным импортом месяцами, а цены на поддержку выросли втрое.
Бизнесу приходится искать альтернативы не из любопытства, а ради базовой выживаемости сервисов. При этом современная отечественная система хранения данных уже проектируется по стандартам открытой архитектуры (OCP), что избавляет от вендорного рабства, но требует от инженеров пересмотра базовых привычек.
«Черный ящик» против открытых стандартов
Раньше вендоры десятилетиями привязывали клиентов к проприетарным чипам. Если ломался контроллер, заменить его можно было только оригинальным блоком той же ревизии.
Сейчас парадигма сменилась на Software-Defined Storage (программно-определяемые хранилища) и унифицированное "железо". Стандарты Open Compute Project (OCP), которые изначально придумали гиперскейлеры вроде Meta для удешевления дата-центров, добрались до корпоративного сегмента. Смысл прост: материнская плата, шасси и блоки питания стандартизированы. Главная ценность сместилась в микрокод и управляющий софт.
Недавно я заметил показательную вещь на одном из закрытых профильных митапов: системные администраторы больше не хвастаются брендами контроллеров. Они спорят о скорости перестроения RAID-массивов на 24-терабайтных дисках и о том, как софт справляется с "тихим" повреждением данных (silent data corruption). Фокус сместился с шильдика на реальную математику отказоустойчивости.
Главный подводный камень: диски стали слишком большими
Мало кто задумывается, но механические HDD объемом 20–24 ТБ создали неожиданную проблему.
Представьте: в классическом массиве RAID 5 или RAID 6 вылетает один диск. Начинается перестроение (rebuild). На таких емкостях этот процесс занимает до нескольких суток. Все это время массив испытывает дикую нагрузку по чтению с остальных дисков, что многократно повышает риск отказа второго накопителя. Случился второй сбой — и массив погиб вместе с данными.
Классический RAID для петабайтных объемов мертв. Ему на смену пришли:
-
Erasure Coding (избыточное кодирование): делит данные на фрагменты с контрольными суммами и распределяет по разным узлам, позволяя терять целые серверы без остановки работы;
-
Двухуровневый тиринг: быстрый слой NVMe для "горячих" транзакций и плотный слой HDD для архивов;
-
Автоматический ребаланс: система распределяет нагрузку так, чтобы перестроение шло параллельно на десятки дисков за считанные часы, а не дни.
Как протестировать новую СХД перед внедрением: 4 шага
Не верьте синтетическим тестам из буклетов. Синтетика тестирует идеальные условия, которых в проде не бывает.
-
Замерьте реальный профиль нагрузки (IOPS и задержку). Запустите мониторинг на боевых серверах в пиковые часы. Выясните точное соотношение чтения и записи (например, 70/30 для баз данных или 90/10 для медиаархива).
-
Смоделируйте аварийный сценарий под нагрузкой. Нагрузите тестовую стойку генератором трафика (инструментом вроде FIO) и физически выдерните два диска подряд. Замерьте, насколько просядет производительность и сколько займет восстановление.
-
Проверьте механизм снепшотов. Сделайте 500 моментальных снимков базы данных подряд. Если СХД начинает зависать или терять скорость доступа — софт контроллера не готов к серьезным задачам.
-
Оцените доступность запчастей. Убедитесь, что вентиляторы, блоки питания и интерфейсные платы HBA можно получить со склада за 24–48 часов, а не ждать под заказ из-за границы.
Хранение данных перестало быть скучной покупкой "железки в стойку". Сегодня это чистая инженерия компромиссов между надежностью, скоростью и доступностью комплектующих. Пытаться держаться за ушедшие зарубежные экосистемы через серые схемы поставок — стратегия опасная и экономически тупиковая. Выигрывает тот, кто научился строить архитектуру на модульных, независимых от одного поставщика платформах и понимать физику процессов внутри своих дисковых массивов.
















