← Все статьи
Серверы13 июн 2026 · 7 мин чтения

Сервер потерял RAID: как действовать, чтобы не добить данные

Что делать при degraded, foreign config, failed disk и ошибках RAID-контроллера Dell, HP, Lenovo. Безопасный порядок действий для бизнеса.

Похоже на вашу неисправность?Позвоните или оставьте телефон — инженер быстро сориентирует по диагностике, сроку и цене.

Инженерная редакция РемФикс · проверено сервисной лабораторией · обновлено

Диагностика серверного оборудования и RAID-контроллера
RAID
Серверы·11 мин
RAID
серверный контроллер и диски
логидискикэш

Коротко

  • При сбое RAID нельзя хаотично переставлять диски, создавать новый массив или запускать rebuild без понимания состояния.
  • Сначала фиксируют порядок дисков, логи контроллера, модель сервера, уровень RAID и состояние каждого накопителя.
  • Ремонт сервера и восстановление данных — разные задачи, но они должны координироваться.
Заявка без перехода

Можно не дочитывать — пришлите симптом инженеру

Опишите устройство в разговоре: ИБП, плату, сервер, медоборудование или косметологический аппарат. Достаточно имени и телефона.

Первая ошибка — паника и rebuild

Когда сервер показывает degraded или failed disk, хочется сразу заменить диск и нажать rebuild. Это правильно только если точно известно, какой диск отказал и остальные живы. Если в массиве уже есть второй деградирующий диск, rebuild может добить данные. Еще хуже — создать новый массив поверх старого: контроллер может перезаписать служебную информацию.

Что нужно зафиксировать сразу

До любых действий нужно записать порядок дисков в корзине, серийные номера, модель сервера, модель RAID-контроллера, уровень RAID, ошибки iDRAC/iLO/контроллера и последние события. Диски лучше промаркировать физически. Если сервер еще работает, срочно проверить резервные копии и не нагружать его лишними задачами.

Когда виноват не диск

RAID может сыпаться из-за батареи/кэша контроллера, прошивки, бэкплейна, блока питания, перегрева или плохого контакта корзины. Иногда диск исправен, но порт на бэкплейне теряет связь. Если заменить накопитель без диагностики, массив снова уйдет в ошибку. Поэтому вместе с данными смотрят железо сервера: питание, охлаждение, контроллер и корзину.

Как действовать, если данные важны

Если резервной копии нет или она сомнительна, приоритет — не ремонт сервера, а сохранение данных. В таком случае диски клонируют, анализируют конфигурацию массива и работают с копиями. Сервисный ремонт сервера выполняется после того, как понятен риск для данных. Для бизнеса это неприятнее по срокам, но безопаснее.

Что проверять после восстановления

После замены диска, контроллера или ремонта питания нужно проверить логи, SMART, rebuild, температуру, работу вентиляторов, состояние кэша и батареи RAID. Затем настраивается мониторинг уведомлений. RAID не является резервной копией: он помогает пережить отказ диска, но не защищает от удаления, шифрования, ошибки контроллера или пожара.

Degraded, failed и foreign config

Degraded означает, что массив работает с потерей избыточности, но это не всегда повод немедленно запускать rebuild. Failed может относиться к диску, порту или виртуальному диску, а foreign config означает, что контроллер видит служебную конфигурацию, не совпадающую с текущей. Перед импортом foreign configuration нужно сохранить состояние и понять, какой набор дисков является исходным. Неправильное подтверждение может изменить метаданные массива.

Диски, бэкплейн и RAID-контроллер

Если один диск выпадает повторно, проверяют его SMART, корзину, кабель, порт бэкплейна, питание и температуру. Сам контроллер тоже может терять связь из-за батареи кэша, прошивки, перегрева или повреждения памяти. В сервере Dell смотрят iDRAC и PERC, в HP — iLO и Smart Array, но общий принцип один: сначала собрать логи, а потом менять железо. Это снижает риск перепутать отказ диска с отказом канала.

Когда нужен специалист по данным

Если резервной копии нет, массив деградировал по нескольким дискам или есть признаки физического отказа, ремонт сервера нельзя начинать с произвольного rebuild. Сначала сохраняют образы дисков, порядок и параметры массива, затем работают с копиями. Цель — не просто включить сервер, а сохранить файловую систему и структуру данных. Срок и методика зависят от уровня RAID, объема и состояния накопителей.

Питание, охлаждение и повторный сбой

Перегрев, неисправный вентилятор, просадка питания или плохой контакт корзины могут привести к повторному выпадению диска после восстановления. Проверяют блоки питания, температурные датчики, обороты вентиляторов, кабели и состояние бэкплейна. После rebuild включают уведомления и наблюдают за SMART. RAID без мониторинга часто обнаруживает проблему слишком поздно.

Что прислать для безопасной оценки

Нужны модель сервера, контроллера и дисков, уровень RAID, список ошибок, фото экрана или iDRAC/iLO, состояние резервных копий и порядок дисков. Укажите, запускался ли rebuild, импортировалась ли foreign configuration и менялись ли диски местами. Не очищайте логи и не создавайте новый массив до консультации. Для критичных данных заранее сообщите желаемый формат: диагностика сервера или восстановление информации.

Порядок дисков и метаданные массива

Положение дисков в корзинах, серийные номера и служебные метаданные помогают восстановить конфигурацию. Перед снятием делают фотографии, маркируют диски и сохраняют логи контроллера. Нельзя ориентироваться только на имена дисков в интерфейсе: после перестановки контроллер может предложить опасную конфигурацию. Если есть сомнения, дальнейшие операции проводят только с копиями.

Контроллер, кэш и батарея

Неисправная батарея или модуль кэш-памяти RAID может привести к остановке записи и ошибкам виртуального диска. Проверяют состояние кэша, конденсатора или аккумулятора, прошивку и журналы. Замена контроллера требует совместимости и сохранения конфигурации. До операции важно понять, где находится актуальная информация о массиве и какие данные уже были записаны после сбоя.

После восстановления: мониторинг и резерв

После rebuild сервер не считают полностью восстановленным. Проверяют SMART, ошибки контроллера, температуру, состояние бэкплейна и уведомления. Затем делают свежую резервную копию и тестируют ее восстановление. Для бизнеса полезно разделить мониторинг дисков, RAID, питания и свободного места, чтобы следующий отказ был замечен до потери доступности.

Сроки и порядок работ при простое

Сначала фиксируют состояние и ценность данных, затем выбирают безопасную последовательность. Быстрый ремонт контроллера не должен опережать клонирование, если массив нестабилен. Для сервера без критичных данных можно восстановить железо быстрее, но это решение тоже фиксируют. В заявке указывают допустимый простой, наличие резервной копии и приоритет: запуск сервера или сохранение информации. Такой порядок предотвращает необратимые действия в спешке.

Что считать успешным результатом

Успешный результат — не только загрузка операционной системы. Нужно подтвердить состояние виртуальных дисков, отсутствие новых ошибок, чтение данных, работу резервного копирования и мониторинга. Если выполнялось восстановление, отдельно фиксируют сохранность файловой системы и ограничения. После этого сервер возвращают в штатную эксплуатацию с планом наблюдения и свежей копией важных данных.

Когда можно возвращать сервер в работу

Сервер возвращают в работу после проверки массива, логов, температуры, резервного копирования и уведомлений. Если диск или контроллер остаются под наблюдением, это фиксируют и назначают повторную проверку. Такой контроль важнее простого исчезновения красного индикатора: скрытая ошибка может проявиться позже при нагрузке или следующем rebuild.

Заметка инженера

Если сервер потерял RAID и данные критичны, лучше остановиться на этапе фиксации состояния. Чем меньше импровизации, тем выше шанс восстановить систему.

Короткий чек-лист

  • не создавать новый RAID поверх старого массива
  • не переставлять диски без маркировки
  • сохранить логи контроллера и сервера
  • проверить актуальность резервной копии
  • при ценных данных сначала клонировать диски

Куда перейти дальше

Частые вопросы

RAID заменяет бэкап?

Нет. RAID снижает риск простоя при отказе диска, но не является резервной копией данных.

Можно ли чинить RAID-контроллер?

Часть отказов контроллера и питания ремонтопригодна, но приоритет зависит от состояния данных и массива.

Сервер Dell, HP или Lenovo показывает degraded RAID или foreign config? Привезите сервер или контроллер — начнем с безопасной диагностики.

Не уверены, что нужно? Начните с бесплатной оценки

Первичная оценка бесплатна. Стоимость стендовой диагностики сложного оборудования согласуем заранее. Принимаем в Москве, работаем с клиентами из Московской области.

Заявка без перехода

Перезвоним и скажем, с чего начать

Укажите имя и телефон. Детали по устройству, цене и сроку уточним в разговоре.

ПозвонитьTelegramЗаявка