Ошибки серверов Dell и HP: RAID PERC, iDRAC, iLO — что значат сообщения
Серверные ошибки читаются не кодами, а сообщениями контроллера и BMC (iDRAC у Dell, iLO у HP). Почти все они про диски и питание, и почти все требуют решения в течение часов: degraded-массив без одного диска живёт до следующего сбоя.
Первое правило при любой ошибке RAID: не переставляйте диски местами и не пересобирайте массив вслепую. Порядок и метаданные — это то, что спасает данные. Не уверены — снимите дамп логов и звоните инженерам.
Dell PERC / HP Smart Array: сообщения RAID
| Код / сигнал | Что означает | Что делать |
|---|---|---|
| VD Degraded / Logical Drive Failed | Из массива выпал диск или несколько | Не перезагружайте без плана. Идентифицируйте сбойный диск по индикации, замените, дождитесь ребилда. При Failed из двух — данные восстанавливаются в сервисе. |
| Predictive failure (S.M.A.R.T.) | Диск предсказывает собственный отказ | Замена диска на горячую без остановки сервера. Откладывать — значит играть в русскую рулетку с ребилдом. |
| Foreign configuration(s) found | Контроллер увидел диск с чужими метаданными RAID | Import, если диск из этого массива; Clear, если диск новый или чужой. Clear на живом члене массива уничтожает данные. |
| Punctured stripe | «Прокол» стрипа RAID 5/6 после сбоя записи | Массив работает деградированно. Лечится backup → delete → recreate → restore. Не добавляйте диски в проколотый массив. |
| Replace drive slot N | Диск финально отказал | Горячая замена. Если после замены слот снова ругается — глючит бэкплейн, а не диск. |
| Battery / capacitor failed (BBU/CL) | Не работает батарея кэша контроллера | Кэш уходит в write-through, запись замедляется. Замена BBU — типовая процедура на месте. |
iDRAC (Dell) / iLO (HP): системные события
| Код / сигнал | Что означает | Что делать |
|---|---|---|
| System is degraded / amber health | Компонент вне нормы | Смотрите System Event Log: оттуда берётся точный источник — CPU, память, PSU, диск или температура. |
| PSU redundancy lost | Потеря резервирования питания | Проверьте второй БП и удлинитель. Один БП на живом сервере — нулевой допуск отказа. |
| CPU IERR / Machine check | Внутренняя ошибка процессора | Перезагрузка помогает разово. Повторяется — мемтест и ревизия сокета, иногда материнская плата. |
| ECC corrected / uncorrectable memory | Ошибки памяти | Corrected — мониторинг и планирование замены. Uncorrectable — менять планку, SEL укажет слот. |
| Thermal violation / overheat | Перегрев | Проверьте вентиляторы и забитые фильтры. Перегрев добивает и диски, и VRM — чистка обязательна. |
Почему нельзя вытащить и вставить диск «для проверки»
На живом RAID 5 выдёргивание второго диска — осознанное уничтожение массива: контроллер пометит его Foreign или PD missing, и даже быстрый возврат не гарантирует воссоединения. Диагностика состояния сервера делается по логам контроллера и SMART без выдёргивания, а замены — только по одной с полным ребилдом между ними.
Ребилд большого диска: часы, а не минуты
На дисках 8–16 ТБ ребилд RAID 5 идёт от полусуток до двух дней, и всё это время массив без защиты. Отсюда правило: обнаружили Predictive failure — меняйте диск немедленно, пока не выпал сосед. Если два диска «сыплются» из одной партии (а так обычно и бывает), приоритет — снятие образа данных до любых экспериментов с массивом.
Частые вопросы
Сервер пищит, на экране Degraded — выключать?
Не выключайте без нужды: сначала посмотрите, какой диск выпал. Плановая замена на горячую безопаснее аварийного цикла питания.
Foreign configuration — нажать Clear?
Clear стирает метаданные RAID с диска. Нажимать можно только если на диске точно нет данных. При сомнениях — импорт после анализа.
iDRAC показывает оранжевый, сервер работает
«Работает» и «исправен» — разные вещи: degraded означает отказ резервирования или компонента. Прочитайте SEL и устраните причину.
Сервер ругается на RAID или горит amber? Позвоните — подскажем по логам бесплатно, приедем с дисками и починим с гарантией.