Зачем серверу два блока питания при colocation и как подключать A/B-линии

У профессионального физического сервера сзади часто находятся два почти одинаковых блока питания. Пока машина стоит в офисе, второй разъём нередко воспринимается как запасной: один кабель подключили в розетку, сервер работает, значит задача решена. При переносе оборудования в дата-центр смысл двух блоков питания становится гораздо интереснее. Они позволяют построить схему, при которой неисправность одного БП или части системы электроснабжения не обязательно выключает сервер.

Но наличие двух блоков ещё не означает настоящего резервирования. Если оба подключены к одному удлинителю, одному PDU и в конечном итоге к одной линии питания, общая точка отказа никуда не исчезает. Один блок действительно может сломаться без остановки машины, но достаточно отключиться общей линии, чтобы оба одновременно остались без электричества.

Поэтому при colocation важнее не количество разъёмов на задней панели, а весь путь электричества до каждого из них. В правильно организованной схеме первый блок питания получает энергию по линии A, второй — по независимой линии B. Тогда сервер способен продолжить работу при отказе одного из путей, если сама платформа рассчитана на такое резервирование.

Для обычного сайта эта деталь может показаться чрезмерной. Но если компания уже купила собственный сервер, разместила его в профессиональном ЦОД и рассчитывает на круглосуточную работу коммерческого проекта, оставлять единственную точку отказа в виде одного кабеля питания не всегда рационально.

Как работают два блока питания в физическом сервере

Два блока питания в сервере обычно называются redundant PSU. Они не предназначены для того, чтобы удвоить производительность процессора или обеспечить машине в два раза больше энергии. Их основная задача — позволить системе продолжать работу после отказа одного блока.

Допустим, сервер под нагрузкой потребляет 300 Вт, а в нём установлены два блока по 750 Вт. Это не означает потребление 1500 Вт. Оба источника обслуживают одну и ту же систему, а способ распределения нагрузки зависит от модели сервера и настроек контроллера.

В одном режиме оба блока работают одновременно и делят нагрузку между собой. В другом один используется активнее, а второй остаётся резервным. Производители могут применять собственные алгоритмы для повышения эффективности и срока службы.

Для владельца сайта важнее другое: при отключении одного блока второй должен самостоятельно обеспечить сервер достаточной мощностью.

Если вытащить кабель первого исправного PSU и сервер продолжает нормально работать на втором, аппаратное резервирование выполняет свою базовую задачу. После возвращения питания система снова видит оба источника.

На большинстве профессиональных платформ блоки питания являются горячезаменяемыми. Если один вышел из строя, инженер дата-центра может извлечь его из работающей машины и установить новый без остановки операционной системы.

Сайт, база данных и остальные сервисы в этот момент продолжают работать.

Два блока питания и две линии питания не одно и то же

Представим простую схему. У сервера два PSU. Оба кабеля подключены к одному блоку распределения питания в стойке. Пока всё исправно, оборудование действительно использует два источника питания.

Если ломается PSU №1, сервер остаётся на PSU №2. Здесь резервирование работает.

Если ломается сам PDU или пропадает питание линии, к которой он подключён, электричество одновременно исчезает у обоих блоков. Сервер выключается.

Получается, что схема защищена от отказа отдельного PSU, но не от отказа общего участка инфраструктуры.

Именно поэтому в дата-центрах используют условные линии A и B. Первый блок сервера подключается к PDU A, второй — к PDU B. В идеале эти PDU получают питание через независимые ветви инженерной инфраструктуры.

Точная архитектура зависит от ЦОД. За стойкой могут находиться разные PDU, дальше разные распределительные линии, ИБП и другие элементы системы питания. Клиенту одного сервера необязательно разбираться во всей электрической схеме площадки, но смысл вопроса должен быть понятен.

Нужно спросить у оператора не просто можно ли подключить два блока питания, а действительно ли две розетки относятся к независимым A/B-линиям.

Это особенно важно потому, что внешне схема может выглядеть правильно. Из сервера выходят два кабеля, каждый подключён отдельно, но оба пути где-то выше сходятся в одну точку отказа.

Полностью независимой инфраструктуры без каких-либо общих элементов практически не бывает. Задача резервирования состоит не в магическом устранении всех возможных аварий, а в том, чтобы отказ одного ожидаемого компонента не отключал сервис.

Поэтому для colocation важна согласованная схема ЦОД, а не количество кабелей само по себе.

Стоит проверить и возможности самого сервера. Не каждый компьютер с двумя установленными блоками автоматически поддерживает полноценный режим резервирования. В профессиональном серверном оборудовании это штатная функция, а в самосборных системах конфигурация может быть другой.

Полезно заранее посмотреть документацию производителя и выполнить простой тест до перевозки в дата-центр.

Сервер запускается под заметной нагрузкой, после чего по очереди отключается питание каждого блока. Машина не должна выключаться или перезагружаться. Аппаратный контроллер должен зафиксировать потерю одного PSU и затем его возвращение.

Если этот тест не проходит в офисе, две линии дата-центра проблему не исправят.

Особое внимание стоит уделить мощности одного блока. Для настоящего резервирования каждый PSU должен быть способен в одиночку обеспечить работу текущей конфигурации.

Представим систему, которая при полной нагрузке потребляет 900 Вт, а в неё каким-то образом установлены два блока по 600 Вт. Пока они работают вместе, мощности может хватать. После отказа одного оставшиеся 600 Вт уже не соответствуют потребностям машины.

Получается резервирование компонентов без достаточного резерва мощности.

На заводских конфигурациях производителей вроде Dell, HPE, Lenovo и Supermicro совместимость обычно рассчитывается заранее. Но после серьёзной самостоятельной модернизации, особенно установки GPU, проверить энергетический баланс всё равно полезно.

Система может прекрасно работать годами, а проблема проявится именно в тот день, когда один БП выйдет из строя и второй внезапно останется один под максимальной нагрузкой.

Состояние источников питания обычно видно через IPMI, iDRAC, iLO или другой BMC. Контроллер показывает, присутствует ли каждый PSU, получает ли он входное питание и имеются ли аппаратные ошибки.

Такой мониторинг особенно полезен при colocation. Сервер стоит далеко от администратора, и физически увидеть погасший индикатор невозможно.

Если один блок отказал, сайт может продолжить работать абсолютно нормально. Без мониторинга проблема останется незаметной, а сервер неделями будет жить без резервирования. Следующий отказ уже способен привести к остановке.

Поэтому состояние PSU нужно контролировать так же, как RAID и накопители.

Когда стоит оплачивать две линии питания при colocation

Здесь нет универсального ответа. Дополнительная линия может входить в тариф, а может заметно увеличивать стоимость размещения. Поэтому необходимость зависит от ценности доступности конкретного проекта.

Для небольшого тестового сервера, личного проекта или резервной машины один ввод питания иногда совершенно оправдан. Даже если сервер оснащён двумя PSU, платить каждый месяц за полноценную A/B-схему может быть экономически бессмысленно.

Для основного интернет-магазина ситуация другая. Компания уже оплачивает собственное оборудование, место в дата-центре, интернет и администрирование. Если простой непосредственно приводит к потерянным заказам, небольшая экономия на втором питании начинает выглядеть менее привлекательной.

Полезно оценивать не цену дополнительной розетки сама по себе, а стоимость возможного простоя.

Допустим, второй ввод обходится в определённую сумму ежемесячно. Если час недоступности интернет-магазина стоит бизнесу намного больше годовой стоимости резервирования, выбор становится очевиднее.

Но резервное питание одного сервера не решает все проблемы доступности.

Даже идеально подключённая машина может остановиться из-за материнской платы, процессора, ошибки операционной системы или повреждения данных. Две A/B-линии защищают только от определённого класса отказов.

Это важный принцип любой отказоустойчивости: каждая технология закрывает свою часть риска.

RAID помогает пережить отказ отдельных накопителей. Два PSU помогают пережить проблему одного источника питания. Два сетевых подключения способны уменьшить зависимость от одного сетевого пути. IPMI даёт аварийный административный доступ.

Но всё это по-прежнему находится внутри одного физического сервера.

Если ломается материнская плата, две розетки её не заменят.

Поэтому для действительно критичного проекта следующим уровнем после резервирования компонентов становится второй сервер. Сервис распределяется между несколькими машинами или имеет резервный узел, способный принять работу после серьёзной аппаратной аварии.

Но строить кластер только потому, что обычный сайт должен иногда быть доступен, тоже не всегда рационально. Между одним кабелем в офисной розетке и полноценной геораспределённой инфраструктурой существует много промежуточных вариантов.

Для одного физического сервера A/B-питание является сравнительно простым способом убрать одну очевидную точку отказа.

При заказе услуги нужно выяснить, сколько розеток входит в тариф. В некоторых предложениях colocation второе подключение уже предусмотрено для оборудования с резервными блоками. В других каждая дополнительная линия тарифицируется отдельно.

Важно уточнить и доступную мощность каждой линии.

Если серверу выделено условно определённое количество ватт, это не обязательно означает, что такую же мощность можно независимо потреблять из A и B одновременно. Чаще речь идёт об общей допустимой нагрузке оборудования.

Смысл двух вводов заключается не в удвоении потребления, а в способности перенести полную рабочую нагрузку на оставшийся путь после отказа одного из них.

Поэтому вопрос к дата-центру должен звучать конкретно: сможет ли сервер продолжить работу с полной согласованной мощностью, если линия A станет недоступна и вся нагрузка останется на B.

Это намного информативнее, чем просто наличие двух PDU в стойке.

Стоит узнать и то, что происходит во время планового обслуживания системы питания. Одно из преимуществ хорошо построенной резервированной инфраструктуры заключается именно в возможности обслуживать часть элементов без отключения клиентского оборудования.

Если одна ветвь выводится из эксплуатации, сервер продолжает получать электричество по второй.

Для клиента это один из наиболее практичных сценариев использования двух PSU. Речь идёт не только об авариях, но и о штатных инженерных работах в ЦОД.

Правильно подключённый сервер при этом вообще не должен заметить обслуживание одной линии.

Но перед первой эксплуатацией полезно проверить, действительно ли оба блока работают. После установки оборудования администратор через BMC может убедиться, что PSU1 и PSU2 видны и получают питание.

Если один из них отображается как отсутствующий или потерявший входное напряжение, проблему лучше решить сразу.

Иногда причина банальна: кабель вставлен не до конца, розетка отключена или блок питания не зафиксирован в шасси.

Ждать реального отказа для проверки резервирования не нужно.

При самостоятельной сборке стоит обратить внимание и на силовые кабели. Они должны соответствовать мощности оборудования и разъёмам конкретных блоков питания. Использовать случайный старый кабель только потому, что он физически подходит, для серьёзной серверной машины не лучшая идея.

Особенно внимательно нужно относиться к мощным GPU-серверам. Там нагрузки значительно выше, а типы силовых подключений могут отличаться от обычных офисных компьютеров.

Профессиональный ЦОД обычно заранее запрашивает параметры оборудования именно по этой причине.

Если сервер имеет только один блок питания, получить настоящее A/B-резервирование непосредственно внутри машины сложнее. Один кабель нельзя одновременно подключить к двум независимым линиям обычным способом.

Для такого оборудования существуют автоматические переключатели питания ATS. Устройство получает электричество от двух источников и при потере основного переключает нагрузку на резервный.

Это позволяет подключить одношнуровое оборудование к резервированной системе электроснабжения ЦОД.

Но для одного обычного сервера проще и надёжнее изначально использовать модель с двумя hot-swap PSU, если высокая доступность действительно важна.

ATS чаще становится интересным для сетевых устройств, систем хранения или другого оборудования, которое имеет лишь один вход питания.

При расчёте мощности сервера для colocation поэтому полезно сразу учитывать и схему резервирования. Недостаточно знать среднее количество ватт. Нужно понимать, способна ли каждая ветвь самостоятельно обслуживать машину после отказа второй.

Есть ещё один нюанс: наличие двух независимых линий в одной стойке не превращает один дата-центр в две площадки.

Крупная авария здания, серьёзная проблема инженерной инфраструктуры или другая площадочная неисправность теоретически способна затронуть обе ветви.

Поэтому проекты, которым необходимо переживать потерю целого ЦОД, используют географическое резервирование. Второй сервер размещается на другой площадке и получает независимую инфраструктуру.

Для большинства сайтов такой уровень избыточен. Но важно понимать границу защиты.

A/B-питание отвечает за устойчивость внутри одной площадки и одной физической машины. Оно не заменяет резервный ЦОД.

То же касается дизель-генераторов. Владельцу одного сервера обычно не нужно разбираться, какой марки генераторы стоят на территории. Важнее знать, что между внешней сетью, ИБП, резервной генерацией и серверной стойкой построена система, рассчитанная на отказ отдельных компонентов.

ЦОД должен регулярно тестировать резервные элементы. Генератор, который существует только на фотографии и никогда нормально не проверяется под нагрузкой, даёт меньше уверенности, чем хорошо обслуживаемая и документированная система.

Клиент не сможет самостоятельно провести аудит всей энергетической инфраструктуры, поэтому здесь имеют значение репутация площадки, техническая документация, сертификация и прозрачность оператора.

Но схему подключения собственного сервера проверить как раз довольно легко.

Перед заказом достаточно задать несколько вопросов: есть ли независимые A/B-линии, сколько подключений входит в тариф, относятся ли они к разным PDU, может ли каждая линия выдержать полную нагрузку сервера и как ЦОД уведомляет о проблемах питания.

После установки нужно посмотреть через BMC, что оба блока действительно активны.

И наконец, мониторинг должен сообщить администратору, если один PSU или одна линия пропали.

Получается сравнительно простая схема, которая не требует сложного программного кластера и при этом устраняет несколько вполне реальных причин простоя.

Для некритичного сервера можно осознанно отказаться от неё и сэкономить. Это тоже нормальное решение, если последствия отключения невелики.

Проблемой становится не отсутствие второго питания само по себе, а ситуация, когда владелец уверен в полном резервировании только потому, что на задней панели машины установлены два одинаковых блока.

Два PSU дают возможность построить отказоустойчивое питание. Реальным резервированием эта возможность становится только после подключения к правильно организованным независимым линиям.

Оцените статью
Рейтинг хостингов
Добавить комментарий