Современный дата-центр для искусственного интеллекта внешне может почти не отличаться от обычного ЦОД. Те же серверные стойки, резервное электропитание, магистральные каналы связи, системы доступа и круглосуточные инженеры. Главное отличие становится заметно внутри стойки. Там, где традиционный дата-центр размещает десятки относительно обычных серверов, инфраструктура для ИИ может быть собрана вокруг мощных GPU-кластеров, которые требуют намного больше электричества, выделяют огромное количество тепла и постоянно передают большие объёмы данных между вычислительными узлами.
Поэтому дата-центр для ИИ нельзя получить простой установкой нескольких серверов с видеокартами в свободные стойки. Чем крупнее кластер, тем сильнее приходится менять саму инженерную инфраструктуру здания. Возрастают требования к электроснабжению, охлаждению, сетям, системам хранения и даже расположению оборудования относительно друг друга.
Именно отсюда появился термин AI-ready data center — ЦОД, подготовленный к размещению высокоплотных вычислительных систем. Ещё чаще крупную инфраструктуру для обучения моделей называют AI factory. Смысл здесь довольно точный: такой объект превращает электричество и данные в вычисления примерно так же, как промышленное предприятие превращает сырьё в готовую продукцию.
Для владельца обычного сайта подобные мощности избыточны. WordPress, интернет-магазину или корпоративному порталу совершенно не нужен специальный дата-центр для искусственного интеллекта. Но для компаний, которые обучают нейросети, запускают большие языковые модели, занимаются компьютерным зрением, научными расчётами или предоставляют GPU в аренду, возможности площадки становятся критичными.
Можно купить очень дорогие ускорители и всё равно получить неудобную инфраструктуру, если ЦОД не способен предоставить достаточно мощности, охлаждения или быстрых соединений между серверами.
Почему обычного дата-центра может не хватить для больших GPU-кластеров
Главная проблема начинается с электричества. Обычная серверная стойка может десятилетиями проектироваться под сравнительно умеренную нагрузку. Внутри расположены веб-серверы, системы хранения, сетевое оборудование и другие машины, каждая из которых потребляет несколько сотен ватт.
GPU-кластер меняет эту математику. Один сервер с несколькими производительными ускорителями способен потреблять несколько киловатт, а плотная стойка из таких машин уже требует десятки киловатт. Современные специализированные системы идут ещё дальше и могут создавать нагрузку, совершенно непривычную для традиционного серверного зала.
Для дата-центра это означает, что мало найти свободное место в шкафу. Электроэнергию нужно сначала подвести к зданию, затем распределить через трансформаторы, ИБП, шинопроводы и PDU и сделать всё это с необходимым резервированием.
Если зал проектировался много лет назад под сравнительно небольшую мощность на стойку, свободные юниты внутри шкафа не помогут. Электрический лимит может быть исчерпан намного раньше физического пространства.
Поэтому новые AI-площадки часто строят там, где можно получить крупные энергетические мощности. Для огромного вычислительного кластера местоположение рядом с доступной генерацией иногда оказывается важнее близости к центру большого города.
Есть и ещё одна особенность GPU. Во время обучения модели ускорители могут работать с высокой загрузкой часами и днями. Это не веб-сервер, который большую часть времени ждёт очередного запроса пользователя.
Энергопотребление получается длительным и предсказуемо высоким. Инженерным системам приходится постоянно отводить соответствующее количество тепла.
Воздушного охлаждения становится недостаточно
Практически вся электроэнергия, которую потребляет сервер, в итоге превращается в тепло. Если стойка потребляет несколько десятков киловатт, примерно такую же тепловую мощность приходится удалять из машинного зала.
Обычный ЦОД делает это холодным воздухом. Кондиционеры охлаждают его, он проходит через серверы, забирает тепло и возвращается в систему охлаждения.
Эта схема прекрасно работает для огромного количества серверов и никуда не исчезает. Но по мере роста плотности оборудования прокачивать необходимый объём воздуха через одну стойку становится всё сложнее.
Именно поэтому в инфраструктуре для ИИ всё чаще используется жидкостное охлаждение. Жидкость значительно эффективнее переносит тепло, чем воздух, и может подводиться непосредственно к наиболее горячим компонентам.
Один из распространённых вариантов — direct-to-chip. На GPU, CPU и другие горячие компоненты устанавливаются холодные пластины, через которые циркулирует теплоноситель. Он забирает тепло прямо рядом с источником и передаёт его в систему дата-центра.
Между сервером и общей инженерной системой обычно появляется отдельный контур с CDU — блоком распределения охлаждающей жидкости. Он позволяет управлять потоком, давлением и теплообменом между оборудованием и инфраструктурой здания.
Для владельца обычного сервера эти детали могут показаться избыточными, но для AI-кластера они становятся такой же частью площадки, как электропитание или сетевой порт.
При этом жидкостное охлаждение не означает, что весь дата-центр обязательно заполнен трубками вместо вентиляторов. На одной площадке могут одновременно работать обычные воздушные стойки, гибридные системы и полностью жидкостные зоны.
Поэтому важнее не наличие модной технологии, а возможность ЦОД обслуживать конкретное оборудование.
Если компания привозит стандартный GPU-сервер с воздушным охлаждением, специально искать жидкостную площадку необязательно. Совсем другая ситуация возникает с плотным кластером, который изначально рассчитан производителем на жидкостное охлаждение.
В нашем материале про размещение GPU-сервера в дата-центре речь идёт именно об одной или нескольких машинах клиента, тогда как большой AI-ЦОД должен решать те же задачи уже в масштабе десятков и сотен стоек.
Следующее отличие — сеть.
В обычном хостинге сервер в первую очередь общается с пользователями. Для него важна скорость выхода в интернет, хорошие маршруты и защита от сетевых атак.
Во время обучения большой модели основная масса сетевого обмена способна происходить вообще внутри вычислительного кластера.
GPU на одном сервере должны постоянно синхронизироваться с ускорителями на других узлах. Чем крупнее модель и больше количество машин, тем важнее скорость и задержка внутренней сети.
Если вычислительные узлы регулярно ждут данные друг от друга, дорогие ускорители начинают простаивать. В итоге проблема сети превращается прямо в финансовую проблему: компания оплачивает GPU и электричество, но часть времени оборудование ничего полезного не считает.
Поэтому AI-кластеры используют высокоскоростные соединения с очень большой пропускной способностью и низкой задержкой. В зависимости от архитектуры применяются специализированные решения InfiniBand или быстрый Ethernet.
Здесь становится важна не только скорость отдельного порта. Огромное значение имеет топология всей сети, количество уровней коммутации и возможность обеспечить необходимую полосу между любыми узлами кластера.
Для обычного сервера подключение 1 Гбит/с может быть более чем достаточным. В крупной AI-инфраструктуре речь идёт уже о совсем другом масштабе внутреннего обмена.
Хранилище тоже становится частью вычислительной системы
Нейросеть невозможно обучать без данных. Иногда это миллионы изображений, документов, аудиозаписей, видеороликов или других объектов.
GPU должны получать эти данные достаточно быстро. Если ускорители постоянно ждут медленную систему хранения, бессмысленно увеличивать количество вычислительных серверов.
Поэтому AI-дата-центр обычно рассматривает серверы, сеть и хранилище как единую систему.
Для небольшого проекта набор данных можно хранить на локальных NVMe каждого сервера. На большом кластере такой подход становится неудобным. Появляются распределённые файловые системы, объектные хранилища и отдельные высокопроизводительные системы хранения.
Особенно сложна ситуация, когда один и тот же массив данных должен одновременно читать большой парк GPU-серверов.
Обычная корпоративная СХД, отлично работающая с офисными виртуальными машинами, может оказаться слишком медленной для такого сценария.
Отсюда ещё одно отличие AI-ready площадки. Недостаточно предложить клиенту стойки под GPU. Нужно иметь возможность организовать быструю сеть между вычислительными узлами и хранилищем.
Большие объёмы данных влияют и на резервное копирование. Если исходный набор занимает петабайты, классический ночной backup становится совершенно другой задачей, чем копирование обычной базы сайта.
Поэтому компания заранее решает, какие данные действительно уникальны, какие можно восстановить из исходных источников, как хранить контрольные точки обучения и где держать копии наиболее ценной информации.
Как устроен современный дата-центр для искусственного интеллекта
Разница между обычным ЦОД и AI-площадкой хорошо заметна, если посмотреть на проектирование не отдельного сервера, а всего здания.
Традиционный дата-центр старается эффективно заполнить серверный зал. Для AI-инфраструктуры главным ограничением всё чаще становится не площадь, а количество мегаватт, которое можно подвести к объекту и безопасно отвести в виде тепла.
Пустое место в машинном зале не имеет ценности, если энергетическая инфраструктура уже работает на пределе.
Поэтому мощность становится одним из главных ресурсов AI-дата-центра.
Следом идёт резервирование. Большой кластер может состоять из сотен или тысяч ускорителей, и единичный отказ оборудования в такой системе практически неизбежен. Архитектура должна быть рассчитана на замену компонентов без остановки всей площадки.
Резервируются линии электроснабжения, насосы, охлаждающие контуры, сетевые элементы и другие критичные системы.
Но бесконечное резервирование тоже стоит денег. Если каждый элемент удвоить, стоимость AI-площадки резко увеличится.
Поэтому инженерам приходится искать баланс между доступностью и экономикой. Для банковской транзакционной системы последствия минуты простоя одни, для обучающего кластера — другие.
Некоторые вычислительные задачи можно повторно запустить с контрольной точки. Это позволяет проектировать инфраструктуру иначе, чем классический критичный ЦОД для финансовых систем.
Большое значение имеет и модульность.
AI-оборудование развивается настолько быстро, что дата-центр, спроектированный исключительно под сегодняшние ускорители, рискует морально устареть раньше окончания строительства.
Поэтому современные площадки стараются закладывать возможность повышать плотность мощности, менять системы охлаждения и подключать новые поколения серверов.
Это одна из причин, почему появляются готовые модульные блоки электропитания и жидкостного охлаждения. Вместо полной перестройки здания оператор может постепенно добавлять новые высокоплотные зоны.
Ещё один важный фактор — физическая масса оборудования.
Плотные GPU-системы, шины питания, распределительные блоки и жидкостная инфраструктура делают стойку заметно тяжелее. Пол серверного зала должен быть рассчитан на такие нагрузки.
Нужно учитывать и обслуживание. Инженеру требуется физически добраться до тяжёлой машины, отключить жидкостные соединения, заменить компонент и вернуть систему в работу.
То, что удобно при одном сервере, может быть совершенно неудобно в зале с сотнями одинаковых платформ.
Поэтому крупные AI-кластеры всё чаще проектируются сразу как законченные блоки, где заранее продуманы питание, охлаждение, сеть, кабели и обслуживание.
Есть и экономическая особенность.
В традиционном colocation оператор продаёт клиенту несколько U, часть стойки или целую стойку. Для AI-инфраструктуры цена всё сильнее привязывается к киловаттам.
Два клиента могут занять одинаковое физическое пространство, но один установит обычные веб-серверы, а другой заполнит шкаф GPU. Нагрузка на инженерную инфраструктуру окажется совершенно разной.
Поэтому стоимость AI-colocation логично оценивать через полный набор ресурсов: электричество, охлаждение, сеть, физическое место и необходимые дополнительные сервисы.
Для крупного проекта особенно важно заранее определить возможность масштабирования.
Допустим, сегодня компания арендует инфраструктуру под двадцать GPU-серверов. Через год задача выросла до ста.
Если рядом нет электрической мощности и подходящего охлаждения, новые стойки придётся размещать в другом зале или вообще на другой площадке. Это усложняет сеть и работу распределённого кластера.
Поэтому для AI-проекта вопрос сколько мощности можно получить через год иногда важнее сегодняшней цены.
Отдельная тема — расположение дата-центра.
Для веб-хостинга часто хочется быть ближе к аудитории, чтобы уменьшить задержку. Большой обучающий AI-кластер не всегда требует размещения в центре Москвы или Санкт-Петербурга.
Если его основная задача заключается в длительном обучении моделей, намного важнее доступная электроэнергия, охлаждение и магистральная связь.
Именно поэтому в мире всё больше крупных вычислительных площадок строится там, где есть свободные энергетические мощности, а не обязательно рядом с крупнейшими городскими офисами.
При этом сервис инференса ведёт себя иначе.
Если модель уже обучена и отвечает миллионам пользователей в режиме реального времени, задержка становится намного важнее. Тогда вычислительные мощности могут распределяться между несколькими регионами ближе к аудитории.
Получается, что даже внутри искусственного интеллекта существуют разные требования к дата-центрам.
Обучающий кластер ценит мощность и масштаб. Публичный AI-сервис дополнительно требует хорошей сетевой связности и географического распределения.
Поэтому формулировка дата-центр для ИИ сама по себе ещё не описывает конкретную инфраструктуру.
Перед выбором площадки компании нужно знать тип оборудования, количество GPU, потребление стоек, способ охлаждения, объём данных, требования к внутренней сети и планы роста.
Если речь идёт о нескольких обычных серверах с одной или двумя видеокартами, специализированная AI-площадка может вообще не понадобиться. Подходящий коммерческий ЦОД способен прекрасно обслужить такие машины в стандартной высокоплотной зоне.
Специализированные решения начинают оправдываться по мере роста кластера.
Именно поэтому рынок постепенно разделяется. Обычные дата-центры продолжают обслуживать сайты, облака, корпоративные системы и классический colocation, а рядом появляются площадки и отдельные залы, рассчитанные на значительно более высокую плотность вычислений.
Это не означает, что традиционные ЦОД исчезнут. Большинство интернет-проектов ещё очень долго не будет нуждаться в сотнях GPU или жидкостном охлаждении.
Скорее дата-центры становятся более разнообразными.
Одни залы рассчитаны на классические серверы, другие на системы хранения, третьи на GPU-кластеры. Внутри одного крупного кампуса могут одновременно работать все эти варианты.
Для владельца бизнеса главное преимущество такой специализации заключается в возможности не строить собственную инженерную инфраструктуру ради вычислительного проекта.
Компания покупает или арендует GPU, размещает их на подготовленной площадке и получает электричество, охлаждение и сеть как услугу.
Но экономить на выборе ЦОД здесь особенно опасно. Дорогие ускорители должны быть постоянно загружены полезной работой. Проблемы с охлаждением, нехватка сетевой полосы или невозможность расширить кластер способны стоить значительно больше небольшой разницы в тарифах.
Поэтому хороший дата-центр для ИИ определяется не количеством модных слов на сайте. Важнее реальные доступные киловатты, поддерживаемая плотность стоек, схема охлаждения, внутренняя сеть, возможность подключить быстрое хранилище и готовность площадки к следующему поколению оборудования.
Именно эти параметры превращают обычное помещение с серверными стойками в инфраструктуру, способную обслуживать большие системы искусственного интеллекта.








