Почему дата-центры для ИИ такие дорогие? Структура затрат: закупка GPU, электричество, охлаждение и стоимость каждого вывода модели

В 2024 году дата-центры потребили около 415 ТВт·ч электроэнергии — примерно 1,5% мирового потребления; в базовом сценарии Международное энергетическое агентство ожидает около 945 ТВт·ч к 2030 году (оценка спроса на электроэнергию для дата-центров и ИИ). Эти показатели описывают масштаб энергопотребления, но не цену отдельного запроса.

Симптом: вы видите высокий счёт за ИИ-сервис и пытаетесь объяснить его ценой GPU.
Быстрое решение: разделите капитальные затраты на оборудование и площадку, текущие расходы на эксплуатацию и стоимость обслуженного запроса; последняя зависит также от загрузки, модели и всей цепочки обработки.

Статья пригодится разработчикам, которым нужно понять, из чего складывается плата за облачный инференс. Техническим студентам она поможет связать работу вычислителей с электроснабжением и охлаждением. Ответственным за бюджет продукта — отделить расходы инфраструктуры от статей, которые могут попасть в счёт сервиса.

Сначала разделите общий бюджет и стоимость вывода модели

Вопрос «почему дата-центры для ИИ такие дорогие?» не имеет одного ответа, пока не уточнено, какие расходы сравниваются. Покупка серверов и подготовка площадки — это инвестиции. Электроэнергия, обслуживание и сетевые услуги — повторяющиеся операционные траты. Стоимость вывода модели — расчётная доля затрат, отнесённая к выполненной работе: запросу, токенам или иному принятому показателю.

Эти уровни связаны, но не взаимозаменяемы. Общая сумма вложений не говорит, сколько стоит один ответ модели. Чтобы получить такую оценку, нужно выбрать период, определить объём выполненной работы за этот период и понять, какие расходы включены в расчёт. Если сравнивать один сервис с другим, правила учёта должны совпадать: иначе в одном случае могут учитываться только вычисления, а в другом — ещё хранение, сеть и обслуживание.

Загрузка оборудования особенно важна. Если сервер большую часть времени простаивает, вложения и готовность к работе распределяются на меньшее количество полезных запросов. При высокой загрузке те же расходы могут приходиться на больший объём вычислений — но только пока сервис не упирается в пропускную способность, память, сеть или требования к задержке. Поэтому универсального значения стоимости инференса без описания нагрузки не существует.

Шаг первый: оцените GPU и всю серверную платформу

Затраты на закупку GPU заметны, но цена ускорителей не равна цене вычислительной системы. Для запуска и обслуживания модели нужны серверы, совместимая память, сетевые интерфейсы, хранилище, стойки и компоненты, обеспечивающие питание и охлаждение. Затем возникают расходы на установку, проверку, настройку программной среды и замену оборудования по мере его старения или изменения требований к нагрузке.

Официальные материалы по проектированию вычислительных систем связывают конфигурацию серверов с требованиями к мощности и отводу тепла; это помогает понять, почему ускоритель нельзя считать изолированной единицей затрат. Например, руководство по проектированию центра обработки данных для системы DGX H100 рассматривает инфраструктуру как взаимосвязанную систему, а не как перечень отдельных GPU. Руководство по конфигурациям серверов с ускорителями PCIe отдельно показывает, что расчёт питания и теплового режима относится к проектированию платформы.

При оценке закупки проверьте, что именно включено в стоимость: только вычислительные устройства или готовый сервер, подключение к сети, доставка, интеграция и ввод в эксплуатацию. Не забывайте и о стоимости замены: если оборудование покупается на ограниченный срок службы, первоначальные расходы необходимо распределить по сроку использования. Но нельзя механически делить цену на календарное время — значение имеет, сколько полезной работы система выполнила за этот период и сколько времени оставалась доступной.

Уровень затрат Что обычно включают Что нужно уточнить при сравнении
Капитальные вложения GPU, серверы, сеть, хранилище, стойки и подготовка площадки Закуплены ли только компоненты или готовая система; какой период амортизации принят
Эксплуатация Электроэнергия, охлаждение, обслуживание, персонал и резервирование Какие расходы учитываются постоянно, а какие возникают при конкретной нагрузке
Сервисная стоимость Вычисления, обработка запросов, хранение и передача данных За какую единицу ведётся расчёт и какие операции включены в счёт

Эта таблица — не универсальная бухгалтерская классификация для каждого поставщика. Её задача — помочь вам задать вопросы о границе учёта. В частности, не сравнивайте цену вычислений без дополнительных услуг с тарифом, в который уже включены обработка запросов или передача данных.

Почему GPU требуют затрат на электроснабжение и охлаждение?

Работа вычислительного оборудования потребляет энергию, а часть этой энергии превращается в тепло, которое нужно отводить. Значит, стоимость питания не исчерпывается электроэнергией, поступившей непосредственно к серверу: площадке также нужны системы распределения питания и инженерная инфраструктура, способная поддерживать работу оборудования. Точная величина зависит от конкретной конфигурации, режима загрузки и конструкции помещения; без этих исходных данных нельзя переносить показатель одной площадки на все дата-центры.

Руководство по проектированию DGX H100 описывает требования к организации площадки, размещению систем и условиям работы вычислительной инфраструктуры (официальное руководство по проектированию). Это полезный технический ориентир для понимания категорий затрат, но не готовый расчёт вашего объекта: проектные требования конкретной системы не задают фактическое потребление или стоимость любого другого центра обработки данных.

Охлаждение также нельзя свести к одной универсальной технологии или коэффициенту эффективности. Имеют значение тепловая нагрузка, выбранное оборудование, размещение серверов, доступная мощность и возможности отвода тепла. Даже если вычислительная часть помещается в стойку, ограничением может стать подвод питания или способность охладить эту стойку. Поэтому при планировании расширения важно выяснить не только, сколько серверов можно купить, но и сколько площадка сможет надёжно запитать и обслужить.

Чтобы корректно разбирать энергозатраты и охлаждение дата-центра, зафиксируйте границу измерения. Вы учитываете только энергопотребление серверов или также инфраструктуру здания? Показатель относится к отдельной стойке, всему объекту или группе площадок? Каков временной интервал и каким прибором или отчётной системой сняты значения? Международное энергетическое агентство рассматривает использование электричества дата-центрами на уровне отрасли и подчёркивает масштаб общего спроса (анализ энергопотребления дата-центров). Для отдельного объекта нужны его собственные измерения.

Сходное предостережение применимо к данным по стране. Отчёт Министерства энергетики США об использовании энергии дата-центрами с обновлением за 2025 год полезен для контекста американской инфраструктуры, но его агрегаты нельзя выдавать за показатель отдельного сервиса или считать типичным результатом для площадки в другой стране.

Шаг второй: проверьте ограничения помещения, сети и эксплуатации

Даже при достаточном бюджете закупка не гарантирует, что вычислительные ресурсы можно сразу включить в работу. Проект должен согласовать доступную электрическую мощность, размещение оборудования, отвод тепла, сетевые соединения и обслуживание. Если любой из этих ресурсов ограничен, часть купленных GPU может оказаться недоступной для планируемой нагрузки. Это скрытая стоимость: вы оплатили готовность оборудования, но не можете использовать его в нужном объёме или режиме.

Есть и расходы, которые не всегда видны в оценке стоимости одного устройства. Команде нужно установить и обновлять программную среду, следить за состоянием серверов, диагностировать сбои и планировать ремонт. Для критичного сервиса могут потребоваться резервные мощности, чтобы сохранить доступность при отказе отдельных компонентов или во время обслуживания. Резерв снижает риск перерыва, однако сам по себе не создаёт дополнительных обработанных запросов: его стоимость должна быть учтена при расчёте полезной работы.

Сетевые расходы зависят от того, как модель включена в продукт. Запрос может требовать передачи входных данных, обращения к хранилищу, ответа клиенту или связи между компонентами сервиса. Если вы учитываете только GPU-время, но исключаете передачу данных и хранение, полученная стоимость неполна. В официальной документации по облачной оптимизации затрат отдельно рассматривается планирование стоимости передачи данных (руководство по планированию расходов на передачу данных). Это помогает проверить, не потерялась ли сеть за строкой «вычисления» в вашей модели расходов.

На распределение затрат влияет и спрос. При неравномерной нагрузке системе может понадобиться запас производительности для коротких пиков, хотя в спокойное время этот запас будет использоваться не полностью. Если же оптимизировать инфраструктуру только под среднее значение, в часы максимального спроса могут вырасти задержки или число необслуженных запросов. Выбирайте целевой уровень обслуживания заранее: тогда будет понятно, почему в расчёте присутствуют резервы, и как они соотносятся с фактически обработанным объёмом.

Если вы параллельно оцениваете среду для разработки или тестирования клиентской части, не приравнивайте её к вычислительной платформе для обучения или обслуживания крупных моделей: это разные задачи и разные классы ресурсов. Временная среда на Mac может подойти для проверки приложения, но сама по себе не заменяет GPU-инфраструктуру для инференса.

Как затраты дата-центра переходят в стоимость вывода модели?

Стоимость инференса — это не синоним стоимости GPU. На неё влияют вычислительные ресурсы, время обработки, размер и поведение модели, подготовка входных данных, требования к задержке, а также сервисная цепочка вокруг модели. При расчёте за запрос полезно определить, какие операции относятся к обслуживанию этого запроса. При расчёте за токены необходимо установить, какие именно токены и этапы обработки включены. Разные единицы измерения нельзя сравнивать без такого пояснения.

Упрощённо можно представить расчёт как сумму относимых затрат за выбранный период, делённую на число обслуженных единиц работы за тот же период. В числитель могут входить амортизация оборудования, электричество, охлаждение, персонал, сеть и другие выбранные статьи. В знаменатель — запросы, токены или другая согласованная единица. Формула не отменяет необходимости определить границы: два расчёта с одинаковой арифметикой могут давать несопоставимые результаты, если один включает резервирование и хранение, а другой нет.

Для чтения облачного счёта отделяйте вычисления от сопутствующих услуг. Официальное описание принципов тарификации облачного сервиса перечисляет разные категории начислений, а не только вычислительные ресурсы (объяснение категорий облачной тарификации). В вашем счёте могут иметь значение выбранная услуга, срок использования ресурсов, объём хранения и передача данных. Поэтому итоговую стоимость продукта не следует выводить из одной ставки на вычисления или из общей оценки строительства дата-центра.

Представьте, что ваша команда запускает модель для сервиса с резко меняющимся числом обращений. Если взять расходы площадки за год и разделить их на плановый объём обращений, получится оценка, чувствительная к прогнозу спроса: недобор запросов увеличит распределённую стоимость, а неожиданный пик может потребовать дополнительного резерва или повысить задержку. Если считать только периоды фактической активности, можно недооценить стоимость готовности к обслуживанию в остальное время. Для решения о бюджете стоит рассмотреть оба ракурса и явно указать, какой из них используется.

Используйте следующий список условий, чтобы выбрать способ оценки:

  • Если вы сравниваете поставщиков облачного инференса, сначала сопоставьте единицы тарификации, включённые услуги, правила оплаты хранения и передачи данных. Иначе сравнение ставок на вычисления не покажет полный счёт.
  • Если вы планируете собственную инфраструктуру, разнесите разовые закупки и подготовку площадки отдельно от повторяющихся расходов на энергию, персонал и обслуживание; затем задайте срок расчёта и прогноз нагрузки.
  • Если спрос сильно колеблется, рассчитайте отдельные сценарии средней и пиковой загрузки, а также учтите стоимость резерва. Не подменяйте переменную загрузки усреднённым показателем без источника.
  • Если у вас нет проверенных сведений о потреблении, закупке и объёме обработанных запросов, не публикуйте точную цену одного вывода. Сначала соберите измерения либо используйте счёт поставщика с раскрытыми категориями, а до этого обозначайте оценку как сценарную.

Завершите расчёт проверкой границ

Перед тем как включать оценку в бюджет продукта, запишите, что именно измеряется и за какой период. Для инфраструктурной модели перечислите оборудование, помещение, электроснабжение, охлаждение, сеть, обслуживание и резервирование. Для стоимости сервиса укажите единицу работы, способ учёта загрузки и расходы, уже включённые в тариф. Если исходные данные получены из отчёта о другом объекте, обозначьте их как контекст, а не как прогноз для вашей площадки.

Практическая последовательность проверки выглядит так:

Шаг первый: запросите перечень начислений и выясните, отдельно ли считаются вычисления, хранение, запросы и передача данных.

Шаг второй: установите границы данных об энергии и охлаждении: что измерено, для какой части объекта и за какой период.

Шаг третий: проверьте, включает ли оценка серверы и сопутствующую инфраструктуру или только ускорители.

Шаг четвёртый: для собственного бюджета задайте временной горизонт и отделите разовые вложения от регулярных расходов.

Шаг пятый: рассчитайте несколько вариантов загрузки, не выдавая предположение о спросе за измеренный отраслевой показатель.

Шаг шестой: сопоставьте итог с реальной единицей обслуживания — например, с объёмом запросов или токенов — и проверьте, включены ли в расчёт сетевые и сервисные операции.

Если ваш текущий вариант — облачный GPU-сервис, следите за тремя типичными слабыми местами: платой за неиспользуемую готовность, переменным счётом при всплесках нагрузки и дополнительными расходами на передачу данных. Для крупной, постоянно загруженной системы с особыми требованиями к мощности и оборудованию собственная инфраструктура может быть уместнее; для разовых проверок Apple Silicon, совместимости приложений или сборок она не заменит GPU-кластер для больших моделей. Если вам нужна именно такая временная среда разработки, аренда Mac у Macstripe может быть удобнее покупки отдельного компьютера: изучите варианты конфигурации. Когда вы продолжите бюджетирование ИИ-инференса, возвращайтесь к главному правилу: структура затрат дата-центра для ИИ объясняет контекст тарифа, но цену конкретного вывода определяют ваша нагрузка и границы учёта.

Дополнительное чтение