«Сколько нужно железа под корпоративный ИИ?» — вопрос, на который честный ответ звучит как «зависит», но это не отговорка. Зависит от конкретных вещей, которые можно назвать и посчитать. Главная ошибка — покупать «на вырост» дорогие серверные ускорители под задачу, которую ещё не проверили. Разберём, как оценить потребности трезво: отдельно для пилота и отдельно для промышленной нагрузки.

От чего вообще зависит потребность в железе

Три фактора определяют, что вам нужно:

  • Размер модели. Чем больше параметров, тем больше видеопамяти и вычислений. Но большая модель не всегда нужна — многие задачи закрываются средними.
  • Нагрузка. Один пользователь в интерактиве и сотни параллельных запросов — разные требования на порядки.
  • Требования к задержке. Чем жёстче лимит по времени ответа, тем больше запас по мощности нужен.

Пока вы не знаете этих трёх параметров эмпирически, любая закупка «серьёзного» железа — угадывание. Поэтому начинают с пилота на минимуме.

Ключевой ресурс — видеопамять (VRAM)

Для инференса языковых моделей главный ограничитель — не скорость процессора, а объём видеопамяти. Именно он определяет, какую модель вы вообще сможете загрузить. Ориентиры для квантизованных моделей (4-bit):

Размер модели Примерная VRAM (4-bit) Что закрывает
7–8B 6–8 ГБ Классификация, извлечение, суммаризация, простые ответы
13–14B 10–12 ГБ Качественный диалог, RAG, подсказки
30–34B 20–24 ГБ Сложные рассуждения, качественная генерация
70B 40–48 ГБ Задачи, близкие к уровню коммерческих API

Квантизация (сжатие весов до 4-bit) позволяет запускать модели на заметно меньшей памяти с небольшой потерей качества — для большинства задач это оправданный размен.

Что нужно для пилота

Цель пилота — проверить, что модель нужного размера справляется с вашей задачей. Экономить стоит на всём, кроме VRAM.

  • Одна видеокарта с 24 ГБ VRAM (например, RTX 4090 / RTX 3090 / профессиональная A5000) закрывает большинство пилотных задач вплоть до моделей 30–34B в квантизации.
  • 32–64 ГБ системной RAM — для загрузки и предобработки.
  • Быстрый NVMe SSD под веса (модель 70B в 4-bit занимает ~40 ГБ на диске).
  • Любой современный многоядерный процессор — при инференсе на GPU он не узкое место.

Этого достаточно, чтобы получить ответ на главный вопрос: «работает ли это для нас в принципе». Кластеры, отказоустойчивость и оркестрация на этом этапе не нужны — только одна машина.

Что нужно для промышленной нагрузки

Переход в продуктив меняет требования качественно. Здесь считают не «влезет ли модель», а «сколько пользователей одна карта обслужит и что будет при пиках».

  • Профессиональные ускорители. NVIDIA A100 (40/80 ГБ) или H100 (80 ГБ). Для больших моделей их объединяют через NVLink. Один сервер может нести 2–8 ускорителей.
  • Серверный движок инференса с continuous batching (vLLM, TGI, TensorRT-LLM) — он позволяет одной карте обслуживать десятки одновременных запросов за счёт умного шедулинга. Это часто важнее, чем добавить ещё одну карту.
  • Инфраструктура вокруг: ECC-память, резервированное питание и охлаждение (GPU-серверы потребляют киловатты), быстрая сеть.
  • Масштабирование и наблюдаемость: несколько нод за балансировщиком, мониторинг задержки (p50/p95/p99), утилизации GPU и длины очередей.

Ключевая мысль: пропускную способность часто повышают не покупкой ещё большего числа карт, а правильным движком инференса и батчингом. Сначала выжмите максимум из имеющегося железа.

Как не переплатить

Типичные способы потратить лишнее — и как их избежать:

  • Не покупайте продуктивное железо до пилота. Реальные цифры по размеру модели и нагрузке вы получите только эмпирически, и они почти всегда отличаются от предположений.
  • Не берите модель больше необходимой. 70B там, где хватает 13B, — это лишние деньги на железо и электричество без пользы для качества.
  • Не игнорируйте квантизацию. Она часто даёт нужное качество на кратно меньшей памяти.
  • Считайте не только карту. Питание, охлаждение, электричество и — главное — людей, которые всё это сопровождают. Инженер обходится дороже, чем кажется на фоне цены сервера.

Ориентировочная логика выбора

Простая последовательность решений:

  1. Пилот → одна карта 24 ГБ, модель до 30–34B в квантизации, одна машина.
  2. Небольшой продуктив, десятки пользователей → одна-две профессиональные карты + движок с батчингом.
  3. Высокая нагрузка, сотни-тысячи запросов → сервер с несколькими A100/H100, масштабирование, наблюдаемость, MLOps-сопровождение.

Двигайтесь по этой лестнице снизу вверх, а не наоборот. Каждый следующий уровень оправдан только тогда, когда предыдущий уперся в реальный, измеренный потолок.

Итог

Железо под корпоративный ИИ подбирают по трём измеримым параметрам: размер модели, нагрузка и требования к задержке. Для пилота хватает одной карты с 24 ГБ VRAM — этого достаточно, чтобы проверить гипотезу. Промышленная нагрузка требует профессиональных ускорителей, серверного движка с батчингом и сопровождения. Главное правило — не покупать «на вырост»: сначала снимите реальные цифры на пилоте, а потом масштабируйте под них, считая полную стоимость, включая электричество и людей.


Материал подготовлен для блога K2W AI.