«Сколько нужно железа под корпоративный ИИ?» — вопрос, на который честный ответ звучит как «зависит», но это не отговорка. Зависит от конкретных вещей, которые можно назвать и посчитать. Главная ошибка — покупать «на вырост» дорогие серверные ускорители под задачу, которую ещё не проверили. Разберём, как оценить потребности трезво: отдельно для пилота и отдельно для промышленной нагрузки.
От чего вообще зависит потребность в железе
Три фактора определяют, что вам нужно:
- Размер модели. Чем больше параметров, тем больше видеопамяти и вычислений. Но большая модель не всегда нужна — многие задачи закрываются средними.
- Нагрузка. Один пользователь в интерактиве и сотни параллельных запросов — разные требования на порядки.
- Требования к задержке. Чем жёстче лимит по времени ответа, тем больше запас по мощности нужен.
Пока вы не знаете этих трёх параметров эмпирически, любая закупка «серьёзного» железа — угадывание. Поэтому начинают с пилота на минимуме.
Ключевой ресурс — видеопамять (VRAM)
Для инференса языковых моделей главный ограничитель — не скорость процессора, а объём видеопамяти. Именно он определяет, какую модель вы вообще сможете загрузить. Ориентиры для квантизованных моделей (4-bit):
| Размер модели | Примерная VRAM (4-bit) | Что закрывает |
|---|---|---|
| 7–8B | 6–8 ГБ | Классификация, извлечение, суммаризация, простые ответы |
| 13–14B | 10–12 ГБ | Качественный диалог, RAG, подсказки |
| 30–34B | 20–24 ГБ | Сложные рассуждения, качественная генерация |
| 70B | 40–48 ГБ | Задачи, близкие к уровню коммерческих API |
Квантизация (сжатие весов до 4-bit) позволяет запускать модели на заметно меньшей памяти с небольшой потерей качества — для большинства задач это оправданный размен.
Что нужно для пилота
Цель пилота — проверить, что модель нужного размера справляется с вашей задачей. Экономить стоит на всём, кроме VRAM.
- Одна видеокарта с 24 ГБ VRAM (например, RTX 4090 / RTX 3090 / профессиональная A5000) закрывает большинство пилотных задач вплоть до моделей 30–34B в квантизации.
- 32–64 ГБ системной RAM — для загрузки и предобработки.
- Быстрый NVMe SSD под веса (модель 70B в 4-bit занимает ~40 ГБ на диске).
- Любой современный многоядерный процессор — при инференсе на GPU он не узкое место.
Этого достаточно, чтобы получить ответ на главный вопрос: «работает ли это для нас в принципе». Кластеры, отказоустойчивость и оркестрация на этом этапе не нужны — только одна машина.
Что нужно для промышленной нагрузки
Переход в продуктив меняет требования качественно. Здесь считают не «влезет ли модель», а «сколько пользователей одна карта обслужит и что будет при пиках».
- Профессиональные ускорители. NVIDIA A100 (40/80 ГБ) или H100 (80 ГБ). Для больших моделей их объединяют через NVLink. Один сервер может нести 2–8 ускорителей.
- Серверный движок инференса с continuous batching (vLLM, TGI, TensorRT-LLM) — он позволяет одной карте обслуживать десятки одновременных запросов за счёт умного шедулинга. Это часто важнее, чем добавить ещё одну карту.
- Инфраструктура вокруг: ECC-память, резервированное питание и охлаждение (GPU-серверы потребляют киловатты), быстрая сеть.
- Масштабирование и наблюдаемость: несколько нод за балансировщиком, мониторинг задержки (p50/p95/p99), утилизации GPU и длины очередей.
Ключевая мысль: пропускную способность часто повышают не покупкой ещё большего числа карт, а правильным движком инференса и батчингом. Сначала выжмите максимум из имеющегося железа.
Как не переплатить
Типичные способы потратить лишнее — и как их избежать:
- Не покупайте продуктивное железо до пилота. Реальные цифры по размеру модели и нагрузке вы получите только эмпирически, и они почти всегда отличаются от предположений.
- Не берите модель больше необходимой. 70B там, где хватает 13B, — это лишние деньги на железо и электричество без пользы для качества.
- Не игнорируйте квантизацию. Она часто даёт нужное качество на кратно меньшей памяти.
- Считайте не только карту. Питание, охлаждение, электричество и — главное — людей, которые всё это сопровождают. Инженер обходится дороже, чем кажется на фоне цены сервера.
Ориентировочная логика выбора
Простая последовательность решений:
- Пилот → одна карта 24 ГБ, модель до 30–34B в квантизации, одна машина.
- Небольшой продуктив, десятки пользователей → одна-две профессиональные карты + движок с батчингом.
- Высокая нагрузка, сотни-тысячи запросов → сервер с несколькими A100/H100, масштабирование, наблюдаемость, MLOps-сопровождение.
Двигайтесь по этой лестнице снизу вверх, а не наоборот. Каждый следующий уровень оправдан только тогда, когда предыдущий уперся в реальный, измеренный потолок.
Итог
Железо под корпоративный ИИ подбирают по трём измеримым параметрам: размер модели, нагрузка и требования к задержке. Для пилота хватает одной карты с 24 ГБ VRAM — этого достаточно, чтобы проверить гипотезу. Промышленная нагрузка требует профессиональных ускорителей, серверного движка с батчингом и сопровождения. Главное правило — не покупать «на вырост»: сначала снимите реальные цифры на пилоте, а потом масштабируйте под них, считая полную стоимость, включая электричество и людей.
Материал подготовлен для блога K2W AI.