Зачем нужен собственный сервер для нейросетей
Когда проект выходит за рамки экспериментов на одной видеокарте, перед командой встаёт вопрос: арендовать облачные GPU-мощности или купить собственный сервер. Облака удобны для старта, но при постоянной нагрузке расходы быстро растут. По оценкам, за три года аренда обходится на 2–4 миллиона рублей дороже, чем покупка сервера, при этом вы не получаете актив в собственность и зависите от провайдера.
Собственный сервер даёт полный контроль над инфраструктурой: вы сами выбираете конфигурацию, устанавливаете нужное ПО, управляете доступом и не платите за каждый час вычислений. Это особенно важно для компаний, работающих с чувствительными данными, где нельзя передавать информацию в облако. Кроме того, сервер можно использовать для нескольких задач одновременно: обучение моделей, инференс, рендеринг, анализ данных.
Однако покупка сервера — это не только затраты на железо, но и на обслуживание, электроэнергию, охлаждение и администрирование. Поэтому перед покупкой важно чётко определить задачи и рассчитать бюджет на весь жизненный цикл.
Ключевые параметры GPU-сервера: видеопамять, GPU, CPU, память, хранилище
Главный параметр для нейросетей — объём видеопамяти (VRAM). Он определяет, какая модель поместится целиком и с каким контекстом вы сможете работать. Для инференса небольших моделей (7–14B параметров) в квантовании Q4 достаточно 6–10 ГБ, что покрывает одна карта на 12 ГБ, например RTX 3060. Модели 32B требуют 20–22 ГБ, а 70B — уже 40–45 ГБ, поэтому нужны две карты по 24 ГБ или A100 40 ГБ. Для моделей от 100B и обучения с нуля нужно от 130 ГБ суммарной видеопамяти — это мульти-GPU конфигурации на A100 80 ГБ или H100.
Кроме VRAM, важны:
- Число GPU и NVLink — для мульти-GPU обучения и крупных LLM, менее критично для независимого инференса.
- Процессор (CPU) — для подготовки данных и управления задачами. Для инференса достаточно 8–16 ядер, для обучения — больше.
- Оперативная память (RAM) — серверная ECC DDR4/DDR5, объём зависит от датасета и числа процессов. Для LLM-инференса часто достаточно 64–128 ГБ, для обучения — 256 ГБ и более.
- Хранилище — NVMe SSD для быстрой загрузки данных и моделей, HDD для архивов. Для больших датасетов нужны ёмкие накопители.
- Сеть — для кластерной работы и распределённого обучения важны интерфейсы 25GbE и выше.
Все эти параметры должны быть сбалансированы: если GPU мощный, а CPU слабый, узким местом станет процессор.
Типы GPU-серверов: от рабочих станций до мульти-GPU платформ
По архитектуре серверы для ИИ делятся на несколько классов.
Рабочие станции (Tower) — компактные решения с одной-двумя видеокартами. Подходят для разработки, генерации изображений, локального запуска LLM. Пример: AI Workstation на базе RTX 6000 Ada с AMD Threadripper и 256 ГБ RAM. Такая станция тихо работает в офисе и не требует стойки.
Серверы 1–2 GPU — обычно 2U-корпус, подходят для инференса и пилотных проектов. Могут быть на базе Xeon или EPYC, с поддержкой ECC-памяти и IPMI.
Серверы 4 GPU — стандарт для обучения моделей средней сложности. Часто используют 4× A100 или 4× H100 в 4U-корпусе. Такие решения обеспечивают высокую производительность и поддерживают NVLink.
Серверы 8 GPU — промышленные системы для обучения LLM и тяжёлых AI-нагрузок. Примеры: NVIDIA DGX H100 (8× H100 SXM5), Supermicro 4U 8×GPU. Требуют серьёзного охлаждения и мощного питания.
GPU-фермы — платформы с несколькими независимыми узлами, каждый со своей видеокартой. Например, HUANANZHI HN-PC-FARM4U4 — 4U корпус с 4 узлами, каждый на Intel Core и RTX 40/50-серии. Идеально для параллельного инференса и рендера.
Как выбрать GPU: RTX, A100, H100, L40S и другие
Для нейросетей используют NVIDIA GPU с поддержкой CUDA. Выбор зависит от задачи и бюджета.
- RTX 3060 12GB — бюджетный вариант для инференса небольших моделей и генерации изображений. Стоит от 30 тыс. рублей, но не имеет ECC и серверных функций.
- RTX 4090 24GB — мощная карта для инференса моделей до 32B в Q4, а также для генерации. Требует мощного питания (450 Вт) и хорошего охлаждения.
- RTX 6000 Ada 48GB — профессиональная карта для рабочих станций, идеальна для генерации и разработки. Цена около 1 млн ₽.
- A100 40/80GB — серверный ускоритель для обучения и инференса крупных моделей. Поддерживает NVLink, требует серверной платформы.
- H100 80GB — флагман для обучения LLM, обеспечивает максимальную производительность. Цена одной карты может превышать 2 млн ₽.
- L40S 48GB — универсальный ускоритель для ИИ и рендеринга, хорош для инференса.
При выборе учитывайте не только VRAM, но и пропускную способность памяти, поддержку NVLink и PCIe 5.0. Для инференса часто достаточно одной карты, для обучения — несколько с NVLink.
Питание и охлаждение: как не перегрузить сервер
GPU-серверы потребляют много энергии. Для одной карты уровня RTX 3060 достаточно блока питания 600–750 Вт. Для двух RTX 4090 нужно уже 2000–2200 Вт, а для четырёх карт — резервируемое питание в серверном корпусе. При расчёте учитывайте суммарное потребление GPU плюс запас 20–30% на процессоры, диски и пики нагрузки.
Охлаждение также критично. Серверные корпуса 4U с активным охлаждением могут справиться с 4–8 GPU, но требуют хорошего воздушного потока. Для H100 SXM часто используется жидкостное охлаждение. В офисных условиях предпочтительны тихие рабочие станции с башенным охлаждением.
Перед покупкой важно проверить, что блок питания и охлаждение соответствуют конфигурации. Многие поставщики проводят стресс-тесты перед отправкой, чтобы система не уходила в защиту под длительной нагрузкой.
Сравнение готовых решений: от бюджетных до топовых
На рынке представлены готовые серверы для ИИ от разных производителей. Вот несколько примеров.
Бюджетный сегмент (до 500 тыс. ₽):
- Сервер Huananzhi HIGH Gen-3 (2× E5 2696 v4, 256GB RAM, RTX 3060 12GB, SSD 4TB + NVMe 2TB) — от 168 291 ₽. Подходит для инференса небольших моделей.
- Сервер GPD BD4 (Xeon E5-2680 v4, 64–128 ГБ, RTX 3060 12GB) — от 200 тыс. ₽.
Средний сегмент (1–3 млн ₽):
- AI Workstation GetCore (RTX 6000 Ada, Threadripper, 256GB) — 1 289 600 ₽. Для генерации и разработки.
- Сервер GetCore для инфраструктуры (2× Xeon Silver, 128GB) — 426 400 ₽, но это не GPU-сервер.
Топовый сегмент (от 5 млн ₽):
- Сервер GetCore для обучения (4× A100 40GB) — 6 964 968 ₽.
- Сервер GetCore для LLM (4× H100 80GB) — 12 750 800 ₽.
- NVIDIA DGX H100 (8× H100 SXM) — 52 160 000 ₽.
Цены могут меняться в зависимости от курса валют и комплектации. Многие компании предлагают лизинг и аренду, что снижает порог входа.
Как рассчитать конфигурацию под вашу модель
Чтобы не переплатить, нужно точно определить требования вашей модели. Для инференса LLM ориентируйтесь на объём видеопамяти: модель 7B в Q4 занимает ~6–10 ГБ, 32B — 20–22 ГБ, 70B — 40–45 ГБ. Для обучения добавьте ещё 20–30% к памяти.
Также учитывайте число пользователей и задержку. Если сервер обслуживает много запросов, может потребоваться несколько GPU или более мощный CPU. Для генерации изображений (Stable Diffusion, Flux) достаточно 8–16 ГБ VRAM.
Пример расчёта: для локального запуска Llama 3 8B с контекстом 8K достаточно одной RTX 3060 12GB, 64GB RAM и 1TB NVMe. Для дообучения модели 70B потребуется минимум 2× A100 80GB, 512GB RAM и 4TB NVMe.
Поставщики часто помогают подобрать конфигурацию по брифу, где вы указываете модель, количество пользователей, бюджет и сроки.
Покупка, аренда или лизинг: что выгоднее
Покупка сервера — это разовые затраты, но они окупаются при длительной эксплуатации. Аренда или лизинг позволяют распределить платежи и обновлять оборудование. По данным GetCore, аренда сервера с GPU экономит от 2 до 4 млн рублей за 3 года по сравнению с облаком, но сама покупка может быть дороже.
Лизинг особенно удобен для юрлиц: можно оформить оборудование в лизинг с выкупом, включить платежи в расходы и сохранить оборотные средства. Аренда подходит для краткосрочных проектов или тестирования.
При выборе учитывайте гарантию: обычно 1–5 лет, а также условия поддержки. Некоторые поставщики предлагают SLA с бесплатной поддержкой на 3–6 месяцев.
Где купить сервер для нейросетей в России: обзор поставщиков
В России есть несколько категорий поставщиков: официальные дистрибьюторы мировых брендов, OEM-сборщики и специализированные компании.
- Huananzhi — китайский производитель, официальный представитель в России. Предлагает бюджетные серверы на базе Xeon и RTX, а также профессиональные решения (A100, H100). Цены от 168 тыс. ₽, есть склад в РФ, отгрузка 3–5 дней.
- GetCore — российская компания, проектирует и собирает серверы под задачи ИИ, работает с ODM (Inspur, Supermicro). Предлагает покупку, аренду и лизинг, гарантия до 5 лет.
- Сервер Молл — поставляет серверы от Dell, HPE, NVIDIA, Supermicro, ASUS, MSI, Gigabyte. Гарантия 5 лет, бесплатная доставка по РФ.
При выборе поставщика важно проверить наличие сертификатов, возможность тестирования и послепродажную поддержку. Многие компании предоставляют коммерческие предложения с несколькими вариантами конфигурации.
Частые ошибки при покупке и как их избежать
Одна из частых ошибок — покупка сервера с недостаточной видеопамятью. Например, для модели 70B покупают одну карту 24GB, а потом не могут запустить модель. Всегда проверяйте требования модели и закладывайте запас.
Вторая ошибка — игнорирование питания и охлаждения. Мощные GPU требуют много энергии и выделяют много тепла. Если блок питания слабый, сервер будет выключаться под нагрузкой.
Третья ошибка — выбор неподходящего форм-фактора. Для офиса лучше рабочая станция, а не стоечный сервер, который шумит и требует стойки.
Также не забывайте про лицензии на ПО и драйверы. Некоторые поставщики предустанавливают CUDA, PyTorch, TensorFlow, что экономит время.
Наконец, не стоит экономить на гарантии. Серверы для ИИ работают под высокой нагрузкой, и поломка может привести к простою. Выбирайте поставщика с гарантией не менее 3 лет и возможностью продления.
Вопросы и ответы
Сколько видеопамяти нужно для запуска LLM?
Для моделей 7–14B параметров в квантовании Q4 достаточно 6–10 ГБ VRAM, поэтому подойдёт одна карта на 12 ГБ (например, RTX 3060). Модели 32B требуют 20–22 ГБ, для них нужна RTX 4090 24 ГБ или две карты по 12 ГБ. Модели 70B (Llama 3.3, DeepSeek) требуют 40–45 ГБ, поэтому нужны две карты по 24 ГБ или A100 40 ГБ. Для моделей от 100B и обучения с нуля нужно от 130 ГБ суммарной видеопамяти — это мульти-GPU конфигурации на A100 80 ГБ или H100.
Можно ли использовать обычный игровой компьютер для нейросетей?
Да, для небольших моделей и генерации изображений можно использовать игровой компьютер с видеокартой RTX 3060 12 ГБ или RTX 4090. Однако для серьёзного обучения или работы с большими LLM потребуется сервер с несколькими GPU, ECC-памятью и надёжным питанием. Игровые компьютеры не рассчитаны на длительную нагрузку 24/7, у них слабее охлаждение и нет удалённого управления.
Что такое NVLink и зачем он нужен?
NVLink — это высокоскоростной интерфейс для связи между видеокартами NVIDIA. Он позволяет объединять память GPU и ускоряет обмен данными при обучении больших моделей. Для инференса одной модели NVLink не критичен, но для мульти-GPU обучения он значительно повышает производительность. Например, в серверах с 4× A100 NVLink позволяет использовать все карты как единый ускоритель.
Какой блок питания нужен для сервера с несколькими GPU?
Для одной карты уровня RTX 3060 достаточно 600–750 Вт. Для двух RTX 4090 нужно 2000–2200 Вт, для четырёх карт — резервируемое питание в серверном корпусе. Всегда добавляйте запас 20–30% на процессоры, диски и пики нагрузки. Лучше выбирать блоки питания с сертификатом 80+ Platinum или Titanium.
Можно ли арендовать сервер для нейросетей?
Да, многие компании предлагают аренду GPU-серверов. Это удобно для краткосрочных проектов или тестирования. Аренда обычно включает поддержку и обслуживание, но обходится дороже в долгосрочной перспективе. Например, аренда сервера с 4× A100 может стоить от 300 тыс. ₽ в месяц, тогда как покупка такого сервера — около 7 млн ₽.
Какая гарантия на серверы для ИИ?
Гарантия зависит от поставщика. Обычно на новые серверы дают 1–5 лет. Например, Huananzhi даёт 1 год с возможностью продления до 3 лет, GetCore — до 5 лет, Сервер Молл — 5 лет на серверы и СХД. На комплектующие гарантия может быть меньше. Важно уточнить условия гарантии и наличие сервисного центра.