Перед тем как выбирать сервер для нейросети, надо понять, что хост за 1 000–3 000 рублей в месяц может обслуживать сотни пользователей, что для MVP то, что нужно. Если же на VPS нужно самостоятельно запустить языковую модель, генератор изображений или систему распознавания речи, бюджет увеличивается до десятков и сотен тысяч рублей.
Поэтому сервер выбирают не «для ИИ вообще», а под конкретную архитектуру:
- ИИ работает через внешний API.
- На сервере запускается небольшая локальная модель.
- Сервер обрабатывает документы и создаёт базу знаний.
- На сервере работает полноценная LLM для нескольких пользователей.
- Модель дообучается на собственных данных.
- Нейросеть генерирует изображения, аудио или видео.
- Несколько GPU объединяются для обучения крупной модели.
Разница между этими сценариями может составлять сто раз: от обычного VPS за €5–10 в месяц до кластера стоимостью несколько тысяч долларов в сутки.
Что такое VPS
VPS, или Virtual Private Server, — это виртуальный сервер, созданный внутри физического компьютера. Один мощный физический сервер делится на несколько изолированных виртуальных машин. Каждая получает собственную операционную систему, IP-адрес, оперативную память, дисковое пространство и определённую долю процессора.
Хостинг, VPS, VDS-серверы Beget — подключи и получи скидку до −50%.
Пользователь получает root-доступ и может устанавливать Docker, Python, PostgreSQL, Redis, Ollama, vLLM, Open WebUI, n8n, Telegram-ботов, API-сервисы и другое программное обеспечение. В этом состоит отличие VPS от обычного хостинга, где владелец сайта может работать только с заранее настроенными PHP, базой данных и панелью управления.
Облачные ресурсы предоставляются по запросу и обычно оплачиваются за фактическое время использования. Пользователю не нужно покупать физическое оборудование, устанавливать его в дата-центре и самостоятельно менять сломанные диски.
Физически VPS всё равно работает на чужом сервере. Если на одном хосте находится 30 виртуальных машин, они могут использовать общие процессоры, сетевой канал и дисковую подсистему. Поэтому одинаковые по описанию тарифы у разных провайдеров иногда отличаются по фактической производительности в два-три раза.
Чем VDS отличается от VPS
VDS расшифровывается как Virtual Dedicated Server, а VPS — как Virtual Private Server. На практике российские и зарубежные провайдеры используют эти термины почти как синонимы.
Раньше под VPS часто понимали контейнерную виртуализацию OpenVZ, при которой несколько клиентов использовали одно ядро операционной системы. VDS связывали с аппаратной виртуализацией KVM или Xen, где каждая виртуальная машина получала собственное ядро ОС и более строгую изоляцию.
Сейчас это разделение почти исчезло. Один провайдер может называть KVM-сервер VPS, другой — VDS. Само название ничего не говорит о производительности. Нужно смотреть на гипервизор, правила распределения процессорного времени и наличие гарантированных ресурсов. Timeweb Cloud прямо указывает, что VDS и VPS фактически являются одним сервисом, а техническая разница может зависеть только от применяемой виртуализации.
Для ИИ предпочтительнее KVM или другая полноценная аппаратная виртуализация. Она позволяет использовать собственное ядро Linux, Docker, драйверы, CUDA и проброс GPU. Контейнерные VPS могут иметь ограничения по модулям ядра, swap, файловым системам и доступу к оборудованию.
Что означает vCPU
vCPU — виртуальное процессорное ядро. Оно не всегда равно одному физическому ядру.
На дешёвом VPS четыре vCPU могут представлять собой четыре потока общего процессора, которыми одновременно пользуются десятки клиентов. При высокой нагрузке производительность будет плавать. Такой тариф подходит для сайта, API или Telegram-бота, но может плохо справляться с постоянным CPU-инференсом.
У некоторых провайдеров есть два класса процессоров:
- shared vCPU — процессор делится между клиентами;
- dedicated vCPU — вычислительный поток закреплён за виртуальной машиной;
- high-frequency CPU — ядра с высокой тактовой частотой;
- compute optimized — конфигурации для постоянной вычислительной нагрузки.
В Yandex Cloud отдельно указывается уровень производительности vCPU: он определяет гарантированное процессорное время, доступное виртуальной машине.
Для обычного ИИ-бота shared vCPU достаточно. Для локальных эмбеддингов, распознавания речи, парсинга документов и CPU-инференса лучше использовать dedicated vCPU.
Какие ещё серверы бывают
Виртуальный сервер с общей нагрузкой
Это обычный дешёвый VPS. Процессор может быть перепродан нескольким клиентам, но оперативная память и диск обычно имеют более строгие лимиты.
Подходит для:
- Telegram-ботов;
- сайтов и личных кабинетов;
- n8n и других систем автоматизации;
- проксирования запросов в API;
- небольших PostgreSQL и Redis;
- панелей управления ИИ-агентами;
- тестовых окружений.
Виртуальный сервер с выделенными ядрами
Физические потоки процессора закрепляются за клиентом либо провайдер гарантирует большую долю процессорного времени.
Подходит для:
- локального CPU-инференса;
- обработки PDF и изображений;
- построения эмбеддингов;
- векторных баз;
- больших очередей фоновых задач;
- постоянно загруженных API.
GPU VPS
Это виртуальная машина, которой предоставляется физическая видеокарта или её часть. Доступ к GPU обычно организуется через PCI passthrough, vGPU или NVIDIA MIG.
Нужно выяснить, что именно продаёт провайдер:
- целую видеокарту;
- фиксированную долю GPU;
- часть видеопамяти;
- производительность с возможным троттлингом;
- прерываемый GPU без гарантии постоянной работы.
Для локальных LLM объём VRAM обычно важнее количества vCPU. Модель сначала должна физически поместиться в видеопамять, иначе часть вычислений будет перенесена в обычную RAM, а скорость может упасть в несколько раз.
Выделенный сервер
Dedicated server, или bare metal, — отдельный физический компьютер без соседей по виртуализации. Все процессоры, память, диски и видеокарты принадлежат одному клиенту на период аренды.
Выделенный сервер выгоднее виртуального при постоянной нагрузке. Если GPU работает круглосуточно, почасовое облако может оказаться дороже фиксированной аренды физического сервера.
Недостатки:
- сервер медленнее масштабируется;
- замена конфигурации требует миграции;
- запуск может занимать больше времени;
- почасовой оплаты может не быть;
- отказ оборудования способен остановить весь проект.
GPU cloud
Облачный GPU создаётся на несколько часов, после выполнения задачи выключается. Это оптимальный формат для обучения, генерации изображений пакетами и временных экспериментов.
Например, сервер можно включить на четыре часа, дообучить модель, сохранить результат в S3 и удалить инстанс. Плата за видеокарту прекратится после удаления или остановки — конкретные правила нужно проверять у провайдера.
Прерываемый сервер
Spot, interruptible или preemptible instance стоит дешевле обычного, но провайдер может остановить его в любой момент.
Selectel указывает экономию на прерываемых виртуальных машинах до 75%, одновременно предупреждая, что такой сервер может работать менее суток и не подпадает под стандартный SLA.
Прерываемые машины подходят для:
- обучения с регулярным сохранением checkpoint;
- пакетной генерации;
- создания эмбеддингов;
- тестов;
- задач, которые можно автоматически перезапустить.
Для публичного чат-бота или API такой сервер опасен: при остановке GPU сервис перестанет отвечать.
Контейнеры и Kubernetes
Контейнер — не отдельный сервер, а изолированный процесс, работающий внутри операционной системы. Docker позволяет упаковать модель, зависимости и приложение в единый образ.
Kubernetes управляет группой контейнеров и серверов: перезапускает упавшие процессы, распределяет запросы и добавляет новые экземпляры при росте нагрузки.
Для одного бота Kubernetes обычно избыточен. Его имеет смысл подключать, когда работают несколько API, очередь задач, база данных, несколько GPU и требуется автоматическое масштабирование.
Serverless
В serverless-модели оплачивается выполнение конкретной функции или запрос к модели. Постоянный сервер пользователю не выделяется.
Serverless выгоден при нерегулярной нагрузке. Если бот получает 50 запросов в день, держать H100 круглосуточно бессмысленно. Однако при первом обращении может возникать cold start — задержка, пока платформа загружает модель в память.
Нужна ли ИИ-проекту видеокарта
GPU нужен, когда вычисления выполняются непосредственно на вашем сервере. Если приложение обращается к внешнему API, видеокарта находится у поставщика модели.
Пример архитектуры без GPU:
- Пользователь пишет сообщение в чат.
- VPS принимает запрос.
- Приложение извлекает информацию из базы.
- VPS отправляет текст в API модели.
- Поставщик выполняет вычисления.
- VPS возвращает ответ пользователю.
На вашем сервере работают Python, Node.js, база данных, очередь и интерфейс. Для этого достаточно 2–4 vCPU и 4–8 ГБ RAM.
GPU требуется, когда модель скачивается на сервер и запускается через Ollama, llama.cpp, Transformers, vLLM или SGLang.
Как оценить объём памяти для языковой модели
Основной ориентир — количество параметров и точность хранения весов.
При FP16 один параметр занимает примерно 2 байта:
- 8 млрд параметров — около 16 ГБ;
- 14 млрд — около 28 ГБ;
- 24 млрд — около 48 ГБ;
- 32 млрд — около 64 ГБ;
- 70 млрд — около 140 ГБ.
Квантизация уменьшает точность весов. При идеальном 4-битном представлении один параметр занимает около 0,5 байта:
- 8B — примерно 4 ГБ;
- 14B — примерно 7 ГБ;
- 24B — примерно 12 ГБ;
- 32B — примерно 16 ГБ;
- 70B — примерно 35 ГБ.
Реальное потребление выше, потому что дополнительно хранятся служебные структуры, KV-кэш, промежуточные тензоры и контекст запросов. Чем длиннее диалог и больше одновременных пользователей, тем больше видеопамяти потребуется.
Hugging Face поддерживает 8-битную и 4-битную квантизацию, которая позволяет загружать крупные модели на GPU с меньшим объёмом VRAM. Однако сжатие способно снижать точность, особенно при агрессивных режимах и сложных задачах.
Какие серверы нужны для разных ИИ
Бот или ИИ-агент через внешний API
Минимальная конфигурация:
- 1–2 vCPU;
- 2–4 ГБ RAM;
- 20–40 ГБ NVMe;
- Ubuntu 24.04 LTS;
- канал от 100 Мбит/с;
- GPU не нужен.
Для рабочего проекта лучше взять:
- 2–4 vCPU;
- 4–8 ГБ RAM;
- 40–80 ГБ NVMe;
- отдельный PostgreSQL или регулярные резервные копии;
- мониторинг CPU, памяти и диска.
Такой сервер может обслуживать Telegram-бота, сайт, n8n, административную панель и обращения к нескольким ИИ-провайдерам.
Бюджет: примерно €6–30 или 700–3 000 рублей в месяц без стоимости запросов к ИИ.
ИИ-агент с браузером и автоматизацией
Playwright, Chromium и Selenium потребляют больше памяти, чем обычный API. Один браузерный процесс может занимать сотни мегабайт RAM, а параллельный запуск быстро исчерпывает ресурсы.
Практическая конфигурация:
- 4 vCPU;
- 8 ГБ RAM;
- 80 ГБ NVMe;
- swap 2–4 ГБ;
- Docker;
- очередь заданий.
Для 5–10 параллельных браузеров потребуется 8–16 vCPU и 16–32 ГБ RAM.
RAG и корпоративная база знаний
RAG состоит из нескольких компонентов:
- хранилища документов;
- парсера PDF, DOCX и HTML;
- модели эмбеддингов;
- векторной базы;
- основной LLM;
- API и интерфейса.
Если эмбеддинги и LLM вызываются через API, достаточно:
- 4 vCPU;
- 8–16 ГБ RAM;
- 100–200 ГБ NVMe.
Если эмбеддинги создаются локально, лучше взять:
- 8 vCPU;
- 16–32 ГБ RAM;
- NVMe с высоким IOPS;
- GPU 8–16 ГБ при большом количестве документов.
Для базы знаний из нескольких тысяч документов GPU не обязан работать постоянно. Можно создать эмбеддинги пакетно, выключить ускоритель и оставить только CPU-сервер с векторной базой.
Небольшая локальная LLM на 1–3 млрд параметров
Модель такого размера можно запускать на CPU.
Ориентир:
- 4–8 vCPU;
- 8–16 ГБ RAM;
- 40–80 ГБ NVMe.
Она подойдёт для классификации, извлечения данных, коротких ответов и простых агентов. Скорость зависит от процессора и пропускной способности памяти. Увеличение количества виртуальных ядер не всегда помогает, если все ядра конкурируют за один медленный канал RAM.
Для быстрого интерактивного ответа можно подключить GPU с 8 ГБ VRAM.
Модель на 7–8 млрд параметров
Пример такого класса — Qwen3-8B.
Минимум для 4-битной версии:
- GPU 8 ГБ;
- 4–8 vCPU;
- 16 ГБ RAM;
- 80 ГБ NVMe.
Комфортная конфигурация:
- GPU 12–16 ГБ;
- 8 vCPU;
- 32 ГБ RAM;
- 100–200 ГБ NVMe.
Без GPU модель можно запустить на сервере с 16–32 ГБ RAM, но задержка ответа будет заметно выше. Для личного использования это допустимо, для коммерческого чата — обычно нет.
Модель на 13–14 млрд параметров
Для 4-битной версии стоит ориентироваться на 16 ГБ VRAM. При длинном контексте и нескольких одновременных запросах лучше 24 ГБ.
Конфигурация:
- T4 16 ГБ — минимальный вариант;
- L4, A10, A5000 или RTX 4090 с 24 ГБ — рабочий вариант;
- 8–16 vCPU;
- 32–64 ГБ RAM;
- NVMe от 150 ГБ.
Модель на 24–32 млрд параметров
Mistral Small 3.1 содержит 24 млрд параметров. Разработчик указывает, что квантизированная модель помещается на одной RTX 4090 либо компьютере с 32 ГБ объединённой памяти.
Однако «помещается» не означает «готова обслуживать много пользователей». На GPU 24 ГБ может почти не остаться запаса для длинного контекста и параллельных запросов.
Практические варианты:
- 24 ГБ VRAM — один пользователь, умеренный контекст;
- 48 ГБ VRAM — стабильный инференс и несколько запросов;
- 80 ГБ VRAM — длинный контекст, высокая параллельность или менее агрессивная квантизация.
Сервер:
- 12–24 vCPU;
- 64–128 ГБ RAM;
- NVMe 300–500 ГБ;
- GPU 24–48 ГБ.
Модель на 70 млрд параметров
Llama 3.3 выпускается в версии 70B.
Теоретически 4-битные веса занимают около 35 ГБ, но модель также использует KV-кэш и служебную память. Поэтому GPU на 40 ГБ находится на границе применимости.
Рабочие варианты:
- одна A100 или H100 на 80 ГБ;
- одна RTX 6000 Pro на 96 ГБ;
- две A6000 по 48 ГБ;
- две A100 по 40 ГБ;
- несколько GPU с распределением модели.
При использовании нескольких карт важна скорость соединения между ними. Обычная PCIe-шина может стать узким местом. Для обучения и высоконагруженного инференса предпочтительны NVLink, NVSwitch или высокоскоростная кластерная сеть.
Распознавание речи
Для периодической расшифровки коротких аудиозаписей можно использовать CPU:
- 8 vCPU;
- 16 ГБ RAM;
- NVMe от 100 ГБ.
Для транскрибации в реальном времени, обработки звонков или нескольких аудиопотоков лучше подключить T4, L4 или другую карту с 16–24 ГБ VRAM.
Генерация изображений
Для старых и компактных diffusion-моделей может хватить 8–12 ГБ VRAM. Современные модели, высокое разрешение, ControlNet, несколько LoRA и пакетная генерация требуют 16–24 ГБ.
Практический выбор:
- 8–12 ГБ — тесты и небольшие изображения;
- 16 ГБ — базовая рабочая станция;
- 24 ГБ — коммерческая генерация и более тяжёлые модели;
- 48 ГБ — высокая загрузка, большие разрешения и несколько процессов.
GPU лучше арендовать почасово, если изображения создаются партиями. Постоянно включённая RTX 4090 может обходиться дороже, чем сами запросы к готовому API.
Генерация видео
Видео требует значительно больше памяти и времени, чем текст или изображения.
Минимальный практический уровень:
- GPU 24–48 ГБ;
- 16–32 vCPU;
- 64–128 ГБ RAM;
- быстрый NVMe от 500 ГБ.
Для тяжёлых моделей понадобятся A100, H100, H200 или несколько GPU. Держать такую машину круглосуточно без постоянной очереди задач экономически невыгодно.
Дообучение через LoRA и QLoRA
QLoRA позволяет дообучать квантизированную модель, добавляя небольшие обучаемые адаптеры. Это резко снижает требования по сравнению с полным обучением всех весов. Hugging Face описывает QLoRA как 4-битный подход, сохраняющий небольшое количество обучаемых LoRA-параметров.
Ориентиры:
- 7–8B — GPU 24 ГБ;
- 14B — 24–48 ГБ;
- 24–32B — 48–80 ГБ;
- 70B — несколько GPU по 80 ГБ.
Требования зависят от длины последовательности, batch size, оптимизатора и числа обучаемых слоёв.
Полное обучение модели
Обучение крупной LLM с нуля — задача не для обычного VPS. Нужен кластер из десятков или сотен GPU, быстрая сеть между узлами, распределённое хранилище и система сохранения checkpoint.
Даже один мощный сервер с восьмью H100 подходит скорее для экспериментов, fine-tuning и обучения относительно небольших моделей, чем для создания аналога крупнейших коммерческих LLM.
Сколько стоит обычный VPS
Нижняя граница зарубежного VPS составляет около €5–6 или $4–6 в месяц.
Hetzner предлагает облачные серверы от €5,99 в месяц. В линейке cost-optimized есть конфигурации от 2 vCPU, 4 ГБ RAM и 40 ГБ SSD, рассчитанные на тестовые среды и небольшую нагрузку.
У DigitalOcean актуальные базовые тарифы выглядят так:
| Конфигурация | Цена |
|---|---|
| 1 vCPU, 512 МБ RAM | $4 в месяц |
| 1 vCPU, 1 ГБ RAM | $6 |
| 1 vCPU, 2 ГБ RAM | $12 |
| 2 vCPU, 4 ГБ RAM | $24 |
| 4 vCPU, 8 ГБ RAM | $48 |
| 8 vCPU, 16 ГБ RAM | $96 |
В стоимость включён определённый объём SSD и исходящего трафика. С 2026 года Droplets тарифицируются посекундно с минимальным списанием за 60 секунд или $0,01.
Для бота через API обычно хватает тарифа стоимостью $6–24 в месяц. Сервер за $48–96 нужен, когда одновременно работают браузерные агенты, базы, обработчики документов и несколько фоновых процессов.
Сколько стоит сервер с GPU
Российские цены удобно оценить по открытым тарифам Selectel.
На 27 июля 2026 года только графическая карта без учёта vCPU, RAM и диска стоит примерно:
| GPU | Обычная цена в месяц | Прерываемая |
|---|---|---|
| RTX 2080 Ti, 11 ГБ | 14 088 ₽ | 4 226 ₽ |
| Tesla T4, 16 ГБ | 31 452 ₽ | 9 436 ₽ |
| L4, 24 ГБ | 36 312 ₽ | 18 157 ₽ |
| A5000, 24 ГБ | 44 000 ₽ | 22 000 ₽ |
| RTX 4090, 24 ГБ | 55 041 ₽ | 27 520 ₽ |
| RTX 6000 Ada, 48 ГБ | 88 088 ₽ | 44 044 ₽ |
| A100, 40 ГБ | 150 658 ₽ | 64 567 ₽ |
| A100, 80 ГБ | 213 177 ₽ | 106 590 ₽ |
| H200, 141 ГБ | 429 000 ₽ | 321 750 ₽ |
К этой сумме добавляются CPU, оперативная память, локальный диск, внешний IP и другие ресурсы.
У зарубежного GPU-провайдера Lambda почасовые цены составляют:
- RTX 6000 24 ГБ — $0,69 в час;
- A6000 48 ГБ — $1,09;
- A100 40 ГБ — $1,99;
- H100 80 ГБ — до $4,29;
- B200 180 ГБ — до $6,99.
При круглосуточной работе в течение условных 730 часов это около $504, $796, $1 453, $3 132 и $5 103 соответственно. Lambda тарифицирует такие инстансы поминутно и не взимает плату за исходящий трафик в указанных конфигурациях.
DigitalOcean указывает диапазон on-demand GPU примерно от $0,76 до $7,99 за GPU в час в зависимости от оборудования.
Когда почасовой GPU выгоднее месячного
Допустим, RTX 6000 стоит $0,69 в час.
При использовании по четыре часа в день расходы составят:
$0,69 × 4 × 30 = $82,80 в месяц.
Круглосуточная аренда той же карты приблизится к $504. Разница — более чем в шесть раз.
Почасовое облако выгодно, если:
- модель обучается несколько раз в месяц;
- изображения генерируются партиями;
- GPU используется для разовой индексации документов;
- нагрузка возникает только в рабочее время;
- сервер можно автоматически включать и выключать.
Постоянная аренда оправдана, когда GPU загружен хотя бы значительную часть суток и пользователям требуется немедленный ответ без cold start.
Скрытые расходы
Цена видеокарты не равна цене готового сервера.
Оперативная память
GPU-инстансу обычно требуется 32–256 ГБ обычной RAM. Она используется для загрузки данных, CPU-offloading, кэша, токенизации и работы приложения.
Диски
Модели занимают десятки и сотни гигабайт. Дополнительно нужно место для:
- нескольких вариантов квантизации;
- Docker-образов;
- датасетов;
- checkpoint;
- логов;
- временных файлов;
- резервных копий.
Для одного проекта разумно закладывать не менее 150–300 ГБ NVMe. Для обучения и видео — от 500 ГБ до нескольких терабайт.
Исходящий трафик
Некоторые провайдеры включают несколько терабайт трафика, другие берут плату за каждый гигабайт. Особенно дорогой становится регулярный перенос датасетов и checkpoint между облаками.
OVHcloud заявляет, что трафик виртуальных инстансов обычно не тарифицируется отдельно, за исключением отдельных региональных условий.
Снапшоты и резервные копии
Выключенный сервер не всегда перестаёт стоить денег. Диски, снимки, IP-адреса и объектное хранилище продолжают тарифицироваться.
Панель управления
ISPmanager, Plesk и Windows Server требуют отдельной лицензии. Для ИИ-проектов обычно дешевле Ubuntu и управление через SSH, Docker Compose или бесплатную панель.
Простой GPU
Самая дорогая ошибка — держать ускоритель включённым без нагрузки. H100 стоимостью $4,29 в час сжигает более $100 в сутки, даже если за это время не обработан ни один запрос.
В какой стране арендовать сервер
Страну выбирают по четырём параметрам:
- Где находятся пользователи.
- Где разрешено хранить данные.
- К каким внешним сервисам обращается сервер.
- Какими способами можно оплачивать провайдера.
Россия
Российский сервер нужен, если проект собирает персональные данные граждан РФ и подпадает под требования локализации. Роскомнадзор указывает, что базы персональных данных российских граждан должны локализоваться на территории России.
Преимущества:
- низкая задержка для российской аудитории;
- оплата в рублях;
- российские закрывающие документы;
- локальная техническая поддержка;
- меньше рисков отключения из-за иностранного биллинга;
- соответствие требованиям локализации при правильной архитектуре.
Недостатки:
- отдельные GPU могут стоить дороже;
- выбор ускорителей и свободных конфигураций уже;
- некоторые зарубежные API могут быть недоступны либо работать нестабильно;
- маршруты до иностранных сервисов могут меняться.
Российский сервер оптимален для сайта, базы пользователей, личного кабинета, платёжной части и основного приложения.
Финляндия
Финляндия подходит для Северо-Запада России, стран Балтии и Скандинавии. Hetzner управляет собственным дата-центром в Хельсинки наряду с немецкими площадками в Нюрнберге и Фалькенштайне.
Преимущества:
- небольшое географическое расстояние до Санкт-Петербурга и Балтии;
- юрисдикция ЕС;
- развитая инфраструктура;
- относительно недорогие VPS.
Для пользователей из Сибири и Дальнего Востока задержка будет выше.
Германия
Германия — универсальная европейская локация для сайтов, API, корпоративных систем и баз данных.
Преимущества:
- большой выбор провайдеров;
- хорошая связность с европейскими сетями;
- развитые дата-центры;
- применимость GDPR;
- удобная центральная локация для аудитории из разных стран Европы.
Hetzner, DigitalOcean и другие крупные провайдеры имеют площадки во Франкфурте или других немецких городах. DigitalOcean также работает в Амстердаме, Лондоне, Сингапуре, США, Канаде, Индии и других регионах.
Нидерланды
Амстердам традиционно используется для международных проектов благодаря развитой сетевой инфраструктуре и большому количеству операторов.
Локация подходит для:
- европейской аудитории;
- проксирования API;
- CDN-origin;
- SaaS;
- хранения неперсонализированных данных;
- резервного узла.
По задержке для Центральной России Нидерланды обычно проигрывают Финляндии, но разница может быть небольшой. Результат зависит от маршрута конкретного российского оператора, поэтому нужен тестовый сервер.
Польша
Польша — компромиссная локация для Восточной Европы. Она может дать хорошую задержку для стран Балтии, Украины, Беларуси и европейской части России.
Выбор GPU-провайдеров обычно меньше, чем в Германии или Нидерландах, поэтому Польша чаще используется для обычных VPS, а не для крупных GPU-кластеров.
Казахстан
Казахстан подходит для проектов, ориентированных на Центральную Азию и часть аудитории СНГ.
Преимущества:
- русскоязычная поддержка у части провайдеров;
- близость к России и Центральной Азии;
- альтернативные платёжные и юридические схемы;
- возможность разделить российскую и зарубежную инфраструктуру.
Недостаток — меньший выбор дата-центров и GPU по сравнению с ЕС и США.
США
США дают самый широкий выбор специализированных AI-cloud, новых GPU и инструментов для машинного обучения.
Локация подходит для:
- обучения моделей;
- пакетной генерации;
- американской аудитории;
- работы с большими датасетами;
- временной аренды H100, H200 и B200.
Для интерактивного сервиса с пользователями из России или Европы американский сервер может добавить заметную сетевую задержку. Для обучения это почти не имеет значения: задача выполняется внутри дата-центра, а пользователь только запускает процесс и получает результат.
Lambda предлагает конфигурации от одной до восьми видеокарт и кластеры с 16–2 000+ GPU.
Сингапур
Сингапур подходит для Юго-Восточной Азии, части Китая, Индии, Австралии и российского Дальнего Востока.
Hetzner открыл сингапурскую облачную локацию, объясняя выбор развитой сетью подводных кабелей и близостью к азиатским рынкам.
Для Москвы или Санкт-Петербурга Сингапур обычно слишком далёк. Его выбирают не ради «зарубежного IP», а ради азиатской аудитории или размещения вычислений рядом с азиатскими источниками данных.
Сервер за границей не решает все ограничения
IP-адрес другой страны не делает владельца аккаунта резидентом этой страны.
Облачный провайдер или поставщик ИИ может учитывать:
- страну регистрации компании;
- адрес владельца;
- платёжную карту;
- номер телефона;
- результаты KYC;
- источник входов;
- санкционные и экспортные ограничения;
- правила использования конкретной модели.
Поэтому выбирать сервер исключительно ради доступа к определённому сервису рискованно. Условия поставщика могут измениться, а аккаунт — потребовать дополнительной проверки.
Лучше проектировать систему так, чтобы модель можно было заменить: использовать OpenAI-совместимый API, хранить промпты отдельно от кода и не привязывать бизнес-логику к одному поставщику.
Можно ли разделить инфраструктуру между Россией и другой страной
Для проектов с российскими пользователями часто используется гибридная схема:
- российский сервер принимает пользователей и хранит основные данные;
- зарубежный сервер выполняет обезличенные вычисления;
- между узлами передаётся только необходимый фрагмент текста;
- документы и идентификаторы остаются в российском контуре;
- результат возвращается в основное приложение.
Такая архитектура снижает задержку для пользователей и позволяет использовать зарубежные вычислительные мощности. Однако передача персональных данных за пределы страны требует отдельной юридической оценки.
Для аудитории ЕС действует GDPR. При передаче персональных данных за пределы Европейской экономической зоны должны применяться предусмотренные механизмы защиты, например решение об адекватности или стандартные договорные положения.
Какой GPU выбрать
T4, 16 ГБ
Подходит для:
- моделей 7–8B;
- эмбеддингов;
- распознавания речи;
- лёгкой генерации изображений;
- тестового инференса.
Плюс — низкая цена. Минус — относительно старая архитектура и ограниченные 16 ГБ памяти.
L4, 24 ГБ
Подходит для:
- моделей до 14B;
- мультимодальных моделей;
- видеообработки;
- серверного инференса;
- нескольких лёгких запросов.
OVHcloud позиционирует L4 как карту для AI-инференса, обработки видео и графических задач.
RTX 4090, 24 ГБ
Обеспечивает высокую производительность за сравнительно небольшую цену. Подходит для:
- моделей 7–24B;
- генерации изображений;
- LoRA;
- прототипирования;
- одного или нескольких пользователей.
Недостатки:
- нет большого запаса VRAM;
- потребительская карта;
- нет NVLink;
- не каждый провайдер гарантирует серверный уровень отказоустойчивости.
A6000 или RTX 6000 Ada, 48 ГБ
Хороший компромисс для моделей 24–32B, длинного контекста и профессиональной генерации изображений.
48 ГБ позволяют избежать агрессивного CPU-offloading и обслуживать больше параллельных запросов.
A100, 40 или 80 ГБ
Подходит для:
- 70B-моделей;
- fine-tuning;
- обучения;
- больших batch;
- нескольких пользователей;
- высоконагруженного инференса.
Версия на 80 ГБ значительно практичнее для крупных LLM.
H100 и H200
Это ускорители для тяжёлого обучения и высокопроизводительного инференса.
H200 имеет 141 ГБ памяти в доступных у Selectel конфигурациях, H100 обычно предлагается с 80 ГБ, а B200 — со 180 ГБ на GPU в тарифах Lambda.
Переплачивать за H100 для Telegram-бота на десять пользователей бессмысленно. Такая карта окупается высокой загрузкой, большими моделями или сокращением времени обучения.
Какие параметры проверять перед оплатой
Объём VRAM
Сначала выберите модель и квантизацию, затем добавьте запас минимум 20–30%. Для длинного контекста и параллельных запросов запас должен быть больше.
Тип GPU
Название «сервер с NVIDIA» ничего не говорит. T4, RTX 4090, A100 и H100 отличаются по памяти, пропускной способности и поддерживаемым форматам вычислений.
Полная или частичная видеокарта
Уточните:
- выделяется ли весь GPU;
- сколько доступно VRAM;
- используется ли MIG;
- есть ли лимит мощности;
- допускается ли постоянная нагрузка;
- делится ли карта с другими клиентами.
Процессор
Для токенизации, подготовки данных и работы API нужно достаточно vCPU. Для одной видеокарты обычно хватает 8–16 ядер, но обучение и обработка больших датасетов могут потребовать больше.
RAM
Обычная память должна быть больше размера модели и рабочих данных. Для GPU на 24 ГБ стоит ориентироваться минимум на 32–64 ГБ RAM, для A100 и H100 — на 128–256 ГБ.
NVMe
Загрузка модели с медленного сетевого диска увеличивает время запуска. Для временных датасетов и checkpoint нужен локальный NVMe.
Трафик
Проверьте:
- сколько исходящего трафика включено;
- сколько стоит превышение;
- тарифицируется ли трафик между зонами;
- платная ли передача в S3;
- есть ли бесплатная приватная сеть.
SLA
SLA 99,9% допускает примерно 43 минуты недоступности в месяц. Для коммерческого API одного сервера недостаточно даже при хорошем SLA: нужны резервирование, мониторинг и автоматический перезапуск.
Возможность получить GPU
Наличие тарифа на сайте не гарантирует свободную карту. В некоторых облаках GPU выдаются по квоте. Например, Yandex Cloud по умолчанию устанавливает нулевую квоту на создание GPU VM, а для её увеличения нужно обращаться в поддержку.
Способ оплаты и KYC
Проверьте требования до переноса проекта. Некоторые провайдеры запрашивают документы, подтверждение адреса или дополнительную авторизацию платежа после заказа дорогого GPU.
Как протестировать сервер
Не покупайте годовую аренду до теста реальной нагрузки.
На тестовом сервере измерьте:
- скорость генерации в токенах в секунду;
- время до первого токена;
- задержку p95;
- потребление VRAM;
- потребление RAM;
- GPU utilization;
- CPU steal;
- скорость чтения NVMe;
- сетевую задержку до пользователей;
- стабильность под параллельными запросами.
Тестировать нужно на реальных промптах. Короткий вопрос «Привет» почти ничего не показывает. Загрузите документ обычного размера, установите рабочий контекст и отправьте столько одновременных запросов, сколько ожидается в продакшене.
Если при двух запросах VRAM заканчивается, сервер нельзя масштабировать добавлением пользователей. Придётся сокращать контекст, применять более сильную квантизацию, использовать меньшую модель или покупать GPU с большим объёмом памяти.
Готовые конфигурации
ИИ-бот через API
- 2 vCPU;
- 4 ГБ RAM;
- 40 ГБ NVMe;
- без GPU;
- Россия или ближайшая к пользователям европейская страна;
- бюджет 700–2 000 рублей в месяц.
ИИ-агент с браузером
- 4 vCPU;
- 8 ГБ RAM;
- 80 ГБ NVMe;
- без GPU;
- бюджет 1 500–4 000 рублей.
RAG для небольшой компании
- 4–8 vCPU;
- 16 ГБ RAM;
- 150 ГБ NVMe;
- PostgreSQL с pgvector или отдельная векторная база;
- GPU подключается временно;
- бюджет без GPU — 3 000–10 000 рублей.
Локальная модель 8B
- GPU 12–16 ГБ;
- 8 vCPU;
- 32 ГБ RAM;
- 100 ГБ NVMe;
- бюджет примерно 15 000–40 000 рублей в месяц при постоянной аренде.
Локальная модель 14B
- GPU 24 ГБ;
- 8–16 vCPU;
- 32–64 ГБ RAM;
- 150–250 ГБ NVMe;
- бюджет примерно 35 000–70 000 рублей.
Локальная модель 24–32B
- GPU 48 ГБ;
- 16 vCPU;
- 64–128 ГБ RAM;
- 300 ГБ NVMe;
- бюджет примерно 80 000–170 000 рублей.
Локальная модель 70B
- GPU 80–96 ГБ либо две карты;
- 24–48 vCPU;
- 128–256 ГБ RAM;
- 500 ГБ NVMe;
- бюджет от 200 000 рублей в месяц, при высокой параллельности — значительно больше.
Дообучение
- прерываемый GPU;
- автоматическое сохранение checkpoint;
- отдельное S3-хранилище;
- почасовая оплата;
- сервер выключается сразу после завершения задачи.
Итоговый алгоритм выбора
Сначала определите, будет ли модель работать локально. Если используется внешний API, начните с VPS на 2 vCPU и 4 ГБ RAM. GPU здесь не ускорит ответы, потому что вычисления выполняются в другом дата-центре.
Если модель запускается локально, узнайте её размер и формат квантизации. Рассчитайте объём весов, добавьте память для KV-кэша и запас под несколько пользователей. После этого выбирайте GPU.
Для 7–8B достаточно 12–16 ГБ VRAM. Для 14B лучше 24 ГБ. Для 24–32B нужен ускоритель на 48 ГБ. Для 70B стоит рассматривать 80–96 ГБ или несколько видеокарт.
Страну выбирайте по пользователям и данным. Российские персональные данные требуют российского контура. Для европейской аудитории подходят Германия, Финляндия и Нидерланды. США дают широкий выбор GPU и выгодны для обучения. Сингапур нужен для азиатского рынка, а не как универсальная зарубежная локация.
Почасовой GPU выгоднее, если он работает менее нескольких часов в день. Круглосуточная аренда оправдана только при постоянной очереди запросов. При отсутствии измеримой нагрузки дорогой ускоритель превращается в сервер, который ежедневно списывает деньги за простой.