цены сверены 5 октября 2026 года

Сервер для нейросети: когда хватит VPS, а когда нужен GPU

Если ваш сервис обращается к нейросети через API, ему хватит обычного VPS: считает чужой сервер. Если модель запускается на вашем сервере, нужны видеопамять или очень много оперативной памяти, а сервер с видеокартой стоит на порядок дороже.

Сервер для нейросети: когда хватит VPS, а когда нужен GPU
Сервер для нейросети: когда хватит VPS, а когда нужен GPUhostfakt.ru

Два разных сценария

Слово «нейросеть» прячет две непохожие задачи.

Первая: вы пишете сервис, который вызывает модель по API. Например, бота, который отправляет вопрос провайдеру модели и показывает ответ. Тяжёлые вычисления идут на стороне провайдера. Ваш сервер принимает запросы, ходит в API, хранит данные и отвечает пользователю.

Вторая: вы запускаете модель на своём сервере. Тогда все вычисления выполняете вы, и это требует совсем других ресурсов.

С этого выбора и надо начинать подбор сервера.

Сценарий 1: работа через API

Для этого подходит обычный VPS. Нагрузка на него небольшая: приём сообщений, запросы к API, работа с базой данных. Для бота или небольшого сервиса достаточно 1–2 ядер и 1–2 ГБ памяти. Точное значение зависит от того, что ещё делает программа.

Что учесть:

Такие сервисы запускают так же, как обычных ботов. Пошаговая инструкция есть в статье сервер для Telegram-бота, а готовые сценарии для ИИ-агентов описаны на странице VPS для ИИ-агента. Если вам нужна автоматизация без кода, посмотрите установку n8n на VPS.

VPS в нашей базе стоят от 140 ₽ в месяц.

Сценарий 2: модель на своём сервере

Языковая модель состоит из огромного набора чисел (весов), которые нужно держать в памяти во время работы. Чем больше модель, тем больше памяти она занимает. Вычисления над этими числами быстро выполняет видеокарта (GPU), у которой своя память, видеопамять. Если модель целиком помещается в видеопамять, она работает быстро. Если нет, нужны ухищрения.

Есть два пути.

Путь А: сервер с GPU

Нужна видеокарта, видеопамяти которой хватает на выбранную модель. Серверы с GPU сдают в аренду специализированные хостеры, и стоят они на порядок дороже обычных VPS. Это главный повод сначала подумать, нужна ли вам своя модель, или хватит API.

При выборе смотрите на объём видеопамяти. Для разных моделей он разный, и точное значение нужно искать в описании модели и в документации программы, которой вы её запускаете.

Путь Б: запуск на процессоре (CPU)

Модель можно запустить и на обычном VPS, без видеокарты. Тогда она работает в оперативной памяти и считается процессором. Это возможно, но:

Конкретной скорости мы не называем: она зависит от модели, процессора и настроек, и мы её не замеряли.

Квантованные модели и Ollama

Квантование — это сжатие модели: числа внутри неё хранятся с меньшей точностью. Модель занимает меньше памяти и запускается на более слабом железе, но качество ответов может немного снижаться. Для запуска на CPU обычно берут именно квантованные модели.

Ollama — программа для запуска моделей у себя. Она скачивает модель, запускает её и открывает к ней доступ через локальный интерфейс. Она работает на Linux и умеет считать как на видеокарте, так и на процессоре. Установка и список поддерживаемых моделей описаны в документации Ollama (адрес в sources статьи, на сайте он не выводится). Перед установкой проверьте актуальную инструкцию: скрипты и команды у таких проектов меняются.

Практический порядок такой:

  1. Выберите небольшую квантованную модель.
  2. Возьмите VPS, у которого памяти заметно больше, чем размер модели.
  3. Запустите и проверьте, устраивает ли вас скорость ответа.
  4. Если нет, переходите на меньшую модель, на сервер мощнее или на API.

Установка Docker, если вы хотите запускать это в контейнере, описана в статье установка Docker на VPS.

Как выбрать

Ситуация Что подойдёт
Бот или сервис с вызовом API модели Обычный VPS
Эксперименты с небольшой моделью, скорость не критична VPS с большим объёмом ОЗУ, запуск на CPU
Своя модель для постоянной работы с быстрым ответом Сервер с GPU
Не уверены Сначала API, затем решайте по счёту и нагрузке

Если расходы на API станут большими, это повод посчитать, выгоден ли свой сервер. Сравнивайте не только цену аренды, но и ваше время на настройку и поддержку.

Что делать дальше

Цены в базе сверены 5 октября 2026 года.