цены сверены 7 октября 2026 года

Установка Ollama на VPS

Ollama ставится одной командой официального скрипта с ollama.com и запускается как служба systemd. Мы прошли установку на VPS с 2 ядрами и 2 ГБ памяти и замерили, какие модели на нём запускаются и с какой скоростью отвечают.

Установка Ollama на VPS
Установка Ollama на VPShostfakt.ru
Содержание
  1. Что ожидать от VPS без GPU
  2. Шаг 1. Установите Ollama
  3. Шаг 2. Проверьте установку
  4. Шаг 3. Скачайте и запустите модель
  5. API и закрытие порта от интернета
  6. Обновление
  7. Что делать дальше

Ollama запускает открытые языковые модели прямо на вашем сервере: вы скачиваете модель командой и общаетесь с ней в терминале или через HTTP API. Подробнее о проекте: Ollama в каталоге ИИ-агентов. Какой сервер выбирать под нейросети в целом, написано в статье сервер для нейросети.

Команды взяты из официальной документации Ollama (адреса в sources) и проверены 6 октября 2026 года на VPS с Ubuntu 24.04, 2 ядрами и 2 ГБ памяти, без видеокарты. Версия Ollama на момент проверки: 0.35.1. Выполняйте их под пользователем с sudo: как его создать, написано в статье первая настройка VPS. Docker для Ollama не нужен.

Что ожидать от VPS без GPU

Без видеокарты модель считается на процессоре. Это работает, но медленно, и главный ограничитель здесь память: модель целиком загружается в оперативную память, и если не помещается, не запустится вообще.

Что получилось на нашем тестовом сервере (2 ядра, 2 ГБ памяти, без GPU, один и тот же вопрос на русском):

Модель Что получилось
gemma3:1b, 815 МБ Работает. Около 11 токенов в секунду, занято около 1,2 ГБ памяти сервера
llama3.2:1b, 1,3 ГБ Работает. Около 8,5 токена в секунду, занято около 1,8 ГБ из 2
gemma4, 6,6 ГБ Не запускается: не хватает памяти

Токен в русском тексте в среднем короче слова, так что 8–11 токенов в секунду на практике означают несколько слов в секунду: читать ответ по мере появления можно, длинный текст придётся подождать. Первый ответ после запуска приходит дольше: около 4 секунд уходит на загрузку модели в память. Цифры относятся к конкретному серверу, на другом процессоре они будут другими.

Модель gemma4, с которой начинается официальный README, на сервере с 2 ГБ упала с ошибкой unable to allocate CPU buffer: ей понадобилось выделить около 4,4 ГБ одним куском. По этой цифре видно, что и на сервере с 4 ГБ она не поместится. Для неё нужен сервер с 8 ГБ памяти.

Практический вывод: на сервере с 2–4 ГБ берите модели размером до 1–2 ГБ, для моделей покрупнее нужен сервер от 8 ГБ. Размер каждой модели указан на её странице в библиотеке ollama.com.

Цены на серверы с 2 ядрами и 4 ГБ в нашей базе от 650 ₽ до 2 319 ₽ в месяц (на 7 октября 2026 года). Для моделей побольше смотрите серверы с 4 ядрами и 8 ГБ и выше.

Шаг 1. Установите Ollama

curl -fsSL https://ollama.com/install.sh | sh

Команда скачивает установочный скрипт с ollama.com и выполняет его: он ставит программу, создаёт пользователя ollama, регистрирует службу systemd и сразу её запускает. У нас установка заняла около 20 секунд, на диске Ollama без моделей заняла примерно 2 ГБ. В конце скрипт пишет WARNING: No NVIDIA/AMD GPU detected. Ollama will run in CPU-only mode: на сервере без видеокарты это нормально. Если вы не доверяете запуску скрипта «вслепую», скачайте его в файл, прочитайте и запустите вручную.

Шаг 2. Проверьте установку

sudo systemctl status ollama

Команда показывает состояние службы. Должно быть active (running). Если служба не запущена, запустите её:

sudo systemctl start ollama

Автозапуск после перезагрузки скрипт включает сам: в выводе systemctl status в строке Loaded стоит enabled. Если там disabled, включите его вручную:

sudo systemctl enable ollama

Проверьте версию и ответ API:

ollama --version
curl http://localhost:11434

Первая команда выводит версию, вторая обращается к API на локальном порту 11434. В ответ приходит строка Ollama is running.

Шаг 3. Скачайте и запустите модель

Начните с небольшой модели, которая точно поместится в память. На сервере с 2–4 ГБ это, например, gemma3:1b:

ollama run gemma3:1b

Команда скачивает модель при первом запуске (815 МБ) и открывает диалог в терминале. Выйти из диалога можно командой /bye. Список скачанных моделей показывает ollama list.

В официальном README в примере стоит ollama run gemma4. Эта модель весит 6,6 ГБ, запускайте её на сервере с 8 ГБ памяти и больше.

После ответа модель ещё около пяти минут остаётся в памяти, чтобы следующий вопрос не ждал загрузки. Что сейчас загружено, показывает первая команда, а вторая выгружает модель сразу:

ollama ps
ollama stop gemma3:1b

Это важно на маленьком сервере. Мы запустили вторую модель, пока первая ещё была в памяти: вдвоём они не поместились в 2 ГБ, система убила процесс модели, и служба Ollama перезапустилась (в журнале journalctl -u ollama это видно по строке Failed with result 'oom-kill'). Служба поднялась сама через несколько секунд, но ответ оборвался. Перед запуском другой модели выгружайте предыдущую.

API и закрытие порта от интернета

Ollama отдаёт HTTP API на порту 11434. По умолчанию он слушает только адрес 127.0.0.1 (так написано в документации, и так было у нас после установки): то есть снаружи сервера порт недоступен. Это безопасное состояние, и менять его без причины не нужно: у API нет входа по паролю.

Адрес меняет переменная окружения OLLAMA_HOST. Если вы её не задавали, ничего закрывать не надо. Убедиться можно так:

ss -tlnp | grep 11434

Команда показывает, кто слушает порт. Адрес 127.0.0.1:11434 означает, что порт доступен только локально. Если вы видите 0.0.0.0:11434 или *:11434, API открыт всем сетям.

Если нужно, чтобы к Ollama обращались другие программы на этом же сервере, оставляйте локальный адрес. Если Ollama надо открыть другим машинам, документация описывает такой порядок: systemctl edit ollama.service, в разделе [Service] задать Environment="OLLAMA_HOST=0.0.0.0:11434", затем systemctl daemon-reload и systemctl restart ollama. Делайте это только вместе с фаерволом, который пропускает порт лишь с нужных адресов. Лучший путь для чужих клиентов: прокси с авторизацией перед API.

Если вы по ошибке открыли порт, верните настройку: уберите строку OLLAMA_HOST из override-файла службы и перезапустите службу. Ключи сторонних API в Ollama не нужны. Если вы используете их в других программах, храните в переменных окружения или в файле с правами 600 (chmod 600 имя_файла).

Обновление

В документации Ollama для Linux написано: чтобы обновить, запустите установочный скрипт ещё раз. Команда та же, что в шаге 1. Скачанные модели при этом остаются. Мы это проверили: после повторного запуска скрипта обе скачанные модели остались на месте.

Учтите одну особенность. Скрипт сначала удаляет старую версию программы и только потом скачивает новую. Пока идёт загрузка, модели не запускаются: запрос возвращает ошибку llama-server binary not found. Не прерывайте установку и не перезагружайте сервер, пока скрипт не напишет Install complete. Если установка всё же оборвалась, просто запустите скрипт ещё раз: у нас это вернуло всё в рабочее состояние.

Версию можно зафиксировать, передав переменную: curl -fsSL https://ollama.com/install.sh | OLLAMA_VERSION=0.5.7 sh (номер версии замените на нужный).

Что делать дальше

Чтобы работать с моделью в браузере, а не в терминале, поставьте Open WebUI. Подобрать сервер по памяти можно в подборе VPS.