Ollama запускает открытые языковые модели прямо на вашем сервере: вы скачиваете модель командой и общаетесь с ней в терминале или через HTTP API. Подробнее о проекте: Ollama в каталоге ИИ-агентов. Какой сервер выбирать под нейросети в целом, написано в статье сервер для нейросети.
Команды взяты из официальной документации Ollama (адреса в sources) и проверены 6 октября 2026 года на VPS с Ubuntu 24.04, 2 ядрами и 2 ГБ памяти, без видеокарты. Версия Ollama на момент проверки: 0.35.1. Выполняйте их под пользователем с sudo: как его создать, написано в статье первая настройка VPS. Docker для Ollama не нужен.
Что ожидать от VPS без GPU
Без видеокарты модель считается на процессоре. Это работает, но медленно, и главный ограничитель здесь память: модель целиком загружается в оперативную память, и если не помещается, не запустится вообще.
Что получилось на нашем тестовом сервере (2 ядра, 2 ГБ памяти, без GPU, один и тот же вопрос на русском):
| Модель | Что получилось |
|---|---|
| gemma3:1b, 815 МБ | Работает. Около 11 токенов в секунду, занято около 1,2 ГБ памяти сервера |
| llama3.2:1b, 1,3 ГБ | Работает. Около 8,5 токена в секунду, занято около 1,8 ГБ из 2 |
| gemma4, 6,6 ГБ | Не запускается: не хватает памяти |
Токен в русском тексте в среднем короче слова, так что 8–11 токенов в секунду на практике означают несколько слов в секунду: читать ответ по мере появления можно, длинный текст придётся подождать. Первый ответ после запуска приходит дольше: около 4 секунд уходит на загрузку модели в память. Цифры относятся к конкретному серверу, на другом процессоре они будут другими.
Модель gemma4, с которой начинается официальный README, на сервере с 2 ГБ упала с ошибкой unable to allocate CPU buffer: ей понадобилось выделить около 4,4 ГБ одним куском. По этой цифре видно, что и на сервере с 4 ГБ она не поместится. Для неё нужен сервер с 8 ГБ памяти.
Практический вывод: на сервере с 2–4 ГБ берите модели размером до 1–2 ГБ, для моделей покрупнее нужен сервер от 8 ГБ. Размер каждой модели указан на её странице в библиотеке ollama.com.
Цены на серверы с 2 ядрами и 4 ГБ в нашей базе от 650 ₽ до 2 319 ₽ в месяц (на 7 октября 2026 года). Для моделей побольше смотрите серверы с 4 ядрами и 8 ГБ и выше.
Шаг 1. Установите Ollama
curl -fsSL https://ollama.com/install.sh | sh
Команда скачивает установочный скрипт с ollama.com и выполняет его: он ставит программу, создаёт пользователя ollama, регистрирует службу systemd и сразу её запускает. У нас установка заняла около 20 секунд, на диске Ollama без моделей заняла примерно 2 ГБ. В конце скрипт пишет WARNING: No NVIDIA/AMD GPU detected. Ollama will run in CPU-only mode: на сервере без видеокарты это нормально. Если вы не доверяете запуску скрипта «вслепую», скачайте его в файл, прочитайте и запустите вручную.
Шаг 2. Проверьте установку
sudo systemctl status ollama
Команда показывает состояние службы. Должно быть active (running). Если служба не запущена, запустите её:
sudo systemctl start ollama
Автозапуск после перезагрузки скрипт включает сам: в выводе systemctl status в строке Loaded стоит enabled. Если там disabled, включите его вручную:
sudo systemctl enable ollama
Проверьте версию и ответ API:
ollama --version
curl http://localhost:11434
Первая команда выводит версию, вторая обращается к API на локальном порту 11434. В ответ приходит строка Ollama is running.
Шаг 3. Скачайте и запустите модель
Начните с небольшой модели, которая точно поместится в память. На сервере с 2–4 ГБ это, например, gemma3:1b:
ollama run gemma3:1b
Команда скачивает модель при первом запуске (815 МБ) и открывает диалог в терминале. Выйти из диалога можно командой /bye. Список скачанных моделей показывает ollama list.
В официальном README в примере стоит ollama run gemma4. Эта модель весит 6,6 ГБ, запускайте её на сервере с 8 ГБ памяти и больше.
После ответа модель ещё около пяти минут остаётся в памяти, чтобы следующий вопрос не ждал загрузки. Что сейчас загружено, показывает первая команда, а вторая выгружает модель сразу:
ollama ps
ollama stop gemma3:1b
Это важно на маленьком сервере. Мы запустили вторую модель, пока первая ещё была в памяти: вдвоём они не поместились в 2 ГБ, система убила процесс модели, и служба Ollama перезапустилась (в журнале journalctl -u ollama это видно по строке Failed with result 'oom-kill'). Служба поднялась сама через несколько секунд, но ответ оборвался. Перед запуском другой модели выгружайте предыдущую.
API и закрытие порта от интернета
Ollama отдаёт HTTP API на порту 11434. По умолчанию он слушает только адрес 127.0.0.1 (так написано в документации, и так было у нас после установки): то есть снаружи сервера порт недоступен. Это безопасное состояние, и менять его без причины не нужно: у API нет входа по паролю.
Адрес меняет переменная окружения OLLAMA_HOST. Если вы её не задавали, ничего закрывать не надо. Убедиться можно так:
ss -tlnp | grep 11434
Команда показывает, кто слушает порт. Адрес 127.0.0.1:11434 означает, что порт доступен только локально. Если вы видите 0.0.0.0:11434 или *:11434, API открыт всем сетям.
Если нужно, чтобы к Ollama обращались другие программы на этом же сервере, оставляйте локальный адрес. Если Ollama надо открыть другим машинам, документация описывает такой порядок: systemctl edit ollama.service, в разделе [Service] задать Environment="OLLAMA_HOST=0.0.0.0:11434", затем systemctl daemon-reload и systemctl restart ollama. Делайте это только вместе с фаерволом, который пропускает порт лишь с нужных адресов. Лучший путь для чужих клиентов: прокси с авторизацией перед API.
Если вы по ошибке открыли порт, верните настройку: уберите строку OLLAMA_HOST из override-файла службы и перезапустите службу. Ключи сторонних API в Ollama не нужны. Если вы используете их в других программах, храните в переменных окружения или в файле с правами 600 (chmod 600 имя_файла).
Обновление
В документации Ollama для Linux написано: чтобы обновить, запустите установочный скрипт ещё раз. Команда та же, что в шаге 1. Скачанные модели при этом остаются. Мы это проверили: после повторного запуска скрипта обе скачанные модели остались на месте.
Учтите одну особенность. Скрипт сначала удаляет старую версию программы и только потом скачивает новую. Пока идёт загрузка, модели не запускаются: запрос возвращает ошибку llama-server binary not found. Не прерывайте установку и не перезагружайте сервер, пока скрипт не напишет Install complete. Если установка всё же оборвалась, просто запустите скрипт ещё раз: у нас это вернуло всё в рабочее состояние.
Версию можно зафиксировать, передав переменную: curl -fsSL https://ollama.com/install.sh | OLLAMA_VERSION=0.5.7 sh (номер версии замените на нужный).
Что делать дальше
Чтобы работать с моделью в браузере, а не в терминале, поставьте Open WebUI. Подобрать сервер по памяти можно в подборе VPS.
