Языковую модель можно запускать не только на арендованном сервере, но и на своём компьютере. Mac mini на процессоре M4 для этого удобен: у него общая память для процессора и видеочипа, поэтому модель считается на видеочипе без отдельной видеокарты. Мы проверили, что реально получается на младшей конфигурации с 16 ГБ.
Если локальные модели вам не нужны и нейросеть работает по API, читайте про сервер для нейросети: там хватит обычного VPS.
Как мы замеряли
- Компьютер: Mac mini M4, 16 ГБ памяти, macOS 26.1, подключён кабелем.
- Программа: Ollama версии 0.40.0. Дата замеров: 7 октября 2026 года.
- Каждой модели давали два задания на русском: короткий вопрос («объясни в двух предложениях, что такое VPS») и длинное («напиши инструкцию из десяти шагов по настройке сервера», до 500 токенов ответа).
- Скорость в таблице взята по длинному заданию, когда модель уже загружена в память. Это число токенов ответа в секунду, которое показывает сама Ollama. В столбце «Память» стоит, сколько модель занимает в оперативной памяти, в столбце «Файл» её размер на диске, в столбце «Загрузка» время, за которое модель грузится в память перед первым ответом.
- Перед следующей моделью предыдущую выгружали из памяти.
Токен в русском тексте в среднем короче слова. Для ориентира: 20 токенов в секунду читаются с экрана без ожидания, 40 и больше ощущаются как мгновенный ответ.
Результаты
| Модель | Скорость | Память | Файл | Загрузка |
|---|---|---|---|---|
| gemma3:1b | 101 ток/с | 0,9 ГБ | 0,8 ГБ | 1 с |
| gemma4:e2b | 95 ток/с | 7,4 ГБ | 7,5 ГБ | 5 с |
| gemma4:e4b | 68 ток/с | 9,4 ГБ | 9,5 ГБ | 5 с |
| llama3.2:3b | 46 ток/с | 2,5 ГБ | 2,0 ГБ | 1 с |
| phi4-mini | 37 ток/с | 3,1 ГБ | 2,5 ГБ | 1 с |
| gemma3:4b | 37 ток/с | 2,9 ГБ | 3,3 ГБ | 1 с |
| gemma4:12b | 29 ток/с | 8,0 ГБ | 7,7 ГБ | 4 с |
| qwen3.5:4b | 29 ток/с | 4,4 ГБ | 4,0 ГБ | 1 с |
| qwen3.5:9b | 28 ток/с | 8,0 ГБ | 7,6 ГБ | 3 с |
| gpt-oss:20b | 23 ток/с | 14,0 ГБ | 13,8 ГБ | 23 с |
| mistral:7b | 23 ток/с | 4,9 ГБ | 4,4 ГБ | 1 с |
| deepseek-r1:8b | 20 ток/с | 5,9 ГБ | 5,2 ГБ | 1 с |
| gemma4:26b | не запустилась | нужно 15 ГБ | 16,1 ГБ | нет |
На коротком вопросе скорости почти те же: разница с длинным заданием у всех моделей в пределах 15%.
Все модели, кроме gpt-oss:20b, считались на видеочипе целиком. Мы сравнивали только скорость и память. Качество ответов не оценивали: это отдельная и субъективная работа.
Где потолок у 16 ГБ
Две самые тяжёлые модели показывают границу.
gpt-oss:20b ещё работает, но впритык. Модель занимает 14 ГБ из 16. На видеочипе поместилось 82% модели, остальное считал процессор. Загрузка в память заняла 23 секунды вместо 1–5 у остальных, свободной памяти в системе после загрузки осталось 10%. Отвечает она при этом с приличной скоростью, 23 токена в секунду, но пользоваться компьютером для чего-то ещё в это время не получится.
gemma4:26b не запустилась. Файл модели весит 16,1 ГБ. Ollama отказалась её загружать с сообщением:
model requires 15.0 GiB but only 11.3 GiB are available
Обратите внимание на вторую цифру. Из 16 ГБ под модель на видеочипе доступно не всё: часть занята системой. В нашем случае свободными были 11,3 ГБ.
Практический вывод: на Mac mini с 16 ГБ спокойно работают модели, которые занимают до 8–10 ГБ. Это оставляет место системе и браузеру. Модели на 14 ГБ запускаются, но забирают компьютер целиком. Всё, что тяжелее, требует 24 или 32 ГБ.
Обновите Ollama: это меняет скорость
До замеров на этом Mac mini стояла Ollama версии 0.20.0 с моделью gemma4:e4b, скачанной полгода назад. Мы замерили её тем же длинным заданием три раза подряд:
Ollama 0.20.0, gemma4:e4b: 27,4 / 27,4 / 27,3 токена в секунду
Ollama 0.40.0, gemma4:e4b: 68,3 токена в секунду
Тот же компьютер, та же модель по названию, разница в два с половиной раза. Оговорка: вместе с программой обновился и сам файл модели (при новой установке мы скачали его заново), поэтому мы не можем сказать, какая часть ускорения пришлась на программу, а какая на модель. Но вывод для практики один: если Ollama и модели у вас стоят давно, обновите и то и другое и замерьте снова. Скорость ответа видна по ключу --verbose:
ollama run gemma4:e4b --verbose
После ответа Ollama покажет строку eval rate с числом токенов в секунду.
Mac mini против VPS без видеокарты
Для сравнения те же модели мы запускали на арендованном VPS с 2 ядрами и 2 ГБ памяти, без видеокарты (подробности в инструкции по Ollama):
| Модель | VPS, 2 ядра и 2 ГБ | Mac mini M4, 16 ГБ |
|---|---|---|
| gemma3:1b | около 11 токенов/с | 101 токен/с |
| gemma4 (e4b) | не запускается, не хватает памяти | 68 токенов/с |
Самая маленькая модель на Mac mini работает в девять раз быстрее, а модели покрупнее на таком VPS не запускаются вообще. Сравнение не совсем равное: сервер взят самый дешёвый. На VPS с 8 ГБ памяти та же gemma4 запустится, но считать её будет процессор, и скорость останется низкой.
Отсюда простое правило. Обычный VPS без видеокарты годится для маленьких моделей и для программ, которые ходят к модели по API. Если модель покрупнее нужна на сервере, а не дома, смотрите серверы с видеокартой: в таблице есть цены за сутки, так что можно взять сервер на время и сравнить со своим компьютером.
Что мы не проверяли
- Качество ответов моделей и то, как они справляются с русским языком на сложных задачах.
- Длинные диалоги и большие документы: с ростом контекста память и время ответа растут.
- Несколько запросов одновременно.
- Модели для картинок и распознавания речи.
- Другие конфигурации Mac mini: 24 и 32 ГБ.
Версии программ и моделей меняются быстро. Цифры в этой статье относятся к 7 октября 2026 года, Ollama 0.40.0 и тем версиям моделей, которые были в библиотеке Ollama в этот день.
Что делать дальше
Нужна модель на сервере, а не дома: откройте таблицу серверов с видеокартой. Хватит модели по API: подберите обычный VPS. Как поставить Ollama на сервер, написано в инструкции.
