цены сверены 9 октября 2026 года

Какие нейросети тянет Mac mini M4 с 16 ГБ памяти

Мы запустили на Mac mini M4 с 16 ГБ памяти 13 открытых языковых моделей и замерили каждую. Двенадцать работают, самая быстрая отвечает со скоростью 101 токен в секунду, тринадцатая в память не поместилась.

Какие нейросети тянет Mac mini M4 с 16 ГБ памяти
Какие нейросети тянет Mac mini M4 с 16 ГБ памятиhostfakt.ru
Содержание
  1. Как мы замеряли
  2. Результаты
  3. Где потолок у 16 ГБ
  4. Обновите Ollama: это меняет скорость
  5. Mac mini против VPS без видеокарты
  6. Что мы не проверяли
  7. Что делать дальше
Замерено на своём Mac mini 7 октября 2026 годаMac mini M4, 16 ГБ, macOS 26.1 · Ollama 0.40.0Как мы проверяем

Языковую модель можно запускать не только на арендованном сервере, но и на своём компьютере. Mac mini на процессоре M4 для этого удобен: у него общая память для процессора и видеочипа, поэтому модель считается на видеочипе без отдельной видеокарты. Мы проверили, что реально получается на младшей конфигурации с 16 ГБ.

Если локальные модели вам не нужны и нейросеть работает по API, читайте про сервер для нейросети: там хватит обычного VPS.

Как мы замеряли

  • Компьютер: Mac mini M4, 16 ГБ памяти, macOS 26.1, подключён кабелем.
  • Программа: Ollama версии 0.40.0. Дата замеров: 7 октября 2026 года.
  • Каждой модели давали два задания на русском: короткий вопрос («объясни в двух предложениях, что такое VPS») и длинное («напиши инструкцию из десяти шагов по настройке сервера», до 500 токенов ответа).
  • Скорость в таблице взята по длинному заданию, когда модель уже загружена в память. Это число токенов ответа в секунду, которое показывает сама Ollama. В столбце «Память» стоит, сколько модель занимает в оперативной памяти, в столбце «Файл» её размер на диске, в столбце «Загрузка» время, за которое модель грузится в память перед первым ответом.
  • Перед следующей моделью предыдущую выгружали из памяти.

Токен в русском тексте в среднем короче слова. Для ориентира: 20 токенов в секунду читаются с экрана без ожидания, 40 и больше ощущаются как мгновенный ответ.

Результаты

Модель Скорость Память Файл Загрузка
gemma3:1b 101 ток/с 0,9 ГБ 0,8 ГБ 1 с
gemma4:e2b 95 ток/с 7,4 ГБ 7,5 ГБ 5 с
gemma4:e4b 68 ток/с 9,4 ГБ 9,5 ГБ 5 с
llama3.2:3b 46 ток/с 2,5 ГБ 2,0 ГБ 1 с
phi4-mini 37 ток/с 3,1 ГБ 2,5 ГБ 1 с
gemma3:4b 37 ток/с 2,9 ГБ 3,3 ГБ 1 с
gemma4:12b 29 ток/с 8,0 ГБ 7,7 ГБ 4 с
qwen3.5:4b 29 ток/с 4,4 ГБ 4,0 ГБ 1 с
qwen3.5:9b 28 ток/с 8,0 ГБ 7,6 ГБ 3 с
gpt-oss:20b 23 ток/с 14,0 ГБ 13,8 ГБ 23 с
mistral:7b 23 ток/с 4,9 ГБ 4,4 ГБ 1 с
deepseek-r1:8b 20 ток/с 5,9 ГБ 5,2 ГБ 1 с
gemma4:26b не запустилась нужно 15 ГБ 16,1 ГБ нет

На коротком вопросе скорости почти те же: разница с длинным заданием у всех моделей в пределах 15%.

Все модели, кроме gpt-oss:20b, считались на видеочипе целиком. Мы сравнивали только скорость и память. Качество ответов не оценивали: это отдельная и субъективная работа.

Где потолок у 16 ГБ

Две самые тяжёлые модели показывают границу.

gpt-oss:20b ещё работает, но впритык. Модель занимает 14 ГБ из 16. На видеочипе поместилось 82% модели, остальное считал процессор. Загрузка в память заняла 23 секунды вместо 1–5 у остальных, свободной памяти в системе после загрузки осталось 10%. Отвечает она при этом с приличной скоростью, 23 токена в секунду, но пользоваться компьютером для чего-то ещё в это время не получится.

gemma4:26b не запустилась. Файл модели весит 16,1 ГБ. Ollama отказалась её загружать с сообщением:

model requires 15.0 GiB but only 11.3 GiB are available

Обратите внимание на вторую цифру. Из 16 ГБ под модель на видеочипе доступно не всё: часть занята системой. В нашем случае свободными были 11,3 ГБ.

Практический вывод: на Mac mini с 16 ГБ спокойно работают модели, которые занимают до 8–10 ГБ. Это оставляет место системе и браузеру. Модели на 14 ГБ запускаются, но забирают компьютер целиком. Всё, что тяжелее, требует 24 или 32 ГБ.

Обновите Ollama: это меняет скорость

До замеров на этом Mac mini стояла Ollama версии 0.20.0 с моделью gemma4:e4b, скачанной полгода назад. Мы замерили её тем же длинным заданием три раза подряд:

Ollama 0.20.0, gemma4:e4b: 27,4 / 27,4 / 27,3 токена в секунду
Ollama 0.40.0, gemma4:e4b: 68,3 токена в секунду

Тот же компьютер, та же модель по названию, разница в два с половиной раза. Оговорка: вместе с программой обновился и сам файл модели (при новой установке мы скачали его заново), поэтому мы не можем сказать, какая часть ускорения пришлась на программу, а какая на модель. Но вывод для практики один: если Ollama и модели у вас стоят давно, обновите и то и другое и замерьте снова. Скорость ответа видна по ключу --verbose:

ollama run gemma4:e4b --verbose

После ответа Ollama покажет строку eval rate с числом токенов в секунду.

Mac mini против VPS без видеокарты

Для сравнения те же модели мы запускали на арендованном VPS с 2 ядрами и 2 ГБ памяти, без видеокарты (подробности в инструкции по Ollama):

Модель VPS, 2 ядра и 2 ГБ Mac mini M4, 16 ГБ
gemma3:1b около 11 токенов/с 101 токен/с
gemma4 (e4b) не запускается, не хватает памяти 68 токенов/с

Самая маленькая модель на Mac mini работает в девять раз быстрее, а модели покрупнее на таком VPS не запускаются вообще. Сравнение не совсем равное: сервер взят самый дешёвый. На VPS с 8 ГБ памяти та же gemma4 запустится, но считать её будет процессор, и скорость останется низкой.

Отсюда простое правило. Обычный VPS без видеокарты годится для маленьких моделей и для программ, которые ходят к модели по API. Если модель покрупнее нужна на сервере, а не дома, смотрите серверы с видеокартой: в таблице есть цены за сутки, так что можно взять сервер на время и сравнить со своим компьютером.

Что мы не проверяли

  • Качество ответов моделей и то, как они справляются с русским языком на сложных задачах.
  • Длинные диалоги и большие документы: с ростом контекста память и время ответа растут.
  • Несколько запросов одновременно.
  • Модели для картинок и распознавания речи.
  • Другие конфигурации Mac mini: 24 и 32 ГБ.

Версии программ и моделей меняются быстро. Цифры в этой статье относятся к 7 октября 2026 года, Ollama 0.40.0 и тем версиям моделей, которые были в библиотеке Ollama в этот день.

Что делать дальше

Нужна модель на сервере, а не дома: откройте таблицу серверов с видеокартой. Хватит модели по API: подберите обычный VPS. Как поставить Ollama на сервер, написано в инструкции.