ННейроАссистент
Продвинутый11 мин чтения·

Локальные нейросети: запуск на своём компьютере

Зачем запускать модели локально, какое железо нужно, чем отличаются Ollama и LM Studio, как выбрать модель под задачу и объём видеопамяти.


Локальный запуск решает две задачи, которые не решает ни один облачный сервис: данные не покидают ваш компьютер, а каждый запрос ничего не стоит. Цена вопроса — требования к железу и качество чуть ниже флагманских моделей.

Когда это действительно нужно

  • Конфиденциальные данные. Клиентские документы, медицинские записи, коммерческая тайна, внутренние регламенты — всё, что нельзя отправлять третьим лицам.
  • Большой объём однотипных запросов. Обработка тысяч записей через облачный API стоит денег; локально это только электричество.
  • Работа без интернета. Поезд, самолёт, объект без связи.
  • Эксперименты и дообучение. Полный контроль над моделью и её поведением.

Если ни один пункт не про вас — облачные сервисы проще и качественнее.

Что нужно по железу

Главный параметр — объём видеопамяти. Модель должна поместиться в неё целиком, иначе вычисления уйдут на процессор и всё станет очень медленным.

ВидеопамятьРазмер моделиЧто реально получится
6–8 ГБ7–8 млрд параметровПереводы, черновики, простые тексты, классификация
12–16 ГБ12–14 млрдПовседневные задачи, код, работа с документами
24 ГБ27–32 млрдКачество, близкое к среднему облачному сервису
48 ГБ и выше70 млрд и большеСложные рассуждения, длинный контекст

Без видеокарты модель тоже запустится — на процессоре и оперативной памяти. Работать будет, но медленно: несколько слов в секунду вместо десятков. Для фоновых задач этого иногда достаточно.

На компьютерах Apple с единой памятью ситуация лучше: доступная модели память равна объёму оперативной, поэтому машина с 32 ГБ тянет модели, для которых на ПК нужна дорогая видеокарта.

Квантизация: как модель помещается в память

Квантизация снижает точность чисел в весах модели. Файл уменьшается в два-четыре раза, скорость растёт, качество проседает незначительно.

Практическое правило: квантизованная большая модель почти всегда лучше, чем полноразмерная маленькая. Если выбор между моделью на 14 млрд параметров в сжатом виде и на 7 млрд в полном — берите первую.

Ориентир по форматам: сжатие до 4 бит — оптимальный баланс, до 8 бит — качество почти как у оригинала, ниже 4 бит — заметная деградация.

Чем запускать

LM Studio — настольное приложение с обычным интерфейсом. Показывает каталог моделей, подсказывает, какие потянет ваш компьютер, умеет чат и работу с документами, поднимает локальный API. Лучший вариант для первого знакомства.

Ollama — запуск одной командой в терминале. Ставится за минуту, поднимает локальный сервер, к которому подключается множество сторонних клиентов. Выбор тех, кому нужен API, а не интерфейс.

Jan и GPT4All — открытые альтернативы с собственным интерфейсом; GPT4All неплохо работает и без видеокарты.

Для генерации изображений отдельная связка: ComfyUI для полного контроля через схемы из узлов или более простые веб-интерфейсы для обычной генерации.

Как выбрать модель

Начните с модели среднего размера под ваше железо и проверьте её на своей реальной задаче. Смотреть стоит на три вещи:

  1. Качество русского языка. Многие открытые модели заметно слабее в русском, чем в английском. Есть версии, дообученные специально на русских данных — они обычно выигрывают.
  2. Специализация. Отдельные модели заточены под код, отдельные — под рассуждения, отдельные — под длинный контекст.
  3. Лицензия. «Открытые веса» не всегда означают разрешённое коммерческое использование. Читайте условия, если планируете встраивать модель в продукт.

Чего ожидать честно

Локальная модель на домашнем железе не догоняет флагманские облачные сервисы в сложных рассуждениях, длинных документах и программировании. Разрыв сократился, но не исчез.

Зато в повседневных задачах — переписать текст, сделать конспект, ответить по своим заметкам, перевести, классифицировать — разница часто незаметна. А по приватности и стоимости локальный запуск выигрывает безоговорочно.

Практичная схема: гибрид

Самый разумный подход — не выбирать, а комбинировать:

  • Чувствительные данные и массовая обработка — локальная модель
  • Сложные задачи и то, где нужно максимальное качество — облачный сервис
  • Черновая фильтрация локально, доводка в облаке

Единый локальный API позволяет переключаться между моделями, не переписывая код.

Что дальше

Подберите конкретный сервис под вашу задачу в каталоге с фильтрами или возьмите готовый промпт из библиотеки.