Локальные LLM, что это, где брать и как запустить.
Локальные LLM, что это, где брать и как запустить
Локальные LLM — это те же самые языковые модели, но веса лежат у тебя на диске, а весь инференс крутится на твоём железе. Можно сколько угодно экспериментировать с системными промптами, квантованием и дообучением.
Давайте разберемся: что это такое, какое железо нужно, где брать модели и как это всё дело запустить.
Что такое LLM
По сути это нейросети с миллиардами параметров, которые умеют генерировать текст, код, рассуждать и отвечать на вопросы.
Самые ходовые семейства локальных моделей сейчас:
- Llama (Meta) — популярная линейка. Llama 3.1, 3.2 и новые версии 4-го поколения.
- Qwen (Alibaba) — часто обгоняет Llama в практических задачах.
- Gemma (Google) и Phi (Microsoft) — компактные варианты, которые нормально бегают даже на слабом железе.
Модели обычно распространяют в двух видах:
- исходные веса в формате safetensors (Hugging Face). Если просто использовать модель, то они не нужны.
- уже квантованные GGUF-файлы (самый удобный вариант для локального запуска)
Квантование — это сжатие модели. Q4_K_M или Q5_K_M почти не теряют качество, но занимают в разы меньше видеопамяти.
Какое оборудование нужно
Всё упирается в размер модели и уровень квантования.
Примерные требования по видеопамяти:
- 7–8B модели в Q4 — спокойно заводятся на 6–8 ГБ VRAM
- 14B модели — от 10–12 ГБ
- 32B модели — от 20–24 ГБ
- 70B модели — уже 40+ ГБ, либо сильное квантование + много оперативки
Что реально покупать:
- Бюджетный старт: RTX 3060 12 ГБ или RTX 4060 Ti 16 ГБ. Хватает для 7–14B моделей с хорошей скоростью.
- Комфортный уровень: RTX 3090 или 4090 на 24 ГБ. Можно нормально гонять 32B и даже 70B в Q3/Q4.
- Если нужно серьёзно — несколько видеокарт или серверные GPU (A6000, A100).
- CPU-only вариант существует, но он медленный. Имеет смысл только на мощных процессорах с 64–128 ГБ оперативки.
Оперативки лучше иметь с запасом: для 32B+ моделей желательно от 64 ГБ, лучше 128. Диск — быстрый NVMe, модели весят от 4 до 40+ гигабайт.
Где брать модели
Основных мест три:
-
Hugging Face (huggingface.co) — Самое большое хранилище. Ищешь нужную модель, заходишь во вкладку Files and versions и качаешь либо safetensors, либо готовые GGUF.
-
Репозитории квантовальщиков — TheBloke, bartowski, mradermacher и другие уже сделали кучу готовых GGUF-версий. Бери нужный размер квантования и запускай.
-
Встроенные библиотеки в программах — Ollama, LM Studio и Open WebUI умеют сами скачивать модели по имени. Иногда это самый быстрый способ.
Полезные поисковые запросы на Hugging Face:
- llama-3.1-8b-instruct GGUF
- Qwen2.5-14B-Instruct GGUF
- DeepSeek-R1-Distill GGUF
Всегда смотри на лицензию. Большинство современных открытых моделей можно использовать и в коммерческих проектах, но иногда бывают ограничения.
Как запускать
Самые удобные варианты на сегодня:
1. Ollama (самый простой способ)
Ставится в одну команду. После установки можно сразу писать:
ollama run llama3.1
ollama run qwen2.5:14b
Модели качаются автоматически. Есть API, совместимое с OpenAI, так что можно подключать к своим скриптам через ==base_url="http://localhost:11434/v1"==.
2. LM Studio
Графическая программа под Windows, macOS и Linux. Выбираешь модель, скачиваешь, запускаешь. Есть встроенный чат и локальный сервер с OpenAI-совместимым API. Удобно, если не хочешь возиться с терминалом.
3. llama.cpp + сервер
Классика. Собираешь или ставишь готовые бинарники, запускаешь сервер:
./llama-server -m model.gguf -c 8192 --port 8080
Потом можно стучаться в ==http://localhost:8080/v1== тем же OpenAI-клиентом.
4. text-generation-webui (oobabooga)
Более тяжёлый, но очень гибкий вариант. Поддерживает кучу бэкендов (llama.cpp, exllamav2, transformers), расширения, LoRA и так далее. Хорош, когда нужно много всего крутить.
5. vLLM или Aphrodite Engine
Если нужна максимальная скорость и обслуживание нескольких пользователей одновременно. Эти движки лучше работают с исходными safetensors и дают высокую пропускную способность.
Пример подключения к своему коду
После того как поднял любой из серверов выше, в Python это выглядит так же, как работа с обычным API:
from openai import OpenAI
client = OpenAI(
base_url="http://localhost:11434/v1", # или 8080, или 5000 — зависит от того, что запустил
api_key="sk-local" # можно любой, многие серверы его не проверяют
)
response = client.chat.completions.create(
model="llama3.1",
messages=[
{"role": "system", "content": ""},
{"role": "user", "content": "Привет!"}
],
temperature=0.7
)
print(response.choices[0].message.content)
На что обратить внимание
- Контекстное окно. У разных моделей оно разное (4k, 8k, 32k, 128k). Чем больше контекст — тем больше памяти нужно.
- Скорость. На 4090 14B модель в Q4 обычно выдаёт 40–80 токенов в секунду. На 3060 будет заметно медленнее.
- Качество квантования. Q4_K_M — хороший баланс. Q3 уже может заметно тупить, Q5–Q6 почти как оригинал.
- Система охлаждения. Большие генерации под полной нагрузкой греют карту сильно.

