Давайте дружить в Телеграме: рассказываем про новые фичи и общаемся в комментах Подписаться
support@serv.host
Личный кабинет

Локальные LLM, что это, где брать и как запустить.

Локальные LLM, что это, где брать и как запустить

Локальные LLM — это те же самые языковые модели, но веса лежат у тебя на диске, а весь инференс крутится на твоём железе. Можно сколько угодно экспериментировать с системными промптами, квантованием и дообучением.

Давайте разберемся: что это такое, какое железо нужно, где брать модели и как это всё дело запустить.

Что такое LLM

По сути это нейросети с миллиардами параметров, которые умеют генерировать текст, код, рассуждать и отвечать на вопросы.

Самые ходовые семейства локальных моделей сейчас:

  • Llama (Meta) — популярная линейка. Llama 3.1, 3.2 и новые версии 4-го поколения.
  • Qwen (Alibaba) — часто обгоняет Llama в практических задачах.
  • Gemma (Google) и Phi (Microsoft) — компактные варианты, которые нормально бегают даже на слабом железе.

Модели обычно распространяют в двух видах:

  • исходные веса в формате safetensors (Hugging Face). Если просто использовать модель, то они не нужны.
  • уже квантованные GGUF-файлы (самый удобный вариант для локального запуска)

Квантование — это сжатие модели. Q4_K_M или Q5_K_M почти не теряют качество, но занимают в разы меньше видеопамяти.

Какое оборудование нужно

Всё упирается в размер модели и уровень квантования.

Примерные требования по видеопамяти:

  • 7–8B модели в Q4 — спокойно заводятся на 6–8 ГБ VRAM
  • 14B модели — от 10–12 ГБ
  • 32B модели — от 20–24 ГБ
  • 70B модели — уже 40+ ГБ, либо сильное квантование + много оперативки

Что реально покупать:

  • Бюджетный старт: RTX 3060 12 ГБ или RTX 4060 Ti 16 ГБ. Хватает для 7–14B моделей с хорошей скоростью.
  • Комфортный уровень: RTX 3090 или 4090 на 24 ГБ. Можно нормально гонять 32B и даже 70B в Q3/Q4.
  • Если нужно серьёзно — несколько видеокарт или серверные GPU (A6000, A100).
  • CPU-only вариант существует, но он медленный. Имеет смысл только на мощных процессорах с 64–128 ГБ оперативки.

Оперативки лучше иметь с запасом: для 32B+ моделей желательно от 64 ГБ, лучше 128. Диск — быстрый NVMe, модели весят от 4 до 40+ гигабайт.

Где брать модели

Основных мест три:

  1. Hugging Face (huggingface.co) — Самое большое хранилище. Ищешь нужную модель, заходишь во вкладку Files and versions и качаешь либо safetensors, либо готовые GGUF.

  2. Репозитории квантовальщиков — TheBloke, bartowski, mradermacher и другие уже сделали кучу готовых GGUF-версий. Бери нужный размер квантования и запускай.

  3. Встроенные библиотеки в программах — Ollama, LM Studio и Open WebUI умеют сами скачивать модели по имени. Иногда это самый быстрый способ.

Полезные поисковые запросы на Hugging Face:

  • llama-3.1-8b-instruct GGUF
  • Qwen2.5-14B-Instruct GGUF
  • DeepSeek-R1-Distill GGUF

Всегда смотри на лицензию. Большинство современных открытых моделей можно использовать и в коммерческих проектах, но иногда бывают ограничения.

Как запускать

Самые удобные варианты на сегодня:

1. Ollama (самый простой способ)

Ставится в одну команду. После установки можно сразу писать:

ollama run llama3.1
ollama run qwen2.5:14b

Модели качаются автоматически. Есть API, совместимое с OpenAI, так что можно подключать к своим скриптам через ==base_url="http://localhost:11434/v1"==.

2. LM Studio

Графическая программа под Windows, macOS и Linux. Выбираешь модель, скачиваешь, запускаешь. Есть встроенный чат и локальный сервер с OpenAI-совместимым API. Удобно, если не хочешь возиться с терминалом.

3. llama.cpp + сервер

Классика. Собираешь или ставишь готовые бинарники, запускаешь сервер:

./llama-server -m model.gguf -c 8192 --port 8080

Потом можно стучаться в ==http://localhost:8080/v1== тем же OpenAI-клиентом.

4. text-generation-webui (oobabooga)

Более тяжёлый, но очень гибкий вариант. Поддерживает кучу бэкендов (llama.cpp, exllamav2, transformers), расширения, LoRA и так далее. Хорош, когда нужно много всего крутить.

5. vLLM или Aphrodite Engine

Если нужна максимальная скорость и обслуживание нескольких пользователей одновременно. Эти движки лучше работают с исходными safetensors и дают высокую пропускную способность.

Пример подключения к своему коду

После того как поднял любой из серверов выше, в Python это выглядит так же, как работа с обычным API:

from openai import OpenAI

client = OpenAI(
    base_url="http://localhost:11434/v1",  # или 8080, или 5000 — зависит от того, что запустил
    api_key="sk-local"  # можно любой, многие серверы его не проверяют
)

response = client.chat.completions.create(
    model="llama3.1",
    messages=[
        {"role": "system", "content": ""},
        {"role": "user", "content": "Привет!"}
    ],
    temperature=0.7
)

print(response.choices[0].message.content)

На что обратить внимание

  • Контекстное окно. У разных моделей оно разное (4k, 8k, 32k, 128k). Чем больше контекст — тем больше памяти нужно.
  • Скорость. На 4090 14B модель в Q4 обычно выдаёт 40–80 токенов в секунду. На 3060 будет заметно медленнее.
  • Качество квантования. Q4_K_M — хороший баланс. Q3 уже может заметно тупить, Q5–Q6 почти как оригинал.
  • Система охлаждения. Большие генерации под полной нагрузкой греют карту сильно.