support@serv.host
ServicestatusKonto erstellen
Glückskarten

Локальные LLM, что это, где брать и как запустить.

Локальные LLM — это те же самые языковые модели, но веса лежат у тебя на диске, а весь инференс крутится на твоём железе. Можно сколько угодно экспериментировать с системными промптами, квантованием и дообучением.

Давайте разберемся: что это такое, какое железо нужно, где брать модели и как это всё дело запустить.

Что такое LLM

По сути это нейросети с миллиардами параметров, которые умеют генерировать текст, код, рассуждать и отвечать на вопросы.

Самые ходовые семейства локальных моделей сейчас:

  • Llama (Meta) — популярная линейка. Llama 3.1, 3.2 и новые версии 4-го поколения.
  • Qwen (Alibaba) — часто обгоняет Llama в практических задачах.
  • Gemma (Google) и Phi (Microsoft) — компактные варианты, которые нормально бегают даже на слабом железе.

Модели обычно распространяют в двух видах:

  • исходные веса в формате safetensors (Hugging Face). Если просто использовать модель, то они не нужны.
  • уже квантованные GGUF-файлы (самый удобный вариант для локального запуска)

Квантование — это сжатие модели. Q4_K_M или Q5_K_M почти не теряют качество, но занимают в разы меньше видеопамяти.

Какое оборудование нужно

Всё упирается в размер модели и уровень квантования.

Примерные требования по видеопамяти:

  • 7–8B модели в Q4 — спокойно заводятся на 6–8 ГБ VRAM
  • 14B модели — от 10–12 ГБ
  • 32B модели — от 20–24 ГБ
  • 70B модели — уже 40+ ГБ, либо сильное квантование + много оперативки

Что реально покупать:

  • Бюджетный старт: RTX 3060 12 ГБ или RTX 4060 Ti 16 ГБ. Хватает для 7–14B моделей с хорошей скоростью.
  • Комфортный уровень: RTX 3090 или 4090 на 24 ГБ. Можно нормально гонять 32B и даже 70B в Q3/Q4.
  • Если нужно серьёзно — несколько видеокарт или серверные GPU (A6000, A100).
  • CPU-only вариант существует, но он медленный. Имеет смысл только на мощных процессорах с 64–128 ГБ оперативки.

Оперативки лучше иметь с запасом: для 32B+ моделей желательно от 64 ГБ, лучше 128. Диск — быстрый NVMe, модели весят от 4 до 40+ гигабайт.

Где брать модели

Основных мест три:

  1. Hugging Face (huggingface.co) — Самое большое хранилище. Ищешь нужную модель, заходишь во вкладку Files and versions и качаешь либо safetensors, либо готовые GGUF.

  2. Репозитории квантовальщиков — TheBloke, bartowski, mradermacher и другие уже сделали кучу готовых GGUF-версий. Бери нужный размер квантования и запускай.

  3. Встроенные библиотеки в программах — Ollama, LM Studio и Open WebUI умеют сами скачивать модели по имени. Иногда это самый быстрый способ.

Полезные поисковые запросы на Hugging Face:

  • llama-3.1-8b-instruct GGUF
  • Qwen2.5-14B-Instruct GGUF
  • DeepSeek-R1-Distill GGUF

Всегда смотри на лицензию. Большинство современных открытых моделей можно использовать и в коммерческих проектах, но иногда бывают ограничения.

Как запускать

Самые удобные варианты на сегодня:

1. Ollama (самый простой способ)

Ставится в одну команду. После установки можно сразу писать:

ollama run llama3.1
ollama run qwen2.5:14b

Модели качаются автоматически. Есть API, совместимое с OpenAI, так что можно подключать к своим скриптам через ==base_url="http://localhost:11434/v1"==.

2. LM Studio

Графическая программа под Windows, macOS и Linux. Выбираешь модель, скачиваешь, запускаешь. Есть встроенный чат и локальный сервер с OpenAI-совместимым API. Удобно, если не хочешь возиться с терминалом.

3. llama.cpp + сервер

Классика. Собираешь или ставишь готовые бинарники, запускаешь сервер:

./llama-server -m model.gguf -c 8192 --port 8080

Потом можно стучаться в ==http://localhost:8080/v1== тем же OpenAI-клиентом.

4. text-generation-webui (oobabooga)

Более тяжёлый, но очень гибкий вариант. Поддерживает кучу бэкендов (llama.cpp, exllamav2, transformers), расширения, LoRA и так далее. Хорош, когда нужно много всего крутить.

5. vLLM или Aphrodite Engine

Если нужна максимальная скорость и обслуживание нескольких пользователей одновременно. Эти движки лучше работают с исходными safetensors и дают высокую пропускную способность.

Пример подключения к своему коду

После того как поднял любой из серверов выше, в Python это выглядит так же, как работа с обычным API:

from openai import OpenAI

client = OpenAI(
    base_url="http://localhost:11434/v1",  # или 8080, или 5000 — зависит от того, что запустил
    api_key="sk-local"  # можно любой, многие серверы его не проверяют
)

response = client.chat.completions.create(
    model="llama3.1",
    messages=[
        {"role": "system", "content": ""},
        {"role": "user", "content": "Привет!"}
    ],
    temperature=0.7
)

print(response.choices[0].message.content)

На что обратить внимание

  • Контекстное окно. У разных моделей оно разное (4k, 8k, 32k, 128k). Чем больше контекст — тем больше памяти нужно.
  • Скорость. На 4090 14B модель в Q4 обычно выдаёт 40–80 токенов в секунду. На 3060 будет заметно медленнее.
  • Качество квантования. Q4_K_M — хороший баланс. Q3 уже может заметно тупить, Q5–Q6 почти как оригинал.
  • Система охлаждения. Большие генерации под полной нагрузкой греют карту сильно.
Weiterlesen

Artikel aus demselben Bereich und zu denselben Themen.

Leistungen
Noch Fragen offen?

Sehen Sie sich die übrigen Artikel der Wissensdatenbank an — die angrenzenden Themen sind dort ebenfalls erklärt.