Files

1.2 KiB
Raw Permalink Blame History

Локальный LLM

Железо (проверено 28.06.2026)

  • GPU: 1× RTX 3060, 12 ГБ VRAM
  • RAM: 15 ГБ
  • Доступ: ssh naeel@192.168.1.49, ключ Y:\MY\Nubes\id_ed25519
  • Ollama: не установлен

Что влезает

Модель Квантизация Память Скорость Для чего
7-9B Q4/Q5 ~6 ГБ Быстро classify, extract
14B Q4 ~8-9 ГБ 15-30 ток/с Весь пайплайн
32B 18-20 ГБ Не влезает

План установки

  1. ollama pull qwen2.5:7b (старт) или qwen2.5:14b (основная)
  2. Ollama отдаёт OpenAI-совместимый API на http://localhost:11434/v1
  3. В llm_client.py: url="http://192.168.1.49:11434/v1/chat/completions", model="qwen2.5:14b"
  4. API-ключ не нужен (ollama локально без авторизации)

Переключение

Код уже готов через DI: HttpxLLMClient(url=..., key=..., model=...). Для переключения достаточно поменять url и model.