Files
contracts-flask/History/local-llm-setup.md
T

2.1 KiB
Raw Blame History

Локальный LLM на 2× RTX 3060 (24 ГБ суммарно)

Дата: 28.06.2026

Железо

2× NVIDIA RTX 3060 (12 ГБ каждая), без NVLink, PCIe.

Что влезает

Модель Квантизация Память Куда Скорость Приоритет
7-9B Q4/Q5 ~6 ГБ 1 карта Быстро Классификация, извлечение
14B Q4 ~8-9 ГБ 1 карта 15-30 ток/с Основная рабочая
32B Q4 ~18-20 ГБ Сплит на 2 карты Медленно Максимальное качество

Важно про две карты

  • Сплит модели на 2 карты через PCIe (без NVLink) — часто медленнее чем та же модель на одной.
  • Лучший расклад: 14B на одной карте, вторая — на параллелизм (два документа одновременно) или под отдельную модель (мелкая на classify, 14B на diff).

Движок

  • llama.cpp (GGUF) или ExLlamaV2 — оптимальны для consumer-карт без NVLink.
  • vLLM/TGI — выше throughput, но больше VRAM-запас, на 12 ГБ тесно.

Засады

  • max_tokens=8000 — большая спецификация = длинный ответ = сотни секунд. Чанковать.
  • Конкурентность: 1-2 запроса параллельно. Не для многопользовательской нагрузки.
  • Точность чисел: подстраховать арифметикой + UNRESOLVED.

Рекомендация

Qwen2.5-14B или Qwen3-14B в Q4/Q5 на одной 3060 — уверенно тянет весь пайплайн для несложных документов. Проверить на testgen/.

Сейчас

api.aillm.ru (gpt-oss-120b, бесплатно). Код готов к смене LLM через llm_client.py DI.