docs: реальное железо — 1× RTX 3060 12GB + план установки ollama

This commit is contained in:
2026-06-28 14:38:29 +04:00
parent ebdfe6a6b0
commit f0c8599035
+19 -30
View File
@@ -1,39 +1,28 @@
# Локальный LLM на 2× RTX 3060 (24 ГБ суммарно) # Локальный LLM
Дата: 28.06.2026 ## Железо (проверено 28.06.2026)
## Железо - **GPU:** 1× RTX 3060, 12 ГБ VRAM
- **RAM:** 15 ГБ
2× NVIDIA RTX 3060 (12 ГБ каждая), без NVLink, PCIe. - **Доступ:** `ssh naeel@192.168.1.49`, ключ `Y:\MY\Nubes\id_ed25519`
- **Ollama:** не установлен
## Что влезает ## Что влезает
| Модель | Квантизация | Память | Куда | Скорость | Приоритет | | Модель | Квантизация | Память | Скорость | Для чего |
|--------|------------|--------|------|----------|-----------| |--------|------------|--------|----------|----------|
| 7-9B | Q4/Q5 | ~6 ГБ | 1 карта | Быстро | Классификация, извлечение | | 7-9B | Q4/Q5 | ~6 ГБ | Быстро | classify, extract |
| 14B | Q4 | ~8-9 ГБ | **1 карта** | 15-30 ток/с | Основная рабочая | | 14B | Q4 | ~8-9 ГБ | 15-30 ток/с | Весь пайплайн |
| 32B | Q4 | ~18-20 ГБ | Сплит на 2 карты | Медленно | Максимальное качество | | 32B | | 18-20 ГБ | — | Не влезает |
## Важно про две карты ## План установки
- Сплит модели на 2 карты через PCIe (без NVLink) — часто **медленнее** чем та же модель на одной. 1. `ollama pull qwen2.5:7b` (старт) или `qwen2.5:14b` (основная)
- **Лучший расклад:** 14B на одной карте, вторая — на параллелизм (два документа одновременно) или под отдельную модель (мелкая на classify, 14B на diff). 2. Ollama отдаёт OpenAI-совместимый API на `http://localhost:11434/v1`
3. В `llm_client.py`: `url="http://192.168.1.49:11434/v1/chat/completions"`, `model="qwen2.5:14b"`
4. API-ключ не нужен (ollama локально без авторизации)
## Движок ## Переключение
- **llama.cpp (GGUF)** или **ExLlamaV2** — оптимальны для consumer-карт без NVLink. Код уже готов через DI: `HttpxLLMClient(url=..., key=..., model=...)`.
- vLLM/TGI — выше throughput, но больше VRAM-запас, на 12 ГБ тесно. Для переключения достаточно поменять `url` и `model`.
## Засады
- `max_tokens=8000` — большая спецификация = длинный ответ = сотни секунд. Чанковать.
- Конкурентность: 1-2 запроса параллельно. Не для многопользовательской нагрузки.
- Точность чисел: подстраховать арифметикой + UNRESOLVED.
## Рекомендация
**Qwen2.5-14B или Qwen3-14B в Q4/Q5 на одной 3060** — уверенно тянет весь пайплайн для несложных документов. Проверить на testgen/.
## Сейчас
api.aillm.ru (gpt-oss-120b, бесплатно). Код готов к смене LLM через `llm_client.py` DI.