29 lines
1.2 KiB
Markdown
29 lines
1.2 KiB
Markdown
# Локальный LLM
|
||
|
||
## Железо (проверено 28.06.2026)
|
||
|
||
- **GPU:** 1× RTX 3060, 12 ГБ VRAM
|
||
- **RAM:** 15 ГБ
|
||
- **Доступ:** `ssh naeel@192.168.1.49`, ключ `Y:\MY\Nubes\id_ed25519`
|
||
- **Ollama:** не установлен
|
||
|
||
## Что влезает
|
||
|
||
| Модель | Квантизация | Память | Скорость | Для чего |
|
||
|--------|------------|--------|----------|----------|
|
||
| 7-9B | Q4/Q5 | ~6 ГБ | Быстро | classify, extract |
|
||
| 14B | Q4 | ~8-9 ГБ | 15-30 ток/с | Весь пайплайн |
|
||
| 32B | ❌ | 18-20 ГБ | — | Не влезает |
|
||
|
||
## План установки
|
||
|
||
1. `ollama pull qwen2.5:7b` (старт) или `qwen2.5:14b` (основная)
|
||
2. Ollama отдаёт OpenAI-совместимый API на `http://localhost:11434/v1`
|
||
3. В `llm_client.py`: `url="http://192.168.1.49:11434/v1/chat/completions"`, `model="qwen2.5:14b"`
|
||
4. API-ключ не нужен (ollama локально без авторизации)
|
||
|
||
## Переключение
|
||
|
||
Код уже готов через DI: `HttpxLLMClient(url=..., key=..., model=...)`.
|
||
Для переключения достаточно поменять `url` и `model`.
|