1.2 KiB
1.2 KiB
Локальный LLM
Железо (проверено 28.06.2026)
- GPU: 1× RTX 3060, 12 ГБ VRAM
- RAM: 15 ГБ
- Доступ:
ssh naeel@192.168.1.49, ключY:\MY\Nubes\id_ed25519 - Ollama: не установлен
Что влезает
| Модель | Квантизация | Память | Скорость | Для чего |
|---|---|---|---|---|
| 7-9B | Q4/Q5 | ~6 ГБ | Быстро | classify, extract |
| 14B | Q4 | ~8-9 ГБ | 15-30 ток/с | Весь пайплайн |
| 32B | ❌ | 18-20 ГБ | — | Не влезает |
План установки
ollama pull qwen2.5:7b(старт) илиqwen2.5:14b(основная)- Ollama отдаёт OpenAI-совместимый API на
http://localhost:11434/v1 - В
llm_client.py:url="http://192.168.1.49:11434/v1/chat/completions",model="qwen2.5:14b" - API-ключ не нужен (ollama локально без авторизации)
Переключение
Код уже готов через DI: HttpxLLMClient(url=..., key=..., model=...).
Для переключения достаточно поменять url и model.