3.8 KiB
3.8 KiB
Мой анализ ответов Opus (раунды 1 и 2)
Дата: 2026-06-23
Раунд 1: Архитектурные вопросы
Что взяли в работу (v1.0.108)
- Advisory lock для seq ✅
- NFKC-нормализация name_hash ✅
- ID-суррогаты r1..rN в промпте вместо хэшей ✅
- Обогащение ops именами из spec_current ✅
Что отложили
- Параллельные вызовы LLM — семантически нельзя (допники кумулятивны)
- Таблица-счётчик для seq — advisory lock проще
- Эмбеддинги — NFKC достаточно
- Мульти-юзеры — преждевременно
Раунд 2: Видение и неизведанное
Что можно сделать прямо сейчас (v1.0.109)
| # | Что | Почему |
|---|---|---|
| 1 | source_document_id FK в spec_events |
Костяк provenance. Связь интерпретации с исходным документом |
| 2 | source_quote в каждой op от LLM |
Точная цитата из документа. Юрист видит источник |
| 3 | confidence 0.0-1.0 в каждой op |
Self-reported моделью. Ниже 0.7 → перепроверить |
| 4 | prompt_version в spec_events |
Какая версия промпта дала этот результат |
| 5 | raw_llm_response JSONB |
Полный ответ модели для аудита |
Что отложить на потом
| # | Что | Когда |
|---|---|---|
| 1 | Temporal UI (ползунок по датам) | После provenance, когда продукт показываем |
| 2 | Human-correction как событие | После базового UI |
| 3 | Confidence-gating (N прогонов → консенсус) | Когда точность станет критичной |
| 4 | Prompt CI (тесты для промптов) | Когда будет >1 версии промпта |
| 5 | Двухслойный лог (факты vs интерпретация) | v2.0 |
| 6 | Эмбеддинги (pgvector) | Только при доказанных промахах NFKC |
Архитектурные принципы (выработанные)
- Сначала данные, потом UI. source_document_id + source_quote дают основу. Красивый UI — потом.
- Минимальными средствами. Одна FK-колонка вместо двухслойного лога. Self-confidence вместо сложного consensus.
- Домен решает. Облачный провайдер + ЦОД — названия услуг копируются дословно. NFKC достаточно.
- Бесплатная LLM меняет экономику. Можно делать N прогонов, не считая токены. Но лучше умно (только low-confidence).
Открытые вопросы к Opus (будущие раунды)
- Prompt engineering для source_quote: как попросить LLM вернуть точную цитату? Нужен пример промпта.
- Confidence calibration: насколько self-reported confidence от gpt-oss-120b коррелирует с реальной точностью? Стоит ли калибровать?
- Temporal UI реализация: как технически строить «спецификацию на дату» из spec_events? Реплей с фильтром по seq?
- Масштабирование LLM: когда 120B станет узким горлышком, какие варианты? Fine-tune? Distill? Переход на большую модель?