Files
contracts/History/my-analysis.md
T

3.8 KiB

Мой анализ ответов Opus (раунды 1 и 2)

Дата: 2026-06-23


Раунд 1: Архитектурные вопросы

Что взяли в работу (v1.0.108)

  • Advisory lock для seq
  • NFKC-нормализация name_hash
  • ID-суррогаты r1..rN в промпте вместо хэшей
  • Обогащение ops именами из spec_current

Что отложили

  • Параллельные вызовы LLM — семантически нельзя (допники кумулятивны)
  • Таблица-счётчик для seq — advisory lock проще
  • Эмбеддинги — NFKC достаточно
  • Мульти-юзеры — преждевременно

Раунд 2: Видение и неизведанное

Что можно сделать прямо сейчас (v1.0.109)

# Что Почему
1 source_document_id FK в spec_events Костяк provenance. Связь интерпретации с исходным документом
2 source_quote в каждой op от LLM Точная цитата из документа. Юрист видит источник
3 confidence 0.0-1.0 в каждой op Self-reported моделью. Ниже 0.7 → перепроверить
4 prompt_version в spec_events Какая версия промпта дала этот результат
5 raw_llm_response JSONB Полный ответ модели для аудита

Что отложить на потом

# Что Когда
1 Temporal UI (ползунок по датам) После provenance, когда продукт показываем
2 Human-correction как событие После базового UI
3 Confidence-gating (N прогонов → консенсус) Когда точность станет критичной
4 Prompt CI (тесты для промптов) Когда будет >1 версии промпта
5 Двухслойный лог (факты vs интерпретация) v2.0
6 Эмбеддинги (pgvector) Только при доказанных промахах NFKC

Архитектурные принципы (выработанные)

  1. Сначала данные, потом UI. source_document_id + source_quote дают основу. Красивый UI — потом.
  2. Минимальными средствами. Одна FK-колонка вместо двухслойного лога. Self-confidence вместо сложного consensus.
  3. Домен решает. Облачный провайдер + ЦОД — названия услуг копируются дословно. NFKC достаточно.
  4. Бесплатная LLM меняет экономику. Можно делать N прогонов, не считая токены. Но лучше умно (только low-confidence).

Открытые вопросы к Opus (будущие раунды)

  1. Prompt engineering для source_quote: как попросить LLM вернуть точную цитату? Нужен пример промпта.
  2. Confidence calibration: насколько self-reported confidence от gpt-oss-120b коррелирует с реальной точностью? Стоит ли калибровать?
  3. Temporal UI реализация: как технически строить «спецификацию на дату» из spec_events? Реплей с фильтром по seq?
  4. Масштабирование LLM: когда 120B станет узким горлышком, какие варианты? Fine-tune? Distill? Переход на большую модель?