Files
drhider/History/sonnet/2026-08-20-sonnet-query-llm-pattern.md
T

31 lines
2.9 KiB
Markdown

# Промпт для Sonnet — вопрос по использованию LLM (без ссылок на файлы)
## Контекст
У нас сервис обфускации документов (удаление персональных данных из русских деловых документов).
Двухступенчатый детект ПДн:
1. Regex-паттерны (телефоны, ИНН, email, типовые формы — быстро, локально, дёшево).
2. LLM (общая NER-подстраховка) — сейчас обрабатывает только урезанный фрагмент:
- от каждого файла берутся первые ~3000 символов,
- всё вместе обрезается до ~8000 символов,
- выполняется ОДИН вызов LLM на весь набор.
Пользователь хочет, чтобы LLM обрабатывал ВСЕ данные (ВСЕ файлы целиком), не только первые 8000 символов.
LLM — своя, стоимость не важна. Важно качество распознавания ПДн и разумная архитектура вызова.
## Вопрос
Как лучше организовать вызов LLM, чтобы он БЕЗ потерь покрывал все документы (набор из сотен файлов, каждый до нескольких десятков страниц), сохраняя качество распознавания русских деловых документов?
Ограничения/требования к ответу:
- Не предлагай менять модель/external API — LLM своя, она остаётся.
- Подумай про: пакетирование файлов (размер батча), максимальную длину контекста на запрос,
как избежать обрезки данных, как не потерять качество при больших объёмах,
параллельность запросов (если релевантна), дедупликацию найденного между пакетами.
- Дай конкретную рекомендуемую схему (числа: размер батча, лимит символов на файл/пакет, параллельность).
- Оцени риски: токены/время, качество, риск пропуска.
- Сухо, по делу, без воды.
## Формат
- Секция «Рекомендуемая схема» — конкретный план с числами.
- Секция «Риски» — что может пойти не так и как смягчить.
- Секция «Минимум для старта» — если хочется просто и быстро, что достаточно сделать первым шагом.