# Запрос к Соннету — нумерация вместо генерации фейков (2026-07-12) ## Контекст DrHider обфусцирует документы: ищет ПДн → заменяет на фиктивные значения. Сейчас используется генерация "похожих" фейков (Иванов И.И., ООО «Ромашка», +7(495)...). ## Проблема 1. **Адреса → абракадабра.** Ул. Стекольная → иг. 8ц Лжчюсвхшбр. Потому что fallback-генератор меняет кириллицу на случайную кириллицу. 2. **Сложность.** 11 генераторов под каждый тип данных. Каждый надо поддерживать. 3. **Ложное ощущение реальности.** Фейковые ИНН с правильной контрольной суммой выглядят как настоящие. ## Идея Заменить всю генерацию на **нумерацию по типам:** | Оригинал | Замена | |---|---| | Иванов И.И. | `Лицо_0042` | | ООО «НУБЕС» | `Компания_0003` | | ул. Стекольная, д.7 | `Адрес_0015` | | +7 (495) 789-41-35 | `Телефон_0007` | | info@nubes.ru | `Email_0004` | | ИНН 9706005293 | `ИНН_0002` | | Р/с 40702... | `Счёт_0001` | | договор-XXX001.docx | `Файл_0006` | ## Вопросы 1. **Плюсы/минусы** нумерации vs генерации фейков для задачи обфускации документов? 2. **Как нумеровать?** Глобальный счётчик на каждый тип? Или в рамках одного документа? 3. **Стоит ли сохранять формат?** Например `Телефон_0007` vs `+7 (000) 000-00-07`? 4. **mapping.csv** — при нумерации он становится главным документом аудита. Это ок? 5. **UUID вместо номеров?** `Лицо_a3f4b2` — лучше или хуже последовательных номеров? ## Текущий mapping.csv (для контекста) ```csv тип_данных,оригинал,замена phone,+7 (495) 789-41-35,+7 (495) 906-87-80 email,info@nubes.ru,ypiorej@company.local company,"ЗАО ""XXX001""",ООО «Альянс» inn_ul,ИНН 9706005293,ИНН 1846691249 text,Исполнителем Заказчику Сторонами,Кузнецов О.В. text,"115404, г. Москва, ул. 1-я Стекольная, д.7с2","084810, б. Ввжзгд, гф. 6-в Фтпжыобнзщ, я.8с1" ```