Files
drhider/History/2026-07-12-sonnet-query-v3-numbering.md
T

2.7 KiB
Raw Blame History

Запрос к Соннету — нумерация вместо генерации фейков (2026-07-12)

Контекст

DrHider обфусцирует документы: ищет ПДн → заменяет на фиктивные значения. Сейчас используется генерация "похожих" фейков (Иванов И.И., ООО «Ромашка», +7(495)...).

Проблема

  1. Адреса → абракадабра. Ул. Стекольная → иг. 8ц Лжчюсвхшбр. Потому что fallback-генератор меняет кириллицу на случайную кириллицу.
  2. Сложность. 11 генераторов под каждый тип данных. Каждый надо поддерживать.
  3. Ложное ощущение реальности. Фейковые ИНН с правильной контрольной суммой выглядят как настоящие.

Идея

Заменить всю генерацию на нумерацию по типам:

Оригинал Замена
Иванов И.И. Лицо_0042
ООО «НУБЕС» Компания_0003
ул. Стекольная, д.7 Адрес_0015
+7 (495) 789-41-35 Телефон_0007
info@nubes.ru Email_0004
ИНН 9706005293 ИНН_0002
Р/с 40702... Счёт_0001
договор-XXX001.docx Файл_0006

Вопросы

  1. Плюсы/минусы нумерации vs генерации фейков для задачи обфускации документов?
  2. Как нумеровать? Глобальный счётчик на каждый тип? Или в рамках одного документа?
  3. Стоит ли сохранять формат? Например Телефон_0007 vs +7 (000) 000-00-07?
  4. mapping.csv — при нумерации он становится главным документом аудита. Это ок?
  5. UUID вместо номеров? Лицо_a3f4b2 — лучше или хуже последовательных номеров?

Текущий mapping.csv (для контекста)

тип_данных,оригинал,замена
phone,+7 (495) 789-41-35,+7 (495) 906-87-80
email,info@nubes.ru,ypiorej@company.local
company,"ЗАО ""XXX001""",ООО «Альянс»
inn_ul,ИНН 9706005293,ИНН 1846691249
text,Исполнителем Заказчику Сторонами,Кузнецов О.В.
text,"115404, г. Москва, ул. 1-я Стекольная, д.7с2","084810, б. Ввжзгд, гф. 6-в Фтпжыобнзщ, я.8с1"