Files
tf_provider/HISTORY/2026-09-30_shturval_dev1_delete_npe.md
T
Repinoid 058d0a6991 docs(history): ошибка операции Edge — сбой DNS платформы при init OpenTofu backend
jlib.tofu не смог зарезолвить provider vmware/vcd через terraform-mirror.yandexcloud.net:
'internal DNS 169.254.25.10:53: server misbehaving' -> 'Edge не удалось найти в Cloud Director'
(операция не выполнилась). Проверено извне: зеркало доступно (DNS резолвится, index.json HTTP 200,
0.88s) => проблема во внутреннем DNS/сети платформы, не в зеркале.
2026-09-30 22:12:46 +03:00

6.4 KiB
Raw Blame History

Штурвал shturval-dev1: повторное удаление через API не проходит (2026-09-30)

Контекст. Владелец не может удалить Edge (сервис 22) в тенанте: платформа отвечает Невозможно удалить Edge. В тенанте 'WZ03709-saas' существуют инстансы CAPvcd (Kubernetes). Инстансы с именами: '[shturval-dev-01]'. При этом кластер Штурвал из ЛК уже удалён.

Что установлено (API dev, только чтение + одна операция)

Факт Значение
Инстанс Штурвала в dev shturval-dev1, svc 150 (k8s_sthutrval_cluster), uid 05ae1dbc-7ef9-458a-bfd9-d5d3196014e0
Статус в ЛК deleted, isDeleted=true (удалён 25.09.2026, 09:46:53)
Активные операции нет; availableOperations — пуст
Организации dev (svc 19) только kontra (running) — тенанта WZ03709-saas в dev нет
Удалённые инстансы dev (4) fullpipe-vapp (26), A-record (web01.…) ×2 (111), shturval-dev1 (150)

Попытка доудаления через API (по указанию владельца)

Операция сервиса 150 delete — svcOperationId=109, без параметров (generated/dev/resources_yaml/150_k8s_sthutrval_cluster.yaml).

POST /instanceOperations  {"instanceUid":"05ae1dbc-…","svcOperationId":109,"operation":"delete"} → 201
POST /instanceOperations/A577373C-590A-40BE-B435-08597E4D437F/run → 201
GET  …?fields=dtFinish → dtFinish=2026-09-30T22:01:39.645+0300, isSuccessful=false,
     errorLog="Cannot invoke \"String.length()\" because \"text\" is null"

Результат: провал. Повторная операция delete завершается ошибкой бэкенда (NPE); остатки CAPvcd в vCD не вычищаются, Edge остаётся неудаляемым.

Вывод

Со стороны клиента (провайдер/API ЛК) обходного пути нет: удаление из ЛК ставит только статус, физическую чистку объектов CAPvcd в vCD платформа не делает — это подтверждает MAN сервиса vc_org: «Если существуют инстансы … Kubernetes-кластер Штурвал, которые были созданы, из ЛК удалены не будут. Необходимо обратиться в техническую поддержку».

Для поддержки: тенант (в ошибке — WZ03709-saas), инстанс shturval-dev1 (uid 05ae1dbc-7ef9-458a-bfd9-d5d3196014e0, svc 150), ошибка удаления Edge + NPE операции delete.


Сопутствующая ошибка: ALB не отключается из-за LB Pools (2026-09-30, 22:06)

При попытке модификации Edge (nsx_WZ03709-saas-tbxiw8kt) платформа отказывает:

error disabling NSX-T ALB: error in HTTP PUT request: FORBIDDEN -
[7-2026-09-30-22-06-22-767--332df779-…] Cannot disable load balancer for Edge Gateway
nsx_WZ03709-saas-tbxiw8kt since there are Pools.

Связь с предыдущим пунктом: пулы ALB (NSX-T Load Balancer Pools) остались на Edge от не удалённых объектов CAPvcd / кластера Штурвал. Пока пулы существуют:

  • ALB отключить нельзя (FORBIDDEN … since there are Pools),
  • Edge удалить нельзя (см. блокировку выше).

Со стороны клиента очистить Pools/инстансы нельзя (нет API у провайдера; операция delete инстанса падает с NPE). Требуется вмешательство платформы: удалить CAPvcd-объекты и LB Pools на Edge, после чего Edge удаляется штатно.

Расширенная заявка для поддержки:

  1. тенант WZ03709-saas;
  2. удалить инстансы CAPvcd кластера shturval-dev-01 / shturval-dev1 (uid 05ae1dbc-7ef9-458a-bfd9-d5d3196014e0, svc 150) — операция delete через API падает с Cannot invoke "String.length()" because "text" is null;
  3. удалить оставшиеся NSX-T LB Pools на Edge nsx_WZ03709-saas-tbxiw8kt;
  4. после п.2–3 — отключение ALB и удаление Edge.

Ещё одна ошибка операции: Edge «не найден», OTOFU backend не инициализируется (2026-09-30, ~22:1x)

EDGE 'nsx_WZ03709-saas-tbxiw8kt' не удалось найти в Cloud Director
jlib.tofu [authBackend] | ERROR | Ошибка при инициализации backend: Command failed with exit code 1
Error: Failed to resolve provider packages
  Could not resolve provider vmware/vcd: failed to query provider mirror
  https://terraform-mirror.yandexcloud.net/ for registry.opentofu.org/vmware/vcd:
  dial tcp: lookup terraform-mirror.yandexcloud.net on 169.254.25.10:53: server misbehaving

Разбор. Это сбой внутренней автоматизации платформы (jlib.tofu — её OpenTofu-обвязка): резолв провайдера vmware/vcd через зеркало не удался, потому что внутренний DNS кластера (169.254.25.10:53 — NodeLocal DNS) вернул server misbehaving. Сообщение «Edge не найден в Cloud Director» — следствие: операция не выполнилась.

Проверено извне (2026-09-30, локально): зеркало доступно — getent hosts terraform-mirror.yandexcloud.net резолвится, GET …/registry.opentofu.org/vmware/vcd/index.json → HTTP 200 за 0.88 с. Значит проблема не во внешнем зеркале, а в DNS/сети инфраструктуры платформы.

Действие: повторить операцию позже; при повторе — в поддержку, указав DNS-ошибку (lookup … on 169.254.25.10:53: server misbehaving) и хост зеркала.