Инцидент в дата-центре Яндекса в Сасово и недоступность зоны ru-central1-b в Yandex Cloud

8 октября пресс-служба Яндекса сообщила «Интерфаксу» об инциденте в дата-центре компании в Сасово Рязанской области: он затронул часть инфраструктуры. В ту же ночь на статусной странице Yandex Cloud появился инцидент «Нарушение электропитания» в зоне доступности ru-central1-b. На утро 8 октября он всё ещё открыт, зона недоступна.

Если у вас что-то крутится в Yandex Cloud только в одной зоне, это как раз тот случай, когда стоит проверить, в какой именно, и есть ли куда переехать.

Что говорит Яндекс про Сасово

По словам пресс-службы, ситуация на площадке под контролем, пострадавших нет, команда устраняет последствия и восстанавливает затронутые сервисы. «Интерфаксу» в компании также сказали, что профильные службы работают на месте, а работа дата-центра полностью остановлена. Основные сервисы Яндекса, по словам компании, работают в штатном режиме, хотя часть из них может быть недоступна для пользователей.

РИА Новости со ссылкой на пресс-службу пишет, что в дата-центре произошёл пожар. Дата-центр в Сасово, по данным «Интерфакса», работает с 2014 года и занимает часть бывших помещений завода «Саста», а с Москвой его связывают несколько оптических линий.

Yandex Cloud: зона ru-central1-b недоступна с 1:31

Инцидент 2092 на статусной странице называется «Нарушение электропитания в зоне доступности ru-central-b», в карточке указана зона ru-central1-b в регионе Россия. Уровень: Unavailable, то есть недоступность.

Хронология по статусной странице, всё по Москве, 8 октября:

  • 1:31. В ru-central1-b перебои с электропитанием. Yandex Cloud советует по возможности перенести нагрузку в другие зоны.
  • 2:19. Проблему в зоне локализовали, но ситуация пока не стабилизировалась, причины выясняют.
  • 4:16. Работы продолжаются, сроки восстановления пока уточняют.
  • 4:55. Из-за инцидента в других зонах могут быть проблемы с созданием новых виртуальных машин, кластеров Kubernetes и баз данных.
  • 8:26. Зона по-прежнему недоступна. Переключение нагрузки на другие зоны закончили, сервисы в остальных зонах работают штатно. Создание новых ресурсов может быть ограничено, следующий апдейт обещают до 15:00.

В карточке инцидента 85 сервисов. Там почти всё облако: Compute Cloud, Virtual Private Cloud, Object Storage, Managed Service for Kubernetes, управляемые PostgreSQL, MySQL, ClickHouse, Valkey и Kafka, YDB, Cloud Functions, балансировщики, Cloud DNS, Monitoring, а также консоль и биллинг.

Если вы в Yandex Cloud: несколько зон и статусная страница

В регионе ru-central1 сейчас четыре зоны: ru-central1-a, ru-central1-b, ru-central1-d и ru-central1-e, плюс отдельная ru-central1-m для BareMetal. Это есть на странице о зонах доступности. Каждая зона изолирована от сбоев в остальных, поэтому всё, что должно пережить отказ зоны, надо разворачивать сразу в нескольких.

В рекомендациях по отказоустойчивости Yandex Cloud советует ставить продуктивные окружения в три зоны: так работают кворумные алгоритмы в управляемых базах и Managed Service for Kubernetes. Перед сервисами ставят балансировщики, которые сами уводят трафик с упавших ресурсов. Есть два варианта: холодный резерв, когда в другой зоне держат минимум ресурсов вроде реплик БД, и распределение нагрузки между зонами.

Хорошо видно по апдейту в 4:55, почему резерв лучше держать заранее: во время аварии создавать новые виртуалки, кластеры и базы в других зонах может быть сложно. Проверить, в каких зонах у вас стоят ВМ, можно так:

yc compute instance list --format json | jq -r '.[] | [.name, .zone_id, .status] | @tsv'

Следить за инцидентами удобнее всего на status.yandex.cloud: там видно зону, список сервисов и все апдейты по времени.

В итоге на утро 8 октября дата-центр Яндекса в Сасово остановлен, а в Yandex Cloud с 1:31 по Москве недоступна зона ru-central1-b. Нагрузку перевели в другие зоны, создание новых ресурсов может быть ограничено, следующий апдейт обещан до 15:00. Основные сервисы Яндекса, по словам компании, работают.

Источники и ссылки


Комментарии загружаются…