8 октября пресс-служба Яндекса сообщила «Интерфаксу» об инциденте в дата-центре компании в Сасово Рязанской области: он затронул часть инфраструктуры. В ту же ночь на статусной странице Yandex Cloud появился инцидент «Нарушение электропитания» в зоне доступности ru-central1-b. На утро 8 октября он всё ещё открыт, зона недоступна.
Если у вас что-то крутится в Yandex Cloud только в одной зоне, это как раз тот случай, когда стоит проверить, в какой именно, и есть ли куда переехать.
Что говорит Яндекс про Сасово
По словам пресс-службы, ситуация на площадке под контролем, пострадавших нет, команда устраняет последствия и восстанавливает затронутые сервисы. «Интерфаксу» в компании также сказали, что профильные службы работают на месте, а работа дата-центра полностью остановлена. Основные сервисы Яндекса, по словам компании, работают в штатном режиме, хотя часть из них может быть недоступна для пользователей.

РИА Новости со ссылкой на пресс-службу пишет, что в дата-центре произошёл пожар. Дата-центр в Сасово, по данным «Интерфакса», работает с 2014 года и занимает часть бывших помещений завода «Саста», а с Москвой его связывают несколько оптических линий.

Yandex Cloud: зона ru-central1-b недоступна с 1:31
Инцидент 2092 на статусной странице называется «Нарушение электропитания в зоне доступности ru-central-b», в карточке указана зона ru-central1-b в регионе Россия. Уровень: Unavailable, то есть недоступность.

Хронология по статусной странице, всё по Москве, 8 октября:
- 1:31. В ru-central1-b перебои с электропитанием. Yandex Cloud советует по возможности перенести нагрузку в другие зоны.
- 2:19. Проблему в зоне локализовали, но ситуация пока не стабилизировалась, причины выясняют.
- 4:16. Работы продолжаются, сроки восстановления пока уточняют.
- 4:55. Из-за инцидента в других зонах могут быть проблемы с созданием новых виртуальных машин, кластеров Kubernetes и баз данных.
- 8:26. Зона по-прежнему недоступна. Переключение нагрузки на другие зоны закончили, сервисы в остальных зонах работают штатно. Создание новых ресурсов может быть ограничено, следующий апдейт обещают до 15:00.

В карточке инцидента 85 сервисов. Там почти всё облако: Compute Cloud, Virtual Private Cloud, Object Storage, Managed Service for Kubernetes, управляемые PostgreSQL, MySQL, ClickHouse, Valkey и Kafka, YDB, Cloud Functions, балансировщики, Cloud DNS, Monitoring, а также консоль и биллинг.

Если вы в Yandex Cloud: несколько зон и статусная страница
В регионе ru-central1 сейчас четыре зоны: ru-central1-a, ru-central1-b, ru-central1-d и ru-central1-e, плюс отдельная ru-central1-m для BareMetal. Это есть на странице о зонах доступности. Каждая зона изолирована от сбоев в остальных, поэтому всё, что должно пережить отказ зоны, надо разворачивать сразу в нескольких.
В рекомендациях по отказоустойчивости Yandex Cloud советует ставить продуктивные окружения в три зоны: так работают кворумные алгоритмы в управляемых базах и Managed Service for Kubernetes. Перед сервисами ставят балансировщики, которые сами уводят трафик с упавших ресурсов. Есть два варианта: холодный резерв, когда в другой зоне держат минимум ресурсов вроде реплик БД, и распределение нагрузки между зонами.

Хорошо видно по апдейту в 4:55, почему резерв лучше держать заранее: во время аварии создавать новые виртуалки, кластеры и базы в других зонах может быть сложно. Проверить, в каких зонах у вас стоят ВМ, можно так:
yc compute instance list --format json | jq -r '.[] | [.name, .zone_id, .status] | @tsv'
Следить за инцидентами удобнее всего на status.yandex.cloud: там видно зону, список сервисов и все апдейты по времени.
В итоге на утро 8 октября дата-центр Яндекса в Сасово остановлен, а в Yandex Cloud с 1:31 по Москве недоступна зона ru-central1-b. Нагрузку перевели в другие зоны, создание новых ресурсов может быть ограничено, следующий апдейт обещан до 15:00. Основные сервисы Яндекса, по словам компании, работают.
