Что такое RPO и RTO в планировании резервного копирования и как их рассчитать?
Понятия RPO и RTO являются ключевыми метриками при разработке стратегии аварийного восстановления и планировании резервного копирования в любой современной IT-инфраструктуре. Без четкого понимания этих показателей невозможно подобрать правильную частоту создания бэкапов и архитектуру хранения данных.
Метрика RPO расшифровывается как целевая точка восстановления. Она определяет максимальный допустимый объем данных, который организация может позволить себе потерять в результате сбоя, измеряемый во временном эквиваленте. Например, если RPO составляет четыре часа, это означает, что система должна сохранять данные так, чтобы в случае аварии потерять не более чем последние четыре часа работы.
Метрика RTO обозначает целевое время восстановления и показывает, сколько времени может потребоваться на то, чтобы полностью вернуть систему в рабочее состояние после возникновения сбоя. Сюда входит время на обнаружение проблемы, выбор нужной версии резервной копии, ее скачивание, распаковку и непосредственное развертывание на «железе» или в облаке.
Для расчета этих показателей необходимо провести аудит бизнес-процессов и оценить финансовые потери от простоя каждого конкретного сервиса. Критически важные финансовые системы обычно требуют RPO и RTO, стремящихся к нулю или нескольким минутам, что достигается с помощью зеркалирования и кластеризации. Для менее важных внутренних архивов эти показатели могут составлять сутки и более.
Чтобы обеспечить заданные значения RPO и RTO на практике, администраторы настраивают комбинированные схемы создания копий. Например, для соблюдения жесткого RPO используют непрерывную репликацию транзакций, а для соблюдения RTO держат в готовности готовые к запуску образы виртуальных машин. Регулярное тестирование восстановления помогает убедиться, что реальные показатели соответствуют запланированным бизнес-требованиям.