Що таке RPO та RTO у плануванні резервного копіювання і як їх розрахувати?
Поняття RPO та RTO є ключовими метриками під час розробки стратегії аварійного відновлення та планування резервного копіювання в будь-якій сучасній IT-інфраструктурі. Без чіткого розуміння цих показників неможливо підібрати правильну частоту створення бекапів та архітектуру зберігання даних.
Метрика RPO розшифровується як цільова точка відновлення. Вона визначає максимальний допустимий обсяг даних, який організація може дозволити собі втратити в результаті збою, що вимірюється в часовому еквіваленті. Наприклад, якщо RPO становить чотири години, це означає, що система повинна зберігати дані так, щоб у разі аварії втратити не більш ніж останні чотири години роботи.
Метрика RTO позначає цільовий час відновлення і показує, скільки часу може знадобитися на те, щоб повністю повернути систему в робочий стан після виникнення збою. Сюди входить час на виявлення проблеми, вибір потрібної версії резервної копії, її завантаження, розпакування та безпосереднє розгортання на «залізі» або у хмарі.
Для розрахунку цих показників необхідно провести аудит бізнес-процесів та оцінити фінансові втрати від простою кожного конкретного сервісу. Критично важливі фінансові системи зазвичай вимагають RPO та RTO, що прагнуть до нуля або кількох хвилин, чого досягають за допомогою дзеркалювання та кластеризації. Для менш важливих внутрішніх архівів ці показники можуть становити добу і більше.
Щоб забезпечити задані значення RPO та RTO на практиці, адміністратори налаштовують комбіновані схеми створення копій. Наприклад, для дотримання жорсткого RPO використовують безперервну реплікацію транзакцій, а для дотримання RTO тримають у готовності готові до запуску образи віртуальних машин. Регулярне тестування відновлення допомагає переконатися, що реальні показники відповідають запланованим бізнес-вимогам.