RTO

Что такое RTO (Recovery Time Objective)
RTO (Recovery Time Objective) — это показатель времени восстановления системы после аварии. RTO показывает предел допустимого простоя, сколько времени инфраструктура может оставаться недоступной, прежде чем это начнет серьезно влиять на бизнес-процессы. Показатель используется при планировании аварийного восстановления и определяет требования к архитектуре инфраструктуры, резервному копированию и отказоустойчивости.
Если для интернет-магазина установлен RTO в 15 минут, это означает, что после сбоя сервис должен вернуться к работе не позднее этого времени.
Отличия RTO от RPO
- RTO определяет время, необходимое для восстановления работы системы.
- RPO показывает допустимый объем потерянных данных, измеряемый во времени.
Например, если RPO составляет 10 минут, система должна иметь копию данных не старше этого времени. Если RTO установлен на уровне 30 минут, инфраструктура должна вернуть сервис в рабочее состояние в течение получаса после сбоя.
Вместе эти показатели определяют требования к резервному копированию, репликации данных и архитектуре аварийного восстановления.
Как рассчитать RTO для бизнес-процессов
Значение RTO определяется исходя из того, насколько критична остановка конкретного сервиса для бизнеса.
Обычно расчет включает несколько этапов:
- анализ бизнес-процессов и зависимых систем;
- оценку финансовых и операционных потерь при простое;
- определение допустимого времени остановки сервисов;
- выбор технологий восстановления.
Например, если остановка системы заказов приводит к потере клиентов уже через несколько минут, RTO для этой системы будет минимальным. Для внутренних сервисов, которые используются реже, допустимый простой может быть значительно больше.
Факторы, влияющие на RTO
На фактическое время восстановления системы влияет архитектура инфраструктуры и используемые механизмы защиты данных.
Основные факторы:
- наличие резервных копий и скорость их восстановления;
- использование репликации данных между узлами;
- автоматизация переключения сервисов;
- производительность инфраструктуры и сетевых каналов.
Например, если данные реплицируются между несколькими узлами кластера, сервис можно запустить на другом сервере практически сразу после отказа. Если же восстановление происходит из резервной копии, системе потребуется время на перенос и запуск данных.