INTEGRITY Документация

Как Cloudflare рассчитывает оповещения о работоспособности туннеля

Оповещения о работоспособности туннеля уведомляют вас, когда надёжность ваших туннельных подключений падает ниже допустимого порогового значения. Понимание того, как Cloudflare рассчитывает эти оповещения, помогает интерпретировать уведомления и отличать кратковременные устранимые проблемы от длительных, требующих внимания.

Cloudflare использует подход с несколькими временными окнами (multi-window), сочетающий краткосрочные и долгосрочные метрики, чтобы не оповещать о временных сбоях и при этом выявлять реальную деградацию. В следующих разделах объясняются ключевые понятия этого процесса.

Индикатор уровня обслуживания (SLI)

SLI представляет собой отношение положительных событий к общему числу событий. Значение SLI 0% означает, что функция не работает вообще, а значение SLI 100% означает, что функция работает полностью так, как ожидается.

Целевые показатели уровня обслуживания (SLO)

Показатели SLO задают пороговое значение для SLI и определяют целевой уровень надежности туннелей IPsec/GRE. Например, SLO может составлять 99.9% исправных состояний туннеля за последние 30 дней. Cloudflare рассчитывает значения SLI для SLO на основе down значение состояния туннеля, а не на результатах истечения времени ожидания при проверках работоспособности туннеля.

Бюджет ошибок

Бюджет ошибок определяет количество неуспешных событий, которые могут произойти в течение периода SLO, при этом уровень доступности службы остаётся в пределах, заданных SLO.

SLO представляет собой целевой процент, а error budget равен 100% минус SLO. Например, предположим, что за 30 дней в вашем аккаунте был выполнен миллион проверок работоспособности туннеля, а ваш SLO установлен на уровне 99.9%. В этом случае error budget составит:

number of events x (1 - SLO) = 1,000,000 x (1-0.999) = 1,000

Это означает, что SLO допускает 1,000 неуспешных проверок работоспособности туннеля за 30 дней. Но что если все ошибки произойдут за один час, а не за 30 дней? Именно отсюда возникает понятие скорости расходования бюджета ошибок.

Burn rate

Скорость расходования бюджета ошибок отражает, как быстро вы расходуете бюджет ошибок в течение заданного временного окна относительно окна SLO. В этом примере SLO на уровне 99.9% означает, что вы можете допустить 1,000 сбоев проверки работоспособности туннеля за 30 дней. Однако те же 1,000 сбоев проверки работоспособности недопустимы в течение одного часа.

Когда Cloudflare оповещает вас

Чтобы определить, когда отправлять оповещения о работоспособности туннеля, Cloudflare использует подход с несколькими окнами и несколькими скоростями расходования бюджета ошибок. Каждые пять минут Cloudflare анализирует данные за последний час и за последние пять минут. Для короткого окна (пять минут) и длинного окна (один час) Cloudflare рассчитывает SLI.

Cloudflare уведомляет вас только в том случае, если и короткое, и длинное окно не достигают заданного порога. То есть для срабатывания оповещения порог должен быть нарушен в обоих окнах. Например, если задан порог 99%: