Любая система мониторинга хороша ровно настолько, насколько быстро и адекватно IT-команда реагирует на ее сигналы. Однако получение уведомления о сбое — это лишь половина дела, а вторая, часто более трудоемкая, заключается в том, чтобы не потерять этот сигнал в потоке писем, правильно его интерпретировать и инициировать требуемые процессы. В Altevics эта связка выстроена на принципах бесшовной интеграции, где события мониторинга напрямую становятся триггерами для действий внутри системы управления ИТ-процессами.
Регистрация отказов: фиксация сбоев и учет бизнес-контекста
Прежде всего, речь идет о базовом, но критически важном сценарии — регистрации отказов. Когда мониторинг фиксирует, что конфигурационная единица (КЕ) перестала быть доступной (событие Down), Altevics получает это событие в контексте конкретной КЕ. Система автоматически фиксирует факт начала сбоя. Как только мониторинг присылает событие о восстановлении (UP), фиксируется окончание инцидента. Но самое интересное начинается, когда мы добавляем к этому бизнес-контекст.
Для каждой КЕ в системе задан операционный календарь, определяющий, когда эта единица должна работать, а также пороговое время простоя в минутах. Если сбой случается в рабочее время и длится дольше установленного порога, Altevics автоматически регистрирует инфраструктурный инцидент, который уже требует управленческого внимания согласно вашим SLA. При этом, вне зависимости от того был ли сгененирован инцидент, приходится ли сбой на рабочие часы или нет, система в любом случае фиксирует начало и окончание недоступности КЕ, а также общую длительность в реестре простоев КЕ.
Это позволяет накапливать статистику по доступности КЕ для последующего анализа и отчетности, не полагаясь на память инженеров или разрозненные логи.
Проактивное управление: от предупреждений к задачам через API
Однако далеко не все события мониторинга свидетельствуют о прямом отказе. Значительно чаще система сообщает о нештатных ситуациях, которые могут к этому отказу привести, если на них не отреагировать вовремя. Классический пример — заполняющееся дисковое пространство. Это не инцидент в моменте, но потенциальный пожар, который лучше предотвратить. Для таких сценариев в Altevics реализована гибкая система интеграции через API. Используя базовую или универсальную интеграцию, вы можете настроить правила, по которым подобные предупреждения будут трансформироваться в конкретные задания на работы или внутренние запросы на обслуживание. Принцип здесь прост: вы сами определяете, как в вашей компании принято учитывать и контролировать такие профилактические работы.
Наше API предоставляет возможность регистрации любых объектов согласно вашему процессу, будь то задание, запрос на обслуживание или изменение. Например, предупреждение о низком месте на диске на одном из продуктовых серверов может быть преобразовано не просто в уведомление, а в полноценное задание с высоким приоритетом, которое автоматически назначается на инженеров по эксплуатации и требует подтверждения выполнения.
Трехуровневая модель интеграции: контроль, предотвращение и управление надежностью
По сути, такая трехуровневая модель интеграции с мониторингом — получение событий, фиксация сбоев с учетом бизнес-календаря и проактивное создание задач узкоспециализированным группам (любых других объектов согласно вашим процессам) по предупреждениям мониторинга — превращает Altevics из системы, которая просто «знает о проблемах», в систему, которая помогает их контролировать и предотвращать.
Инженеры перестают гадать, было ли уведомление от мониторинга реальной проблемой, или же оно потерялось в почте, а менеджеры получают четкую картину не только по инцидентам, но и по всему спектру профилактических работ. Это позволяет сместить фокус команды с постоянной борьбы со следствиями на плановое управление надежностью инфраструктуры, где каждый сигнал от мониторинга находит свое законное место в общем процессе.