# Бесплатная экспертная база знаний по управлению ИТ

Никакого пересказа ITIL, COBIT, ISO 20000, PRINCE2, TOGAF и прочего. Только сведения от консультантов и тренеров Cleverics. Включает ответы на **несколько тысяч вопросов** из **сотен источников**, а также детальный глоссарий с примерами, объяснениями и нюансами

# Практика управления мониторингом и событиями

[Практика](https://cleverics.ru/digital/kb-glossary/practice/) систематического наблюдения за [услугами](https://cleverics.ru/digital/kb-glossary/service/) и [компонентами](https://cleverics.ru/digital/kb-glossary/component/) услуг, а также [записи](https://cleverics.ru/digital/kb-glossary/record/) и формирования отчётности по выбранным [изменениям](https://cleverics.ru/digital/kb-glossary/change/) состояния, идентифицированным как [события](https://cleverics.ru/digital/kb-glossary/event/).

Синонимы: управление мониторингом и событиями

## Оригинальный английский термин

monitoring and event management practice

## Подробности

[Практика управления мониторингом и событиями](https://cleverics.ru/digital/kb-glossary/monitoring-and-event-management-practice/) фокусируется на том, чтобы обеспечить постоянную «видимость» состояния услуг и их компонентов и своевременно выявлять значимые [отклонения](https://cleverics.ru/digital/kb-glossary/variance/). В рамках [ITSM](https://cleverics.ru/digital/kb-glossary/it-service-management/) она связывает технический [мониторинг](https://cleverics.ru/digital/kb-glossary/monitoring/) (инфраструктуры, платформ, [приложений](https://cleverics.ru/digital/kb-glossary/application/), сетей) с потребностями [управления услугами](https://cleverics.ru/digital/kb-glossary/service-management/): из потока телеметрии, логов и проверок [доступности](https://cleverics.ru/digital/kb-glossary/availability/) выделяются события, которые требуют реакции, [анализа тренда](https://cleverics.ru/digital/kb-glossary/trend-analysis/) или информирования [заинтересованных сторон](https://cleverics.ru/digital/kb-glossary/stakeholder/). Практика помогает подтверждать доступность и [производительность](https://cleverics.ru/digital/kb-glossary/performance/), поддерживать выполнение [SLA](https://cleverics.ru/digital/kb-glossary/service-level-agreement/) и снижать время [обнаружения](https://cleverics.ru/digital/kb-glossary/detection/)[сбоев](https://cleverics.ru/digital/kb-glossary/failure/), обеспечивая входные данные для [управления инцидентами](https://cleverics.ru/digital/kb-glossary/incident-management/), [управления проблемами](https://cleverics.ru/digital/kb-glossary/problem-management-practice/) и [управления изменениями](https://cleverics.ru/digital/kb-glossary/change-management/). На практике здесь определяют, что именно наблюдать, какие [пороги](https://cleverics.ru/digital/kb-glossary/threshold/) и корреляции использовать, как классифицировать и маршрутизировать события, какие события подлежат записи и отчётности, а какие могут быть отфильтрованы как шум. Вне области этой практики находятся собственно устранение [инцидентов](https://cleverics.ru/digital/kb-glossary/incident/) и [восстановление](https://cleverics.ru/digital/kb-glossary/recovery/) услуги, а также поиск коренной причины и [разработка](https://cleverics.ru/digital/kb-glossary/development/) долгосрочных исправлений — это относится к управлению инцидентами и управлению [проблемами](https://cleverics.ru/digital/kb-glossary/problem/), хотя инициируется данными мониторинга.## Нюансы

Частая [ошибка](https://cleverics.ru/digital/kb-glossary/error/) — считать, что мониторинг и события тождественны управлению инцидентами. Событие фиксирует изменение состояния и сигнал, но не всегда означает инцидент: [предупреждение](https://cleverics.ru/digital/kb-glossary/alert/) о росте использования диска или кратковременная деградация могут требовать наблюдения или плановых действий, а не немедленного восстановления услуги. Обратная путаница тоже распространена: инцидент может быть зарегистрирован по [обращению](https://cleverics.ru/digital/kb-glossary/call/)[пользователя](https://cleverics.ru/digital/kb-glossary/user/) даже без «технического» события, если мониторинг не покрывает нужный компонент или [сценарий использования](https://cleverics.ru/digital/kb-glossary/use-case/). Ещё одна ловушка — пытаться «регистрировать всё»: избыточный поток событий перегружает [команду поддержки](https://cleverics.ru/digital/kb-glossary/support-team/), ухудшает [время реакции](https://cleverics.ru/digital/kb-glossary/response-time/) и снижает доверие к мониторингу. Корректнее управлять качеством событий: определять значимость, устранять дубли, использовать корреляцию и подавление, согласовывать пороги с реальной [полезностью](https://cleverics.ru/digital/kb-glossary/utility/) для услуги и её [заказчика](https://cleverics.ru/digital/kb-glossary/customer/). Важно также не сводить практику только к инструментам: без договорённостей о правилах [классификации](https://cleverics.ru/digital/kb-glossary/classification/), [эскалации](https://cleverics.ru/digital/kb-glossary/escalation/), владении и ответственности мониторинг превращается в набор разрозненных алертов. Наконец, отчётность по событиям не должна подменять [метрики](https://cleverics.ru/digital/kb-glossary/metric/)[ценности](https://cleverics.ru/digital/kb-glossary/value/): большое число событий может означать как улучшение обнаружения, так и ухудшение [устойчивости](https://cleverics.ru/digital/kb-glossary/resilience/) услуги — интерпретация требует контекста.## Примеры

- Событие «ИТ-услуга недоступна» по результату синтетической транзакции, автоматически инициирующее эскалацию в команду поддержки и регистрацию инцидента
- Событие предупреждения о достижении 80% заполнения файловой системы, используемое для планирования расширения ресурсов и предотвращения будущего инцидента
- Коррелированное событие «сбой узла кластера» на основе нескольких низкоуровневых сигналов (недоступность хоста, рост ошибок приложений, потеря сетевой связности)
- Событие изменения состояния компонента услуги после развёртывания, используемое для подтверждения корректного возврата в рабочую среду и формирования отчётности по стабильности
- События отклонения производительности (рост времени ответа API), используемые для выявления тренда и передачи данных в управление проблемами

## Рекомендуемые продукты по этой теме

- [VAP: Управление поддержкой ИТ-услуг](https://edu.cleverics.ru/vap-support?utm_source=knowledgebase&utm_medium=article&utm_content=banner&utm_term=VAP-SUPPORT) — Учебный курс: интенсив с тренером. Строим эффективную ИТ-поддержку. Оптимизируем существующую.
- [Apollo 13 — ITSM на практике](https://edu.cleverics.ru/apollo?utm_source=knowledgebase&utm_medium=article&utm_content=banner&utm_term=APOLLO) — Деловая игра. Service Desk, управление инцидентами, проблемами, изменениями
- [Altevics](https://cleverics.ru/solutions/altevics?utm_source=knowledgebase&utm_medium=article&utm_content=banner&utm_term=altevics) — Современная ITSM/ESM-система