Search

Теперь сервис Jira Service Management входит в Service Collection, что многократно повышает эффективность этого решения. Откройте для себя исключительные возможности с Rovo, активами и новым приложением Customer Service Management.Попробовать

Набор инструментов для плана непрерывной работы в сфере ИТ

Основные моменты

  • План непрерывной работы в сфере ИТ обеспечивает функционирование критически важных систем и сервисов во время сбоев.

  • ITSCM, аварийное восстановление и более широкое управление непрерывностью бизнеса служат разным целям и рассчитаны на разные сроки, но лучше всего работают в сочетании.

  • Шаблоны для анализа влияния на бизнес, отслеживания RTO/RPO, перечней процедур и планирования коммуникации помогают командам быстрее создать надежную программу непрерывной работы.

  • Автоматизация и ИИ упрощают отслеживание рисков, активацию оповещений с помощью триггеров и проверку готовности к восстановлению с минимумом трудозатрат.

Когда выходит из строя система или происходит кибератака, недостаточно простого плана — нужен подходящий план, подкрепленный соответствующими инструментами и специалистами. Наличие плана непрерывной работы в сфере ИТ (ITBCP) отличает команду, которая действует хаотично, от той, что реагирует уверенно. 

Коллекция шаблонов для управления службами в Jira Service Management предоставляет ИТ-командам готовые структуры для планирования непрерывности работы, реагирования на инциденты и решения других задач, чтобы вы не тратили время на планирование с нуля, а посвятили его работе. 

В этом материале приводятся определения понятий, разбор шаблонов, сравнение методологий и советы по использованию автоматизации для усиления программы обеспечения непрерывности работы. Эта информация пригодится вам независимо от того, создаете ли вы свой первый план ITBCP или проводите аудит существующего.

Что такое план непрерывной работы в сфере ИТ?

План непрерывной работы в сфере ИТ — это задокументированная стратегия, определяющая, как организация будет поддерживать работу критически важных технологических систем и сервисов во время и после сбоя. Сбой может быть вызван кибератакой, стихийным бедствием, отключением электроэнергии или серьезным отказом системы. Цель заключается не только в восстановлении, но и в поддержании непрерывной работы бизнеса.

Управление непрерывностью ИТ-обслуживания (ITSCM) — одна из практик в составе более широкой концепции обеспечения непрерывности работы. Она ориентирована именно на технологические службы, обеспечивающие работу бизнеса, включая инфраструктуру, приложения, данные и процедуры поддержки, основанные на принципах ITIL и ITSM.

Стоит различать три термина, которые часто используются как взаимозаменяемые.

  • Планирование непрерывности работы в сфере ИТ направлено на поддержание доступности систем и сервисов во время сбоя. Это проактивный подход, который охватывает предотвращение, подготовку и реагирование.

  • Аварийное восстановление — один из аспектов планирования непрерывной работы, направленный на восстановление ИТ-систем и данных после сбоя. Это реактивный процесс, который запускается при возникновении проблем.

  • Управление непрерывностью работы (BCM) — самое широкое из трех понятий. Оно охватывает всю организацию, а не только ИТ и распространяется на технологии, сотрудников, процессы, объекты и коммуникацию.

Основные шаблоны и инструменты ITSCM

Эффективное планирование непрерывной работы предусматривает наличие необходимой документации до возникновения проблем. Представленные ниже шаблоны охватывают наиболее важные составляющие плана непрерывной работы в сфере ИТ. Коллекция шаблонов для управления обслуживанием от Atlassian — это отличная отправная точка, а шаблон для управления ИТ-обслуживанием специально разработан, чтобы помочь ИТ-командам с самого начала структурировать рабочие процессы, связанные со службами и обеспечением непрерывности.

Вот шаблоны, которые должны быть под рукой у каждой ИТ-команды.

Шаблон правил и охвата

Помогает определить цели, охват и руководящие принципы программы обеспечения непрерывной работы. Без этого команды часто не могут договориться о том, что входит в зону их ответственности, когда наступает кризис.

Анализ влияния на бизнес

Помогает оценить критически важные системы, приложения и их зависимости. Анализ влияния на бизнес показывает, что ломается в первую очередь, сколько это стоит и что нужно восстановить как можно скорее.

Таблица RTO/RPO

Отслеживает целевое время восстановления (как долго система может простаивать) и целевые точки восстановления (какой объем потери данных допустим) для каждой системы. 

План коммуникации

Содержит контакты, пути эскалации и правила коммуникации. Четкое сообщение об инциденте во время сбоя уменьшает путаницу и ускоряет решение проблемы.

План тестирования аварийного восстановления / повестка дня для разбора моделируемых ситуаций

Включает структурированную методику тестирования для проверки готовности к восстановлению. Регулярное тестирование позволяет обнаружить пробелы до того, как произойдет реальный инцидент.

Структура перечня процедур

Представляет собой оперативный сборник сценариев для реагирования на инциденты, сбои и отказы системы. При наличии грамотно составленного перечня процедур реагирующим лицам не придется в стрессовой ситуации продумывать все с нуля.

ITSCM, аварийное восстановление, BCM и управление серьезными инцидентами: в чем разница?

Эти четыре методологии пересекаются, что может вызвать серьезную путаницу, особенно в кризисной ситуации, когда команды не уверены, кто за что отвечает. Ниже описаны различия этих методологий и сферы их применения.

Методология

Focus

Область действия

Сроки

Цель

Когда использовать / пересечения

Управление непрерывностью ИТ-обслуживания (ITSCM)

Поддержка и восстановление ИТ-служб

ИТ-системы и службы

Постоянно и проактивно

Свести к минимуму последствия сбоя для ИТ-служб

Лежит в основе программы обеспечения непрерывной работы в сфере ИТ. Пересекается с аварийным восстановлением в части планирования и с BCM в части оценки рисков.

Аварийное восстановление

Восстановление ИТ-систем и данных после сбоя

Инфраструктура, приложения и данные

Реактивно; запускается по событию

Как можно скорее восстановить работоспособность систем

Обеспечивает восстановления систем в случае сбоя. Планы аварийного восстановления создаются с опорой на ITSCM и применяются при серьезных инцидентах.

Управление непрерывностью работы (BCM)

Обеспечение работы всей организации

Сотрудники, помещения, процессы и технологии

Стратегически и долгосрочно

Обеспечить непрерывную работу всей компании в неблагоприятных условиях

Используется на организационном уровне, когда сбой затрагивает не только ИТ. Включает в себя ITSCM и аварийное восстановление как компоненты более широкой стратегии.

Управление крупными инцидентами

Устранение критических ИТ-сбоев в реальном времени

Конкретный инцидент

Немедленно

Быстро восстановить нормальную работу службы и четко информировать заинтересованные лица

Используется при критическом инциденте. Запускает перечни процедур аварийного восстановления и предоставляет данные для разбора инцидента с целью улучшить планирование ITSCM.

На практике эти методологии взаимозависимы. ITSCM служит основой для планирования аварийного восстановления. Аварийное восстановление используется в BCM. Управление инцидентами задействует планы аварийного восстановления в случае серьезного происшествия. Пересечение этих методологий не случайно, но важно понимать, какая из них приоритетна в тот или иной момент.

Как модернизировать обеспечение непрерывной работы в сфере ИТ с помощью автоматизации и ИИ?

Процессы обеспечения непрерывной работы вручную имеют свои ограничения. Они выполняются медленно, нестабильно и сильно зависят от того, кто свободен в момент сбоя. Автоматизация и ИИ меняют представление о возможном, позволяя ИТ-командам создавать более отказоустойчивые программы с меньшими усилиями.

Перечислим сферы, в которых автоматизация наиболее полезна.

  • Автоматизированный мониторинг и оповещения. Настройте мониторинг состояния системы, пороговых значений производительности и аномалий в реальном времени. Благодаря автоматическим оповещениям команда узнает о потенциальном сбое до того, как он перерастет в полный отказ системы.

  • Автоматизация резервного копирования. Автоматизированное резервное копирование по расписанию снижает влияние человеческого фактора и гарантирует достижение целевых точек восстановления. Сочетайте его с автоматическими проверками, чтобы иметь уверенность в работоспособности резервных копий.

  • Анализ последствий на базе ИИ. Инструменты ИИ могут анализировать зависимости в системе и моделировать последствия сбоя быстрее, чем анализ влияния на бизнес вручную. Это особенно полезно в сложных средах с сотнями взаимозависимостей.

  • Прогнозное тестирование. Вместо того чтобы дожидаться ежеквартального разбора моделируемых ситуаций, ИИ может непрерывно моделировать сценарии сбоев и выявлять слабые места в плане восстановления. Это превращает тестирование из периодического события в постоянную практику.

  • Автоматизация для ускоренного восстановления. Перечни процедур можно частично или полностью автоматизировать, чтобы при инциденте первые шаги по восстановлению выполнялись немедленно без вмешательства человека.

Автоматизация не заменяет качественное планирование, а расширяет его возможности. Наилучших результатов достигают те команды, которые начинают с надежных шаблонов и процедур, а затем добавляют автоматизацию, чтобы уменьшить объем ручной работы. Непрерывное совершенствование — неотъемлемая составляющая этой модели. Каждый автоматизированный тест и оповещение добавляют данные, которые со временем помогают совершенствовать план.

Практическое применение набора инструментов для обеспечения непрерывной работы в сфере ИТ

Jira Service Management предоставляет ИТ-командам единое пространство для координации разбора моделируемых ситуаций, отслеживания прогресса восстановления и управления полным жизненным циклом мероприятий по обеспечению непрерывной работы. Благодаря встроенным инструментам управления инцидентами и настраиваемым рабочим процессам JSM служит операционной основой для плана непрерывной работы в сфере ИТ, объединяя людей, процессы и документацию, от которых зависят программы обеспечения непрерывности.

Используйте эту страницу как отправную точку для создания или обновления собственной программы обеспечения непрерывной работы. Представленные здесь шаблоны, методологии и рекомендации разработаны для использования в сочетании. Начните с самой неотложной задачи, будь то анализ влияния на бизнес, создание плана коммуникации или таблицы RTO/RPO, и отталкивайтесь от этого в дальнейшей работе. Цель — создать программу, которая не подведет в самый ответственный момент.

Рекомендовано для вас

Справочник

Справочник Atlassian по управлению инцидентами

В справочнике описаны реальные процессы управления инцидентами от международной компании, насчитывающей тысячи сотрудников и более 200 000 клиентов.

Управление проблемами в ITIL: руководство по процессам и реализации

Управление проблемами помогает ИТ-командам предотвращать инциденты, выявляя их основные причины. Узнайте о процессе в целом и о его преимуществах и ознакомьтесь с рекомендациями.

Подробнее об ITSM

В этом разделе вы найдете другие руководства и ресурсы по ITSM.