Хороший сервис — это незаметный сервис. Он просто функционирует, и за этим скрывается невидимая работа: профилактика, мониторинг и умение команды действовать без лишней суеты.
На чем держится надежность сервиса? Не на героизме, а на рутине.
В Cloupard есть базовый принцип: «Вызов, возможности, вдохновение — при развитии. Системность, процесс, порядок — при эксплуатации». Клиенты и партнеры ждут от провайдера предсказуемую доступность, производительность и функциональность при управлении услугой.
«Предсказуемость» должна быть измерена и закреплена в SLA. Чаще всего провайдеров облаков сравнивают по доступности. Хорошим считается показатель в 99,9%. А вот каждая сотая доля сверх этого, например, до 99,95%, требует от компании кратно больших вложений в инфраструктуру и организационные процедуры.
За надежность отвечает отдельный процесс — управление непрерывностью услуг. Он включает в себя несколько направлений: автоматический мониторинг сервисов и инфраструктуры, плановые и профилактические работы, управление нештатными ситуациями и анализ результатов работы.
Чтобы и команда, и системы действовали отлажено и четко, помимо документации по сервису нам понадобится процессная документация.
Именно в ней мы фиксируем:
Как это выглядит на практике? Скажем, перед нами стоит цель: минимизировать влияние нештатных ситуаций на доступность, безопасность, производительность и качество услуг.
Тогда мы будем измерять продолжительность, масштаб, существенность влияния и количество нештатных ситуаций за период. В главных ролях — дежурная линия поддержки, медиатор, ответственный за восстановление, инженерные команды и клиентский сервис.
Из инструментов нам потребуется мониторинг, чаты рабочих групп (группы восстановления, группы клиентского сервиса), инфраструктурные ресурсы и доступы, система Helpdesk, налаженные коммуникации с поставщиками, сайт публикации для клиентов актуальной информации о состоянии сервисов.
Что мы делаем по шагам:
Надежность сервиса начинается не в момент аварии, а сильно раньше. Она складывается из рутинных вещей: мониторинга, профилактики, анализа и честного разбора того, что уже происходило.
* Изображение создано с использованием ИИ (искусственного интеллекта).
На чем держится надежность сервиса? Не на героизме, а на рутине.
В Cloupard есть базовый принцип: «Вызов, возможности, вдохновение — при развитии. Системность, процесс, порядок — при эксплуатации». Клиенты и партнеры ждут от провайдера предсказуемую доступность, производительность и функциональность при управлении услугой.
«Предсказуемость» должна быть измерена и закреплена в SLA. Чаще всего провайдеров облаков сравнивают по доступности. Хорошим считается показатель в 99,9%. А вот каждая сотая доля сверх этого, например, до 99,95%, требует от компании кратно больших вложений в инфраструктуру и организационные процедуры.
За надежность отвечает отдельный процесс — управление непрерывностью услуг. Он включает в себя несколько направлений: автоматический мониторинг сервисов и инфраструктуры, плановые и профилактические работы, управление нештатными ситуациями и анализ результатов работы.
Чтобы и команда, и системы действовали отлажено и четко, помимо документации по сервису нам понадобится процессная документация.
Именно в ней мы фиксируем:
- цели, методику оценки достижения цели;
- распределение ролей, их полномочия и взаимодействие;
- порядок шагов для достижения результата и контроль сроков;
- чек-листы, маршруты, правила, написанные кровью прошлого опыта;
- алгоритмы и критерии принятия решений;
- требуемые инструменты и ресурсы;
- границы, исключения, риски;
- регулярный анализ результатов и поиск возможностей улучшения.
Как это выглядит на практике? Скажем, перед нами стоит цель: минимизировать влияние нештатных ситуаций на доступность, безопасность, производительность и качество услуг.
Тогда мы будем измерять продолжительность, масштаб, существенность влияния и количество нештатных ситуаций за период. В главных ролях — дежурная линия поддержки, медиатор, ответственный за восстановление, инженерные команды и клиентский сервис.
Из инструментов нам потребуется мониторинг, чаты рабочих групп (группы восстановления, группы клиентского сервиса), инфраструктурные ресурсы и доступы, система Helpdesk, налаженные коммуникации с поставщиками, сайт публикации для клиентов актуальной информации о состоянии сервисов.
Что мы делаем по шагам:
- Выявление — алерты от мониторинга, в редких случаях — обращения клиентов.
- Эскалация — подключаем экспертов к анализу выявленных симптомов.
- Первичная информация — фиксируем симптомы, причину, принимаем решение о необходимости включения режима аварии.
- Информирование клиентов — отражаем информацию о состоянии сервисов на сайте и отвечаем клиентам, которые обратились за помощью.
- Восстановление доступности — зачастую авария происходит в связи со сбоем, которого никогда раньше не было, поэтому здесь все индивидуально.
- Регулярная актуализация информации — вплоть до окончания нештатной ситуации.
- Postmortem — анализируем, как отработали инцидент и как избежать повторения.
- Меры, чтобы ситуация не повторилась — пересматриваем оценку угроз, расширяем мониторинг и так далее.
Надежность сервиса начинается не в момент аварии, а сильно раньше. Она складывается из рутинных вещей: мониторинга, профилактики, анализа и честного разбора того, что уже происходило.
* Изображение создано с использованием ИИ (искусственного интеллекта).