В сфере управления цифровыми операциями ИИ-агенты обеспечивают организациям конкурентное преимущество за счет сокращения количества инцидентов и ускорения восстановления. Потенциал для трансформации реальный, но он реализуется только в том случае, если агенты внедряются для решения конкретного целевого задачи, а не просто в качестве «слоя ИИ», добавляемого к существующим возможностям.
Одной из практических областей, где корпоративные ИИ-агенты могут изменить традиционные рабочие процессы, является инженерия надежности сайтов (SRE), где стандартная операционная модель носит реактивный характер и ориентирована на человека. Такая модель сопряжена с высокими затратами, обременяя инженеров рутинной работой, которая отнимает у них время и может привести к выгоранию.
ИИ-агенты SRE предлагают способ изменить подход к работе инженеров по обеспечению надежности сайтов, превращая их из «исполнителей», вручную управляющих операциями, в «руководителей», возглавляющих команду агентов, которые проактивно способствуют улучшению операционной деятельности.
От руководств по эксплуатации до анализа первопричин: где агенты помогают больше всего
Существует пять практических способов, с помощью которых ИИ-агенты SRE могут облегчить нагрузку на инженерные команды:
1. Автономная работа
Традиционная работа SRE опирается на руководства по эксплуатации, которые инженеры составляют и обновляют. Получив оповещение, инженеры входят в систему, запускают диагностику, применяют исправления и, по возможности, создают автоматизацию, чтобы ускорить устранение подобных инцидентов в будущем. Даже при внедрении автоматизации процесс управления инцидентами по-прежнему зависит от человека, который управляет им от начала до конца.
Агенты SRE на базе ИИ меняют эту ситуацию. После получения оповещения и анализа его контекста - например, сопоставления оповещения о всплеске использования памяти с недавним обновлением или развертыванием - они могут самостоятельно выполнять действия для устранения рутинных проблем.
2. Накопление опыта на основе операционных данных
SRE полагаются на значительный личный опыт, чтобы составить полную картину инцидента и выявить факторы, повлиявшие на его возникновение. Однако по мере того, как цифровые системы становятся все более сложными, такие накопленные знания становится гораздо сложнее масштабировать. Если эксперт в данной области недоступен, организация теряет доступ к знаниям, необходимым для быстрого устранения инцидента.
«Обрабатывая эти данные со скоростью машины, агенты ИИ могут давать соответствующие рекомендации и даже самостоятельно устранять проблемы в случае рутинных неполадок с низким уровнем риска».
Агенты ИИ для SRE, обученные на реальных исторических данных об инцидентах, могут опираться на предыдущие инциденты и соответствующие принятые меры, чтобы быстро диагностировать и устранять повторяющиеся проблемы. Работая со скоростью машины при обработке этих данных, агенты ИИ могут давать соответствующие рекомендации и даже самостоятельно устранять проблемы в случае рутинных неполадок с низким уровнем риска.
3. Устранение рутинной работы
Инженеры тратят огромное количество времени и усилий на автоматизацию ручных, повторяющихся задач, чтобы сократить рутинную работу, но автоматизация - это не то же самое, что автономность. Эти автоматизированные рабочие процессы по-прежнему требуют участия инженера для запуска и оценки результатов.
Агенты ИИ SRE идут еще дальше и полностью устраняют целые категории рутинной работы, например, автономно перезапускают вышедший из строя сервис без необходимости предварительного написания скриптов или запуска со стороны человека.
4. Проактивный подход
Команды SRE тратят большую часть своего времени на «тушение пожаров», реагируя на проблемы, вместо того чтобы улучшать долгосрочное состояние и надёжность систем. Благодаря тому, что инцидентами управляет агент SRE на базе ИИ, у инженеров появляется время сосредоточиться на повышении отказоустойчивости системы, улучшении наблюдаемости и укреплении архитектуры с прицелом на будущее.
«По мере того как агенты берут на себя все большую часть повседневной работы по управлению инцидентами, роль SRE эволюционирует от тактического специалиста по устранению неполадок к стратегическому руководителю, принимающему решения».
По мере того как агенты берут на себя все большую часть повседневной работы по управлению инцидентами, роль SRE эволюционирует от тактического специалиста по устранению неполадок к стратегическому руководителю, принимающему решения.
5. Переориентация специалистов на контекстную инженерию
Инженеры обладают глубокими техническими знаниями о системах, языках сценариев и инструментах инфраструктуры. Эта экспертиза не исчезает с появлением агентов; она переходит на более высокий уровень. Вместо того чтобы самостоятельно выполнять команды, инженеры используют свои знания для обучения агентов ИИ особенностям своей среды: инструментам, которые они могут использовать, действиям, которые они могут безопасно выполнять, и соответствующим зависимостям между сервисами. Роль инженеров смещается с выполнения задач на установление ограничений, в рамках которых работают агенты ИИ.
Новая роль SRE
SRE постоянно ведут упорную борьбу с перегрузкой. Чтобы справиться с этой проблемой, некоторые организации установили строгие ограничения на ручную работу для инженеров. Однако даже эти ограничения по-прежнему вынуждают инженеров тратить до половины своего рабочего времени на ручное устранение инцидентов.
Базовая рабочая нагрузка никуда не исчезает; она просто ограничивается, а не устраняется. Агенты ИИ SRE позволяют инженерам перейти от роли технических специалистов, вручную устраняющих сбои, к роли стратегических операторов, контролирующих набор агентов ИИ.
«Базовая рабочая нагрузка никуда не исчезает; она просто ограничивается, а не устраняется. Агенты ИИ SRE позволяют инженерам перейти от роли технических специалистов к роли стратегических операторов, курирующих набор агентов ИИ».
Новая структура ролей меняет то, как инженеры воспринимают свою повседневную работу: снижается уровень стресса и риск выгорания, появляется больше умственных ресурсов для инноваций, усовершенствования систем и другой высокоценной работы, которая приносит организации реальную пользу, а не просто позволяет ей оставаться на плаву.
Читайте также
- Почему при тестировании программного обеспечения необходима проверка безопасности ИИ-агентов
- Когда ИИ-агенты получают доступ к производственной среде: следующий серьезный риск для DevOps
- Создатель Spring хочет, чтобы система типов Java помогла обуздать агентный ИИ
Подписывайтесь на наш канал в Телеграм
⚡ Подписаться