Anthropic внедрила ИИ-агента для автоматического расследования сбоев CI/CD
Инженеры Anthropic рассказали, как используют агента Claude Tag в качестве первой линии поддержки для обнаружения, анализа и устранения инфраструктурных инцидентов.
Инженеры Anthropic рассказали, как используют агента Claude Tag в качестве первой линии поддержки для обнаружения, анализа и устранения инфраструктурных инцидентов.
2 мин

Инженеры Anthropic поделились опытом интеграции ИИ-агента Claude Tag в процессы непрерывной интеграции и развертывания (CI/CD). Агент выступает в роли первой линии поддержки при сбоях, автоматически анализируя инциденты и предлагая решения. Это важный шаг в демонстрации того, как большие языковые модели (LLM) могут переходить от простых ответов на вопросы к автономному выполнению сложных инфраструктурных задач.
Традиционно поддержка CI/CD требует от дежурных инженеров постоянного внимания. Жестко заданные правила мониторинга часто приводят к ложным срабатываниям, что вызывает у специалистов усталость от предупреждений (alert fatigue). При возникновении реального сбоя инженеру приходится прерывать текущую работу и вручную собирать данные из разрозненных систем — логов, метрик, систем контроля версий, — чтобы найти первопричину проблемы.

Изображение из источника
Anthropic настроила агента Claude Tag для работы в корпоративном мессенджере Slack. Система обладает памятью, работает по расписанию и имеет доступ к инструментам разработчика (Grafana, PagerDuty, GitHub, Kubernetes) через коннекторы MCP (Model Context Protocol).
Процесс работы агента включает несколько ключевых этапов:
Во-первых, обнаружение. ИИ анализирует входящие предупреждения и самостоятельно решает, требует ли проблема немедленного вызова инженера, или ее можно отложить до утра. Также система помогает настраивать пороги срабатывания алертов для новых сервисов.
Во-вторых, расследование. При инциденте Claude Tag запускает субагентов для параллельного сбора данных из разных источников. В среднем агент публикует первый структурированный отчет (SITREP) через 14 минут после начала инцидента, а в лучших случаях находит первопричину всего за 4 минуты.

Изображение из источника
В-третьих, обучение и разрешение. Агент опирается на файл lessons.md, куда автоматически записывает опыт прошлых инцидентов. Для устранения проблем ИИ может самостоятельно управлять флагами функций (feature flags) для перенаправления трафика или предлагать готовый код (Pull Request) для исправления ошибки.
Практика Anthropic показывает жизнеспособность агентных систем в реальных производственных условиях. Использование обычных текстовых файлов формата Markdown для программирования логики поведения агента демонстрирует новый подход к управлению инфраструктурой — своеобразные "инструкции как код". ИИ не заменяет инженера полностью, но берет на себя рутину сбора контекста и первичного анализа. Это позволяет значительно сократить среднее время восстановления (MTTR) и снизить выгорание специалистов.
В ближайшем будущем подобные ИИ-системы станут стандартом для DevOps-команд. Мы увидим переход от жестко заданных правил мониторинга к динамическим системам, где искусственный интеллект самостоятельно адаптирует пороги срабатывания на основе анализа исторического трафика. Роль дежурного инженера постепенно сместится от ручного поиска причин сбоя к верификации и утверждению решений, предложенных автономными агентами.
Anthropic успешно автоматизировала первую линию поддержки CI/CD с помощью ИИ-агента, который самостоятельно расследует инциденты и предлагает исправления.
Самым эффективным способом управления логикой ИИ-агента оказалось ведение простого текстового файла (lessons.md), который система читает перед каждым расследованием и обновляет после него.