Компания Harness, специализирующаяся на жизненном цикле разработки программного обеспечения (SDLC), намерена подвергать агентов тем же процессам и механизмам контроля, через которые проходит весь код приложений, с целью изменить сложившуюся ситуацию, которая тормозит внедрение агентов.
Согласно опросу Gartner «CIO и руководители технологических подразделений - 2026», на сегодняшний день только 17 % организаций внедрили ИИ-агенты.
На этой неделе компания Harness запустила сервис «Жизненный цикл разработки ИИ-агентов» (DLC), чтобы разработчики могли выпускать ИИ-агенты с тем же уровнем управления, тестирования и безопасности, на которые они уже полагаются при разработке кода приложений.
Реальность агентов: технически - успех, но на практике бесполезно
Тревор Стюарт, старший вице-президент и генеральный директор Harness, отмечает, что заставить агента работать в демонстрационной версии - это легкая часть, но понять, как он будет вести себя в производственной среде, - это совершенно другая проблема.
«Поверхность атаки, создаваемая агентом, не только больше, но и носит динамический характер», - говорит Стюарт. «Из-за этого компании не решаются внедрять его в производственную среду. Принудительное удержание агента в предпроизводственных средах и песочницах - в конечном итоге это технически успех, но практически бесполезно».
Он подчеркивает это и отмечает, что часть процесса внедрения любого решения в производственную среду заключается в обеспечении того, чтобы качество и точность оставались на высоком уровне даже под нагрузкой. Поэтому самая сложная часть работы с агентами - «сохранить эту планку качества на прежнем уровне», когда один и тот же входной сигнал может каждый раз давать разный результат.
Поскольку код приложения детерминирован, разработчики могут дважды запустить один и тот же тест на одном и том же коде и оба раза получить одинаковый предсказуемый результат. Агенты, очевидно, мыслят иначе. Языковая модель, лежащая в основе агента, определяет, как выполнить задачу, поэтому один и тот же агент при одинаковых входных данных может выбрать другой инструмент или предпринять иное действие при повторном запуске.
Тест, который прошел один раз, не гарантирует, что он пройдет и в следующий раз. Инциденты перестают быть воспроизводимыми по требованию, а это означает, что стандартный набор действий для обнаружения и исправления ошибок также не работает.
Пришло время сделать конвейер предсказуемым
Учитывая эти основные принципы, если вам кажется, что попытка применить детерминированные механизмы контроля доставки к недетерминированным ИИ-агентам, принимающим решения, - задача сложная, то, вероятно, это действительно так.
«Не думайте о том, как сделать самого агента предсказуемым; вместо этого сделайте предсказуемым конвейер вокруг него», - объясняет Стюарт. «Если мы вспомним, как всегда работала непрерывная доставка, то видим, что перед выпуском продукта проверяется, прошли ли тесты. Теперь мы точно так же подходим к контрольным точкам качества и оценкам: оцениваем ответ по корректности, безопасности и производительности, а полученную оценку напрямую встраиваем в конвейер в качестве контрольной точки, определяющей прохождение или отклонение».
«Не пытайтесь сделать агент предсказуемым; вместо этого сделайте предсказуемым конвейер, построенный вокруг него. Оценивайте ответ [теста] по критериям корректности, безопасности и производительности, а полученную оценку напрямую подключайте к конвейеру в качестве контрольного пункта, определяющего прохождение или отклонение».
По словам Стюарта, в этом и заключается настоящий прорыв: Harness внедряет детерминированные механизмы и управление в процесс, имеющий дело с недетерминированными результатами. Он осторожно подчеркивает, что мы не собираемся делать агентов (или их результаты) воспроизводимыми, по крайней мере, в ближайшем будущем.
«Что мы можем сделать воспроизводимым, так это запись того, что произошло: каждый вызов модели, каждый вызов инструмента, каждый выполненный шаг - всё это фиксируется», - уточняет Стюарт. «Именно эта запись позволяет инженеру реально настраивать агента для достижения лучшего результата, а не полагаться на догадки».
Он объясняет, что это означает «не ограничиваться лишь запуском оценок» перед выпуском продукта. Это включает «тестирование и итерации над агентом в режиме реального времени», чтобы разработчик мог быстро вносить изменения, а затем «наблюдать, как они проявляются в реальных условиях использования», для дальнейшей доработки. Все это означает, что агент продолжает двигаться к лучшим результатам для клиента.
Расширяющаяся поверхность атаки, о которой упоминалось в начале, обусловлена тем, что агенты подключаются к инструментам и API, создают подагентов и наследуют доверие от каждой модели, с которой они взаимодействуют. Стюарт и его команда заявляют, что статические сканирования никогда не были предназначены для такого рода рисков. Теперь Harness стремится предоставить средства безопасности, чтобы устранить этот пробел, с помощью пяти новых продуктов и функций, охватывающих тестирование, развертывание, эксплуатацию и управление.
Пять новых механизмов контроля агентов
Harness AI Evals позволяет измерить качество агентов, давая командам возможность определять наборы данных для оценки, настраивать функции оценки и устанавливать пороги качества, которые автоматически выявляют регрессии при любом изменении агента или модели. Развертывания Harness Agent расширяют возможности «канарейковых» релизов, утверждений и защитных механизмов OPA, которые Harness уже применяет к развертываниям в Kubernetes, на управляемые среды выполнения агентов.
Еще одна новинка от Harness - AI Configs, предназначенная для поддержки выпуска и управления подсказками и изменениями моделей во время выполнения; AI Asset Catalog автоматически обнаруживает всех агентов, навыки и плагины, созданные в репозиториях организации, и связывает каждый из них с владельцем, благодаря чему ничто не поставляется и не запускается без учета; а также Harness AgentTrace, который фиксирует события как во время отдельного запуска агента, так и на протяжении полной многоэтапной сессии, показывая, по какому пути двигался агент, где происходило замедление и как различные модели или подсказки влияют на результат.
Harness также открывает исходный код базовых компонентов, лежащих в основе AgentTrace, включая harness-sdk и harness-evals, чтобы разработчики могли внедрить те же примитивы трассировки в свои собственные приложения искусственного интеллекта.
Могут ли разработчики теперь приступать к развертыванию агентных систем?
Означает ли всё это, что разработчики теперь могут приступать к развёртыванию агентов с большей скоростью и уверенностью, и, что особенно важно с точки зрения измеримой эффективности, в чём заключается компромисс между использованием программистами специальных пилотных проектов для тестирования агентов и использованием всего спектра возможностей платформы Harness для контроля управляемых конвейеров Agent DLC?
«Здесь нет идеальных статистических данных, поэтому я не буду делать вид, что могу назвать вам точную цифру в долларах», - признает Стюарт. «Из нашего собственного отчёта «Состояние инженерного совершенства 2026» нам известно, что почти треть рабочего дня разработчика (31 %) уходит на работу, связанную с ИИ, которая вообще не отражается ни в одной метрике, а 94 % руководителей инженерных подразделений признают, что такие аспекты, как технический долг, время на валидацию и профессиональное выгорание, отсутствуют в том, что они отслеживают».
«Нет единой управленческой роли, стоящей над всем. Ответственность возникает в тот момент, когда что-то создается, и всегда можно проследить, кто за это отвечает».
Нет единой руководящей роли, стоящей над всем
Сдвиг в подходе к разработке, о котором здесь рассказывает Стюарт, заключается в том, чтобы рассматривать агент и лежащую в его основе технологию как сервис.
«Именно на этой концепции и построен каталог ИИ-ресурсов», - заключает Стюарт. «Нет единой роли управления, стоящей над всем. Ответственность за объект возникает в тот момент, когда он создается, и всегда можно проследить, кто за него отвечает. Кроме того, каждый может узнать, что уже создано, что позволяет избежать дублирования усилий и ненужного разрастания проекта».
В июне 2026 года компания Harness представила свое решение Autonomous Worker Agents, позволяющее командам создавать и запускать ИИ-агенты в рамках конвейеров доставки программного обеспечения. Рабочие агенты (Worker Agents) выполняются в качестве контролируемых этапов в рамках этих конвейеров и подпадают под те же меры контроля, которые Harness уже применяет ко всем развертываниям. Agent DLC распространяет этот же контекст и управление на весь жизненный цикл агента.
Конвейеры, политики, утверждения и подтверждающая документация, которые уже применяются к коду организации, теперь распространяются и на её агенты, поэтому этапы оценки, утверждения развёртывания и проверки безопасности выполняются как этапы в рамках единого конвейера - с момента создания агента и на протяжении всего его последующего функционирования.
Читайте также
- Руководство для начинающих по CI/CD и конвейерам CI/CD
- Звонок поступает изнутри вашего конвейера: как устроена атака Codecov
- Вот 10 ошибок в конвейере CI/CD, которые замедляют работу инженерных команд
Подписывайтесь на наш канал в Телеграм
⚡ Подписаться