Блог

Агенты постоянно меняют свои ответы. Harness просто создал конвейеры доставки, которым это не важно.

Компания Harness, специализирующаяся на жизненном цикле разработки программного обеспечения (SDLC), намерена подвергать агентов тем же процессам и механизмам контроля, через которые проходит весь код приложений, с целью изменить сложившуюся ситуацию, которая тормозит внедрение агентов. 

Согласно опросу Gartner «CIO и руководители технологических подразделений - 2026», на сегодняшний день только 17 % организаций внедрили ИИ-агенты. 

На этой неделе компания Harness запустила сервис «Жизненный цикл разработки ИИ-агентов» (DLC), чтобы разработчики могли выпускать ИИ-агенты с тем же уровнем управления, тестирования и безопасности, на которые они уже полагаются при разработке кода приложений.

Реальность агентов: технически - успех, но на практике бесполезно

Тревор Стюарт, старший вице-президент и генеральный директор Harness, отмечает, что заставить агента работать в демонстрационной версии - это легкая часть, но понять, как он будет вести себя в производственной среде, - это совершенно другая проблема.  

«Поверхность атаки, создаваемая агентом, не только больше, но и носит динамический характер», - говорит Стюарт. «Из-за этого компании не решаются внедрять его в производственную среду. Принудительное удержание агента в предпроизводственных средах и песочницах - в конечном итоге это технически успех, но практически бесполезно».

Он подчеркивает это и отмечает, что часть процесса внедрения любого решения в производственную среду заключается в обеспечении того, чтобы качество и точность оставались на высоком уровне даже под нагрузкой. Поэтому самая сложная часть работы с агентами - «сохранить эту планку качества на прежнем уровне», когда один и тот же входной сигнал может каждый раз давать разный результат. 

Поскольку код приложения детерминирован, разработчики могут дважды запустить один и тот же тест на одном и том же коде и оба раза получить одинаковый предсказуемый результат. Агенты, очевидно, мыслят иначе. Языковая модель, лежащая в основе агента, определяет, как выполнить задачу, поэтому один и тот же агент при одинаковых входных данных может выбрать другой инструмент или предпринять иное действие при повторном запуске. 

Тест, который прошел один раз, не гарантирует, что он пройдет и в следующий раз. Инциденты перестают быть воспроизводимыми по требованию, а это означает, что стандартный набор действий для обнаружения и исправления ошибок также не работает.

Пришло время сделать конвейер предсказуемым

Учитывая эти основные принципы, если вам кажется, что попытка применить детерминированные механизмы контроля доставки к недетерминированным ИИ-агентам, принимающим решения, - задача сложная, то, вероятно, это действительно так.

«Не думайте о том, как сделать самого агента предсказуемым; вместо этого сделайте предсказуемым конвейер вокруг него», - объясняет Стюарт. «Если мы вспомним, как всегда работала непрерывная доставка, то видим, что перед выпуском продукта проверяется, прошли ли тесты. Теперь мы точно так же подходим к контрольным точкам качества и оценкам: оцениваем ответ по корректности, безопасности и производительности, а полученную оценку напрямую встраиваем в конвейер в качестве контрольной точки, определяющей прохождение или отклонение».

«Не пытайтесь сделать агент предсказуемым; вместо этого сделайте предсказуемым конвейер, построенный вокруг него. Оценивайте ответ [теста] по критериям корректности, безопасности и производительности, а полученную оценку напрямую подключайте к конвейеру в качестве контрольного пункта, определяющего прохождение или отклонение».

По словам Стюарта, в этом и заключается настоящий прорыв: Harness внедряет детерминированные механизмы и управление в процесс, имеющий дело с недетерминированными результатами. Он осторожно подчеркивает, что мы не собираемся делать агентов (или их результаты) воспроизводимыми, по крайней мере, в ближайшем будущем.

«Что мы можем сделать воспроизводимым, так это запись того, что произошло: каждый вызов модели, каждый вызов инструмента, каждый выполненный шаг - всё это фиксируется», - уточняет Стюарт. «Именно эта запись позволяет инженеру реально настраивать агента для достижения лучшего результата, а не полагаться на догадки». 

Он объясняет, что это означает «не ограничиваться лишь запуском оценок» перед выпуском продукта. Это включает «тестирование и итерации над агентом в режиме реального времени», чтобы разработчик мог быстро вносить изменения, а затем «наблюдать, как они проявляются в реальных условиях использования», для дальнейшей доработки. Все это означает, что агент продолжает двигаться к лучшим результатам для клиента.

Расширяющаяся поверхность атаки, о которой упоминалось в начале, обусловлена тем, что агенты подключаются к инструментам и API, создают подагентов и наследуют доверие от каждой модели, с которой они взаимодействуют. Стюарт и его команда заявляют, что статические сканирования никогда не были предназначены для такого рода рисков. Теперь Harness стремится предоставить средства безопасности, чтобы устранить этот пробел, с помощью пяти новых продуктов и функций, охватывающих тестирование, развертывание, эксплуатацию и управление.

Пять новых механизмов контроля агентов

Harness AI Evals позволяет измерить качество агентов, давая командам возможность определять наборы данных для оценки, настраивать функции оценки и устанавливать пороги качества, которые автоматически выявляют регрессии при любом изменении агента или модели. Развертывания Harness Agent расширяют возможности «канарейковых» релизов, утверждений и защитных механизмов OPA, которые Harness уже применяет к развертываниям в Kubernetes, на управляемые среды выполнения агентов.

Еще одна новинка от Harness - AI Configs, предназначенная для поддержки выпуска и управления подсказками и изменениями моделей во время выполнения; AI Asset Catalog автоматически обнаруживает всех агентов, навыки и плагины, созданные в репозиториях организации, и связывает каждый из них с владельцем, благодаря чему ничто не поставляется и не запускается без учета; а также Harness AgentTrace, который фиксирует события как во время отдельного запуска агента, так и на протяжении полной многоэтапной сессии, показывая, по какому пути двигался агент, где происходило замедление и как различные модели или подсказки влияют на результат. 

Harness также открывает исходный код базовых компонентов, лежащих в основе AgentTrace, включая harness-sdk и harness-evals, чтобы разработчики могли внедрить те же примитивы трассировки в свои собственные приложения искусственного интеллекта.

Могут ли разработчики теперь приступать к развертыванию агентных систем?

Означает ли всё это, что разработчики теперь могут приступать к развёртыванию агентов с большей скоростью и уверенностью, и, что особенно важно с точки зрения измеримой эффективности, в чём заключается компромисс между использованием программистами специальных пилотных проектов для тестирования агентов и использованием всего спектра возможностей платформы Harness для контроля управляемых конвейеров Agent DLC?

«Здесь нет идеальных статистических данных, поэтому я не буду делать вид, что могу назвать вам точную цифру в долларах», - признает Стюарт. «Из нашего собственного отчёта «Состояние инженерного совершенства 2026» нам известно, что почти треть рабочего дня разработчика (31 %) уходит на работу, связанную с ИИ, которая вообще не отражается ни в одной метрике, а 94 % руководителей инженерных подразделений признают, что такие аспекты, как технический долг, время на валидацию и профессиональное выгорание, отсутствуют в том, что они отслеживают».

«Нет единой управленческой роли, стоящей над всем. Ответственность возникает в тот момент, когда что-то создается, и всегда можно проследить, кто за это отвечает».

Нет единой руководящей роли, стоящей над всем

Сдвиг в подходе к разработке, о котором здесь рассказывает Стюарт, заключается в том, чтобы рассматривать агент и лежащую в его основе технологию как сервис. 

«Именно на этой концепции и построен каталог ИИ-ресурсов», - заключает Стюарт. «Нет единой роли управления, стоящей над всем. Ответственность за объект возникает в тот момент, когда он создается, и всегда можно проследить, кто за него отвечает. Кроме того, каждый может узнать, что уже создано, что позволяет избежать дублирования усилий и ненужного разрастания проекта».

В июне 2026 года компания Harness представила свое решение Autonomous Worker Agents, позволяющее командам создавать и запускать ИИ-агенты в рамках конвейеров доставки программного обеспечения. Рабочие агенты (Worker Agents) выполняются в качестве контролируемых этапов в рамках этих конвейеров и подпадают под те же меры контроля, которые Harness уже применяет ко всем развертываниям. Agent DLC распространяет этот же контекст и управление на весь жизненный цикл агента. 

Конвейеры, политики, утверждения и подтверждающая документация, которые уже применяются к коду организации, теперь распространяются и на её агенты, поэтому этапы оценки, утверждения развёртывания и проверки безопасности выполняются как этапы в рамках единого конвейера - с момента создания агента и на протяжении всего его последующего функционирования.

Читайте также

Подписывайтесь на наш канал в Телеграм

Подписаться
CI/CD