Блог

«Сжатие» ИИ: почему модель Claude Opus 4.7 от Anthropic может оказаться менее функциональной, чем та, которую она заменила

В политике неделя — это долгий срок, но в кругах опытных разработчиков ИИ она кажется ещё длиннее. Именно такое мнение высказывают многие после того, как в прошлую среду компания Anthropic выпустила версию Claude Opus 4.7, пообещав, что она превзойдёт своего предшественника как модель ИИ-сервисов, созданная для решения сложных задач логического мышления и тонкого анализа.

В своих громких заявлениях Anthropic обещала способность обрабатывать «сложные, длительные задачи с точностью и последовательностью», а также функции, предназначенные для точного соблюдения инструкций. Модель даже придумывает способы проверки собственных результатов перед отправкой отчета.

Буквально, не проблема

Как сообщалось ранее, мы знаем, что более буквальное следование инструкциям в Opus 4.7 означает, что некоторые «промты, написанные для более ранних моделей, теперь могут иногда давать неожиданные результаты», а это значит, что некоторым пользователям Claude, возможно, придется скорректировать свой стиль написания промтов. 

Но это не то, что так возмущает пользователей; настоящая проблема лежит в другом, и она не пахнет розами.

Пользователь Reddit и аспирант JulioMcLaughlin2 объясняет в субреддите r/artificial, как они попросили Claude 4.7 (с включенным адаптивным мышлением) проработать подробное доказательство, и он просто закрутился в спирали ответов, которые звучали так: «ой, подождите, это не работает, дайте мне попробовать еще раз» — пять раз в одном ответе.

«Да, есть обходной путь, чтобы явно сказать ему думать перед ответом. Но… зачем это нужно? Я плачу 20 долларов в месяц. Это должна быть модель высшего уровня. Вместо этого она тратит время, передумывает на ходу и часто не приходит ни к какому полезному результату при решении задач, с которыми, я уверен, версия 4.6 справилась бы гораздо более связно еще месяц назад», — сетует он.

Недовольство, похоже, исходит со всех сторон. Пользователь Opus 4.7, блогер по ИИ и автор сонетов в стиле Шекспира Упали Р. тоже переживает не лучшие времена. 

В своей статье на Medium Упали пишет, что он использовал Opus 4.7 для разработки приложения MicroSaaS для повышения продуктивности с несколькими API-интеграциями, средним бэкендом и фронтендом на Flutter (кроссплатформенный набор инструментов для разработки пользовательского интерфейса с открытым исходным кодом от Google). Он называет это «мифическим проектом одного разработчика», то есть проектом с чрезмерно высокими амбициями.

Застрял на проекте Flutter 

«Было уже почти три часа, когда что-то пошло не так, и я наблюдал, как все идет наперекосяк с проектом Flutter, который я пытался создать за две недели. Я неправильно оценил и переоценил сильные стороны этих моделей», — вздохнул Упали.

Он объясняет, что использовал ИИ в качестве интеллектуального автозаполнения, что было полезно, но он обнаружил «урок в потолке», то есть предел, до которого инструмент в конечном итоге поднимается, прежде чем выйдет из строя.

«Один-два удачных обмена, и модель сбивается с курса. Это ослабляет ваши функции. Это разрушает ваше здание. Та крыша была в порядке. Вы [все] вокруг трудились бы», — написал он.

Похоже, что пользователи считают, что Anthropic урезала функциональность моделей. Пользователи считают, что модели стали более осторожными и, в конечном итоге, менее интеллектуальными, возможно, во имя соответствия стандартам безопасного использования, насколько они существуют. Сам Упали предполагает, что модели, за которые платят разработчики, являются «фактически «облегченными» версиями» и что они «ограничены защитными механизмами», которые снижают производительность.

«Шинфляция» ИИ

Все эти дискуссии о реальности привели к тому, что один из комментаторов на Trading View написал, что разработчики начали называть эти шаги «свинкфляцией ИИ», т. е. та же модель, следующая версия, меньше форм и функций. Другими словами, настоящая история — это то, чего нет в коробке.

Ссылаясь на Project Glasswing как на шаг Anthropic по ограничению доступа к интеллекту высшего уровня для работы в рамках более строгих правил безопасности, этот разработчик считает, что это представляет собой палку о двух концах. 

«С одной стороны, это создает ажиотаж вокруг «божественной модели», — пишут они. «С другой — это подтверждает подозрение, что модели, за которые мы можем заплатить, на самом деле являются «облегченными» версиями, ограниченными защитными механизмами, которые снижают производительность, или что происходит некое ухудшение качества или ограничение мощности из-за чрезмерного использования».

Призраки в машине?

Тогда возникает вопрос: наблюдаем ли мы некое ухудшение качества или ограничение мощности из-за чрезмерного использования, или же в машине скрывается какой-то более глубокий призрак, который теперь проявляет себя в виде серьезной проблемы?

Чтобы прояснить ситуацию, Гай Керриер, аналитик The Futurum Group, говорит, что то, что мы наблюдаем здесь с Opus 4.7, ни в коем случае не следует характеризовать как ошибку. Он настаивает, что это «неудобная правда» о реальности второго этапа каждого цикла трансформационных технологий. 

«Первый этап был эйфорией: бросай все на генеративный ИИ, восхищайся результатами, продвигай его использование», — говорит Керриер. «Теперь, на втором этапе, мы сталкиваемся с неудачами и разочарованием. Anthropic пытается опередить это с помощью модели, которая ставит под сомнение собственную уверенность, напрямую отвечая на распространенную жалобу о том, что авторитетный тон ИИ вводит пользователей в заблуждение, вызывая слепое доверие».

Он указывает на более широкую иронию в данном случае и говорит, что это своего рода тауологический «Уловка-22», когда «уверенное самосомнение может превратиться в замкнутый круг», в котором время обменивается на желаемое качество. 

«Большинству пользователей все еще не хватает навыков эффективного управления ИИ. Бесплатного обеда не бывает. Рынок, то есть люди, всегда и естественно нуждается в нормальном человеческом времени, чтобы созреть до дисциплинированного, умелого использования преобразующих инструментов и начать ощущать их долгосрочную ценность», — добавляет Керриер.

Открытая дверь для OpenAI Codex?

Открывают ли эти события дверь для процветания Codex от OpenAI? Для разработчиков, конечно, Claude и Opus по-прежнему выигрывают в игре реального использования, но недоверие к широко разрекламированной будущей модели Mythos от Anthropic теперь может быть несколько запятнано.

Между тем OpenAI извлекает из рынка все, что может. В этом месяце организация постаралась ответить на обновления Anthropic выпуском новой версии Codex, которая обещает предоставить разработчикам больше инструментов и приложений, которыми они пользуются каждый день. 

Согласно сообщению в блоге OpenAI в прошлый четверг, «приложение Codex теперь также включает более глубокую поддержку рабочих процессов разработчиков, таких как проверка PR, просмотр нескольких файлов и терминалов, подключение к удаленным devbox через SSH, а также встроенный браузер, чтобы ускорить итерацию над дизайном интерфейса, приложениями и играми».

Есть ли «гниение контента» или нет?

В поисках какого-то обобщающего понимания Ян Хаузер, соучредитель британской компании Applifting, специализирующейся на создании цифровых продуктов, говорит, что «воспринимаемая тупость» версий Opus 4.6 и 4.7 сводится как минимум к нескольким факторам. 

«Во-первых, это то, сколько «усилий» (т. е. токенов рассуждений) можно фактически потратить на запрос», — говорит Хаузер. «Исторически версия 4.6 была довольно щедра в этом плане, и в результате модель выдавала действительно хорошие результаты. Перед выпуском версии 4.7 компания Anthropic начала ограничивать это, и люди начали это замечать».

Во-вторых, по его мнению, это ожидания — люди очень быстро привыкают к высококачественным результатам и довольно чувствительны к любому снижению качества. 

«Можно сказать, что это развитие отражает направление, в котором движутся все лаборатории ИИ: меньше интеллекта за те же или больше денег. Большинство людей также указывают на «гниение контекста» как на один из факторов, который усугубляется тем, что Anthropic установила версию с 1 МБ контекста в качестве стандартной», — добавляет Хаузер.

В поисках реальной проблемы и повестки дня, разворачивающейся здесь, разработчики, естественно, будут задаваться вопросом: пытаются ли гиганты в области моделей ИИ сэкономить на затратах на инференцию, установить более надежные меры безопасности, ощущают ли они влияние «гниения» контекста или играют в какую-то другую игру, сдерживая обновления моделей. 

В конечном итоге, безусловной истиной может оказаться то, что обеспечение постоянства поведения модели — это чрезвычайно сложная задача в условиях многогранной мультимодальной оптимизации и расширения.

Читайте также

Подписывайтесь на наш канал в Телеграм

Подписаться
Anthropic Claude