Блог

Grok 4.5 от SpaceXAI предлагает цены на кодирующих агентов ниже, чем у Anthropic и OpenAI

SpaceXAI выпустила Grok 4.5 - первую модель, разработанную совместно с Cursor после приобретения этой платформы для программирования с помощью ИИ, - и эта новинка явно ориентирована на инженерные команды, внимательно следящие за расходованием своих токенов. Grok 4.5 создана для превосходного выполнения задач по программированию, агентским задачам и интеллектуальной работе, и это самая мощная модель, выпущенная SpaceXAI на данный момент. Кроме того, согласно собственному заявлению Cursor, это первая модель, разработанная компанией за пределами сферы программной инженерии.

Эта более широкая сфера применения находит отражение в подходе к обучению. Ранее Cursor создала Composer 2.5 как специалиста по программированию. При разработке Grok 4.5 команда намеренно расширила набор обучающих данных, включив в него высококачественные задачи в области STEM, научные статьи и другие виды интеллектуальной работы, что позволяет модели эффективно работать в различных областях, выходящих за рамки программирования. В основе набора данных лежали в значительной степени собственные модели поведения Cursor - триллионы токенов, отражающих то, как разработчики взаимодействуют с кодовой базой и как агенты-программисты ведут себя в реальных средах.

Само обучение является совместным проектом SpaceXAI и Cursor. Grok 4.5 работал на десятках тысяч графических процессоров Nvidia GB300, а обучение с подкреплением сыграло ключевую роль в совершенствовании его способности решать задачи. Команда разработала среды для обучения с подкреплением, достаточно сложные, чтобы заставить передовые модели «спотыкаться», поскольку задачи, которые больше не представляют для модели вызова, перестают учить её чему-либо новому. Чтобы создать такие среды в большом масштабе, Cursor использовала распределённую систему агентов, в которой инженеры определяют задачу и метод её проверки, а затем позволяют большим группам агентов строить и дорабатывать среду - работа, которая в противном случае заняла бы сотни инженеров в течение нескольких месяцев.

Оценка по цене и производительности

Независимые тесты подтверждают часть этой оценки, хотя и с некоторыми оговорками. Artificial Analysis поместила Grok 4.5 на четвёртое место в своём «Индексе интеллекта» (Intelligence Index), уступив Fable 5, GPT-5.5 и Opus 4.8, а также на четвёртое место в рейтинге GDPval-AA v2, уступив лишь последним версиям Claude от Anthropic. Где он действительно выделяется, так это в эффективности: Grok 4.5 использовал в среднем примерно на 60 % меньше токенов вывода, чем Opus 4.8, при выполнении тех же задач по индексу интеллекта, и почти на четверть меньше общего количества токенов, которые потребовались Fable 5 в рамках Claude Code для эквивалентной работы агента-программиста. Собственные данные Cursor подтверждают это: при выполнении задач SWE-Bench Pro модель в среднем использовала менее 16 000 токенов вывода, что примерно в 4,2 раза меньше, чем у Opus 4.8 в том же сравнении.

Стоит обратить внимание на мелкий шрифт в таблице результатов тестирования Cursor. Компания сообщила, что более ранняя версия кодовой базы Cursor была случайно включена в обучающие данные Grok 4.5, что дало ему преимущество в тестах CursorBench, которое, по словам Cursor, невозможно полностью количественно оценить - с тех пор эти данные были удалены из последующих циклов обучения. Это небольшое примечание о прозрачности, но его стоит отметить для тех, кто воспринимает диаграммы тестов как истину в последней инстанции.

Обновлены меры безопасности

Те же преимущества в использовании инструментов, которые делают Grok 4.5 полезным для инженерной работы, также повышают риск его злоупотребления, и Cursor напрямую решила эту проблему. Компания обновила свой подход к обнаружению и блокировке злоумышленников, вместо того чтобы незаметно понижать уровень интеллекта или тихо переключаться на более слабую модель. Заявленная цель - сохранить легитимную работу по обеспечению безопасности, включая обнаружение уязвимостей и исправление ошибок, одновременно ограничивая рабочие процессы, которые с наибольшей вероятностью могут нанести вред.

«Передовые модели кодирования все чаще соревнуются по экономике вывода - то есть по стоимости выполнения инженерных работ в масштабах производства», - сказал Митч Эшли, вице-президент и руководитель практики по инженерии жизненного цикла программного обеспечения и разработке программного обеспечения на базе ИИ в The Futurum Group. «Эффективность токенов стала первостепенной переменной при закупках, поскольку именно объем вывода, а не каталожная цена, определяет стоимость задач, выполняемых агентами», - добавил Эшли. «Выбор модели теперь входит в сферу разработки платформы как решение по управлению портфелем, причем ключевым показателем является стоимость одного проверенного результата». «Снижение стоимости генерации данных перенаправляет расходы на проверку результатов работы агентов, и именно эти затраты на проверку определяют реальную цену автономности», - отметил он. «Открытым остается вопрос о том, кто занимается оптимизацией конвейера ИИ в соответствии с выбранной моделью по мере её изменения».

Что это означает для инженерных команд

Более важным моментом является то, как это влияет на дискуссию о ценообразовании на рынке кодирования с использованием ИИ. Когда модель, стоимость которой значительно ниже, чем у Opus 4.8, демонстрирует результаты тестирования примерно на том же уровне - даже если они не являются лучшими в категории - команды, которые до сих пор рассматривали передовую помощь в программировании как фиксированную и дорогостоящую статью расходов, теперь получают в своё распоряжение более дешёвый рычаг влияния. Стоит ли это сохранится после завершения внедрения в ЕС и появления данных о более широком использовании - вот что стоит наблюдать дальше.

Читайте также

Подписывайтесь на наш канал в Телеграм

Подписаться
Anthropic Grok OpenAI SpaceX