Капитализация —Объём 24ч —BTC —Индекс страха —
MasterInvestИнвестиции & Заработок
Реклама
Реклама

Grok 4.5 возглавил агентский тест, подтвердив заявление Маска об «уровне Opus»

Grok 4.5 возглавил агентский тест, подтвердив заявление Маска об «уровне Opus»

Илон Маск называл Grok 4.5 моделью «уровня Opus», которая при этом работает быстрее и стоит дешевле. Теперь у этого заявления появилось подтверждение со стороны независимого агентского бенчмарка: в тесте AutomationBench-AA от Artificial Analysis Grok 4.5 занял первое место с результатом 51,4% при стоимости $0,34 за задачу, обойдя Claude Fable 5 (48,6%) и Claude Opus 4.8 (48,5%).

Независимая проверка слов Маска

Grok 4.5 вышел на этой неделе; модель построена на базе V9 с 1,5 трлн параметров. Изначально аргументы Маска опирались на внутренние ранние оценки.

AutomationBench-AA меняет картину: Artificial Analysis проводит бенчмарк самостоятельно и держит набор задач закрытым, чтобы избежать «загрязнения» обучающих данных. Тест охватывает 657 задач в 40 симулированных приложениях, включая Gmail, Slack, Salesforce и HubSpot, и оценивает долю целей, которые агент выполняет, не нарушая защитных ограничений.

Дешевле, быстрее и в основном в рамках правил

Стоимость $0,34 за задачу у Grok 4.5 оказалась значительно ниже, чем $1,35 у Fable 5 и $1,46 у Opus 4.8. Ближе всех подошёл Gemini 3.5 Flash с $0,49.

Модель расходовала около 8000 выходных токенов на задачу — примерно четверть от показателя Opus 4.8. Именно эта эффективность объясняет большую часть разрыва в стоимости и совпадает с тем, как Маск подавал модель на запуске.

«Её суммарное потребление токенов в 0,44 млн на задачу — одно из самых низких в таблице лидеров. Низкая стоимость обусловлена как этой эффективностью, так и низкими ценами на токены», — заявили в Artificial Analysis

Кроме того, Grok 4.5 выполнил 79,9% целей и полностью прошёл 21,9% задач. В финансах — самом сложном домене — модель лидировала с 71% против 64% у Fable 5 и 62% у Opus 4.8.

При этом правил модель нарушала чаще ближайших конкурентов: на её счету 0,63 нарушения защитных ограничений на задачу — против 0,55 у Opus 4.8 и 0,46 у Gemini 3.5 Flash. Для компаний, которые запускают агентов в боевые финансовые системы, этот разрыв важен: одно нарушение может обернуться реальными издержками.

Источник: BeInCrypto

Ещё по теме «Новости в мире криптовалют»

Все записи
Случайная цитата о деньгах
Щедрость доходнее скупости.
— Лион Фейхтвангер

Интересное в других разделах

Весь блог

Комментарии 0

Комментариев пока нет

Станьте первым, кто поделится мнением или опытом по теме статьи.

Реклама