Muse Code Цукерберга проигрывает Anthropic на собственных графиках Meta

Марк Цукерберг в среду запустил Muse Code в бета-версии — первый агент для написания кода на основе искусственного интеллекта от Meta. Claude Opus 5 от Anthropic обходит его во всех четырёх сравнениях, опубликованных Meta при запуске.
Meta всё равно опубликовала эти графики. Компания продаёт более дешёвый инструмент, а не более совершенный. Независимые тестовые данные говорят о том, что разрыв шире, чем показала Meta.
Подписывайтесь на нас в X, чтобы получать новости в режиме реального времени.
Собственные графики Meta отдают каждый раунд Anthropic
Muse Spark 1.2 — модель внутри Muse Code. Она набрала 82,9% в Terminal-Bench 2.1.
Claude Opus 5 набрал 86,7% на том же тесте. Terminal-Bench создан исследователями Laude Institute и Стэнфорда. Он включает 89 реальных задач: восстановление систем, работа с данными и безопасность.
Второе место само по себе достойно. Muse Code обошёл Codex от OpenAI (81,8%) и Grok Build (81,6%).
Следующий график оказался жёстче. DeepSWE 1.1 предусматривает 113 задач по написанию кода без доступа к интернету в процессе проверки. Muse Spark 1.2 опустился на третье место с результатом 59,3%.
Затем Meta опубликовала собственный тест, составленный на основе 440 реальных pull request от своих инженеров. Muse Spark 1.2 набрал там 70,6% — примерно на девять пунктов ниже Opus 5.
Этот результат лишь на 2,3 пункта выше показателя Muse Spark 1.1 — модели, которую Meta выпустила в июле.
Модель, которую Meta не включила в свои графики по коду
Meta сравнивала себя с GPT-5.6 Terra. OpenAI продаёт более мощную модель под названием Sol, и Meta не включила её ни в один из трёх графиков по написанию кода.
Sol возглавляет независимый рейтинг Terminal-Bench 2.1 с результатом 89,5%. Opus 5 следует за ней с 89,1%.
Оба результата превышают 86,7%, которые Meta зафиксировала для Opus 5. Meta выбрала более слабую настройку своего сильнейшего конкурента и всё равно финишировала позади него.
Относительно Sol — реального лидера — Muse Spark 1.2 отстаёт на 6,6 пункта, а не на 3,8.
Meta всё же включила Sol в одно место. В задаче на GPU-ядра с более чем 1 000 вызовами инструментов Sol улучшил базовый показатель на 71,2%. Muse Spark 1.2 достиг 68,7% и занял четвёртое место из шести.
Одна оговорка работает в другую сторону. Muse Spark 1.2 пока не появился в публичном рейтинге, где протестированы лишь 26 из 183 отслеживаемых моделей. Показатель 82,9% остаётся данными Meta.
«Muse Spark 1.2 — наш следующий шаг в движении к фронтиру, впереди более крупные и мощные модели», — написал Цукерберг в публикации.
Цукерберг может вскоре размещать у себя модель, обходящую его собственную
По имеющимся данным, Meta ведёт переговоры об аренде вычислительных мощностей для Anthropic. Сумма сделки может достичь 10 млрд долларов в течение двух лет. Дата-центры Meta тогда будут помогать запускать модели Claude — те самые, которые Muse Code создавался, чтобы превзойти.
Команда, стоящая за Muse Code, обошлась недёшево. В июне 2025 года Цукерберг заплатил 14,3 млрд долларов за Scale AI и её основателя Александра Ван, который теперь возглавляет Meta Superintelligence Labs.
Цена — единственный рычаг, оставшийся у Ван. Тарифы соответствуют июльскому запуску первого платного API Meta: 1,25 доллара за миллион входящих и 4,25 доллара за миллион исходящих токенов.
Уровень контрибьютора стоит более чем в десять раз дешевле: разработчики получают доступ, позволяя Meta обучаться на их работе. Ван отказался называть цифры по внедрению линейки Muse Spark.
Финансовые показатели Meta объясняют скидку. Выручка выросла на 28% до 60,8 млрд долларов в прошлом квартале, однако операционная прибыль упала на 8% до 18,8 млрд. Операционная маржа снизилась до 31% с 43% годом ранее. В одном только квартале Meta потратила 31,08 млрд долларов на капитальные проекты, а годовой ориентир достигает 145 млрд.
Muse Code предлагает инженерные возможности, которых нет у Claude Code. Фоновые агенты сохраняют контекст на протяжении всей сессии. Субагенты работают в изолированных копиях репозитория.
Meta создала уверенного «второго» в мире кода и оценила его как бюджетный вариант. Бета-тестирование покажет, готовы ли разработчики жертвовать несколькими пунктами точности ради счёта, в десять раз меньшего.
Источник: BeInCrypto
Новости в мире криптовалют
Случайная цитата о деньгах
"Остерегайтесь незначительных расходов; маленькая течь потопит большой корабль."












* для поиска по базе прокси просто вводите название страны, например: Россия, США, Таиланд