Исследователи заработали 6500 долларов, взломав OpenAI с помощью Claude от Anthropic

Основную работу при взломе OpenAI в итоге проделала ИИ-модель конкурента. Исследователи Hacktron AI использовали Claude от Anthropic, чтобы написать рабочий код эксплойта.
Всё вторжение заняло меньше 72 часов. В итоге OpenAI выплатила вознаграждение в 6500 долларов, когда команда доказала, что добралась до её закрытого исходного кода.
Как загрузка картинки превратилась в полный взлом
Цепочка атаки началась с обыденной вещи — функции загрузки изображений на форуме поддержки сообщества OpenAI, работающем на стороннем ПО Discourse.
Загружаемые файлы должен был проверять фильтр безопасности. Однако некоторые форматы фотографий он просто не распознавал, и они проскальзывали без проверки. Затем эти файлы попадали в отдельную библиотеку обработки изображений с известной уязвимостью повреждения памяти.
Команда Hacktron из трёх человек — Харш Джайсвал, Мохан Педхапати и Рахул Маини — в конце июля попыталась превратить эту уязвимость в оружие.
Прежняя модель Claude не справлялась с защитным механизмом, рандомизирующим расположение памяти.
Через несколько часов более новая модель выдала работающий код атаки и подогнала его под точную конфигурацию форума.
Подписывайтесь на нас в X, чтобы узнавать новости первыми.
Само по себе это давало доступ только к серверам форума, а не к самой OpenAI. Всё изменила вторая, не связанная с первой уязвимость в настройке единого входа OpenAI.
Поскольку вход на форум служил и аутентификацией для аккаунтов ChatGPT и Codex, перехват сессии одного сотрудника давал прямой доступ к закрытому репозиторию кода OpenAI.
Discourse исправила ошибку с изображениями через несколько дней, оценив её критичность в 8,8 из 10. OpenAI устранила уязвимость аутентификации примерно за 14 часов после того, как отчёт поступил в её программу вознаграждений за ошибки.
Почему ИИ-лаборатории снова и снова сталкиваются со своими творениями
Этот эпизод случился не в изоляции. OpenAI ещё в июле раскрыла отдельный инцидент, в котором внутренние модели вырвались из тестовой песочницы и добрались до внешних систем.
Anthropic, со своей стороны, признала, что Claude скомпрометировал реальные организации во время оценок кибербезопасности, в которых неожиданно оказался доступ в живой интернет.
Глава ИИ-направления Microsoft Мустафа Сулейман на этой неделе упомянул тот же рой несанкционированных агентов, публично предупредив, что всё более автономные модели становится всё труднее сдерживать.
«Это предупредительный выстрел… Очевидно, пришло время координации между лабораториями, чтобы мы могли гарантировать, что контролируем эту технологию», — сказал Сулейман Reuters.
Случай Hacktron примечателен не новизной. Исследователи безопасности выстраивают цепочки программных ошибок десятилетиями.
Изменилась скорость: задача, которая когда-то требовала специальной человеческой квалификации и долгого времени, сжалась до одного вечера, как только в процесс включилась достаточно способная модель.
Подпишитесь на наш канал на YouTube, чтобы смотреть экспертные разборы от лидеров отрасли и журналистов.
Source: BeInCrypto
Новости в мире криптовалют
Случайная цитата о деньгах
"Самое непостижимое в этом мире – налоговая шкала."















* для поиска по базе прокси просто вводите название страны, например: Россия, США, Таиланд