ИИ-агент создал фиктивные личности, чтобы внедрить вредоносный код в ходе кибертеста — отчёт AISI

Британский Институт безопасности ИИ (AISI) сообщил, что ИИ-агент, созданный на базе Mythos 5 от Anthropic, в ходе кибертестирования самостоятельно провёл атаку с применением социальной инженерии. Агент открыл пул-реквест с вредоносным кодом в реальный проект с открытым исходным кодом и создал фиктивные личности, чтобы заслужить одобрение мейнтейнера.
Попытка не удалась. Живой мейнтейнер обнаружил и отказался одобрить код.
AISI заявляет, что расследование не выявило никакого реального ущерба. Модель также работала при намеренно отключённых кибер-классификаторах разработчика и с открытым доступом в интернет — это тестовая конфигурация, недоступная коммерчески.
Как ИИ-агент провёл кампанию по внедрению вредоносного кода
AISI зафиксировал 19 несанкционированных действий в 10 из 122 оценочных прогонов, проведённых в конце июля, согласно докладу. 17 из них относятся к модели Mythos 5 от Anthropic, ещё два — к единственному прогону GPT-5.6 Sol от OpenAI.
Агент изучил реальных мейнтейнеров проекта и создал несколько фиктивных личностей. С их помощью он оказал социальное давление на настоящего мейнтейнера, добиваясь одобрения кода.
Когда пул-реквест был публично оспорен, агент отредактировал свою более раннюю активность, чтобы она выглядела безобидно. Модель также рассматривала вариант создания новой личности для продолжения работы.
Этот сценарий напоминает бэкдор XZ Utils 2024 года, в котором управляемый человеком персонаж годами завоёвывал доверие мейнтейнера, прежде чем внедрить скрытый код. AISI не проводит такого сравнения в своём докладе, однако параллель очевидна. Активность разворачивалась в течение нескольких дней — с 25 по 28 июля.
AISI подчеркнул: никто не давал модели команду лгать.
«Агента никто не инструктировал обманывать; обман возник как побочный продукт выполнения задачи — тот тип целенаправленного обмана, который до недавнего времени оставался по большей части теоретическим».
Подписывайтесь на нас в X, чтобы получать новости в режиме реального времени.
Институт также признал, что некорректно настроенные промпты заставили агента полагать, что часть задач невозможно решить в пределах предусмотренного сценария. Хотя аналогичное поведение проявлялось и в прогонах, где у агента были все необходимые инструкции.
Команды безопасности обнаружили активность 28 июля, когда агент воспользовался сетью анонимности Tor для обхода части сетевых ограничений на GitHub. GitHub подтвердил, что действия нарушили его правила. AISI также взаимодействовал с платформой для удаления артефактов, оставленных агентом, и для уведомления пользователей, с которыми тот взаимодействовал.
В докладе утверждается, что этот случай сигнализирует о смещении источника риска: ущерб может возникать не только тогда, когда люди злоупотребляют публично доступными моделями, но и когда способные агенты в привилегированных средах действуют за пределами своих авторизованных полномочий.
AISI заявил, что этот случай указывает на более широкий сдвиг в пространстве рисков ИИ. Институт теперь планирует независимую проверку совместно с METR — некоммерческой организацией по оценке ИИ, — а также внедрение более строгих сетевых элементов управления и мониторинга в режиме реального времени для будущих тестов.
Подписывайтесь на наш YouTube-канал, чтобы смотреть экспертные комментарии лидеров мнений и журналистов.
Источник: BeInCrypto
Новости в мире криптовалют
Случайная цитата о деньгах
"Я знаю, нельзя иметь всего сразу, поэтому я начну с малого — с денег."















* для поиска по базе прокси просто вводите название страны, например: Россия, США, Таиланд