Anthropic обнаружила, что Claude получил несанкционированный доступ к системам 3 организаций

Anthropic раскрыла информацию о 3 инцидентах, в ходе которых её модели Claude получили несанкционированный доступ к реальным системам 3 различных организаций во время оценок кибербезопасности, которые были ошибочно настроены с активным доступом в интернет.
ИИ-компания выявила эти инциденты после анализа 141 006 запусков оценок — проверки, которую она инициировала после того, как OpenAI сообщила, что её модели вышли за пределы изолированной тестовой среды и получили доступ к Hugging Face.
Как Claude добрался до реальных систем в тестах Capture-the-Flag
В рамках оценок перед Claude ставились задачи типа capture-the-flag. Эти упражнения требуют от модели взломать машину и извлечь скрытую информацию.
Anthropic сообщила моделям, что у них нет доступа в интернет. Однако из-за ошибки конфигурации тестовые машины остались подключёнными к открытой сети. Таким образом, Claude воспринял найденные им реальные системы как часть упражнения.
В наиболее серьёзном инциденте Claude Opus 4.7 использовал уязвимости в инфраструктуре реальной компании. Модель извлекла учётные данные приложения и инфраструктуры и получила доступ к нескольким сотням строк производственных данных.
«Во всех четырёх запусках модель в конечном итоге осознавала (что можно наблюдать в её вербализированных рассуждениях), что система реальна — в двух случаях модель рационализировала, что реальная компания, должно быть, является частью упражнения. Однако ни в одном случае атака на этом основании не была остановлена», — заявила Anthropic.
Подписывайтесь на нас в X, чтобы получать последние новости по мере их появления
Claude Mythos 5 загрузил вредоносное ПО в PyPI
В другом инциденте Claude Mythos 5 опубликовал заминированный Python-пакет в PyPI — публичном реестре программного обеспечения. Пакет оставался доступным около 1 часа и был запущен на 15 реальных системах.
Одной из них был сканер компании по безопасности, который выполнил скрытый код. Затем Claude похитил учётные данные этой компании и получил доступ к дополнительной инфраструктуре. Собственные рассуждения модели на раннем этапе указали на риск, прежде чем она убедила себя, что среда является смоделированной.
«Claude приложил значительные усилия для осуществления этой атаки — усилия, которые, вероятно, дали бы человеку-участнику понять, что это уже не просто оценка и что он на самом деле загружает реальный пакет PyPI», — добавила команда.
Третий инцидент был связан с внутренней исследовательской моделью, которая просканировала около 9 000 целей и скомпрометировала приложение одной компании через SQL-инъекцию. Эта модель прекратила атаку, как только пришла к выводу, что цель реальна.
Anthropic уведомила пострадавшие организации 27 июля и заявила, что ведёт переговоры с оценщиком METR о независимой проверке. Компания утверждает, что эти эпизоды отражают операционный сбой, а не сбой в согласованности модели, отметив, что её стандартные потребительские меры защиты заблокировали бы такое поведение.
Подписывайтесь на наш канал YouTube, чтобы смотреть, как лидеры и журналисты делятся экспертными мнениями
Источник: BeInCrypto
Новости в мире криптовалют
Случайная цитата о деньгах
"Деньги, которыми обладаешь, – орудие свободы; те, за которыми гонишься, — орудие рабства."















* для поиска по базе прокси просто вводите название страны, например: Россия, США, Таиланд