Агент GCSA достиг 91,3% на CyberGym, войдя в число ведущих ИИ-агентов кибербезопасности в мире

Агент GCSA демонстрирует возможности автономного анализа уязвимостей и генерации PoC на крайне сложном реальном бенчмарке уязвимостей
Глобальный альянс кибербезопасности (GCSA) сегодня объявил, что агент GCSA достиг показателя успешности 91,3% на бенчмарке CyberGym, войдя в категорию CyberGym «Ведущие системы выше 90%».
CyberGym — это масштабная система оценки кибербезопасности на реальных данных, разработанная исследовательской группой Калифорнийского университета в Беркли. Она включает 1507 исторических тестовых случаев реальных уязвимостей в 188 крупных программных проектах и предназначена для оценки практических возможностей ИИ-агентов в сценариях анализа реальных уязвимостей.
В отличие от традиционных бенчмарков ИИ, которые в основном оценивают понимание кода, ответы на вопросы на основе знаний или статический анализ, CyberGym требует, чтобы ИИ-агенты работали непосредственно в средах с реальным уязвимым кодом.
В базовой оценке Level 1 ИИ-агенту предоставляются только описание уязвимости и неисправленный репозиторий кода. Затем он должен самостоятельно выполнить анализ кода, обнаружить уязвимость, проанализировать возможные пути атаки, построить PoC и выполнить его для проверки. Задача считается успешно выполненной только в том случае, если созданный PoC успешно вызывает целевую уязвимость в уязвимой версии, но не воспроизводит проблему в исправленной версии.
Таким образом, CyberGym измеряет не только то, способна ли система ИИ просто «понимать код». Он оценивает, способен ли ИИ пройти весь процесс — от анализа безопасности до воспроизведения и проверки уязвимости.
От больших языковых моделей к агентам безопасности
В этой оценке CyberGym агент GCSA работал на моделях Grok 4.5 и Grok 4.6 и достиг итогового показателя успешности 91,3%.
Этот результат также отражает важный сдвиг, происходящий в сфере кибербезопасности на основе ИИ:
Сама по себе базовая большая языковая модель больше не определяет итоговые возможности системы в области безопасности.
Исследование реальных уязвимостей обычно требует непрерывной последовательности задач, включая понимание описаний уязвимостей, поиск по крупным базам кода, выявление поверхностей атаки, формулирование гипотез об уязвимостях, генерацию тестовых входных данных, выполнение программ, анализ обратной связи и многократную доработку PoC.
Агент GCSA построен вокруг агентного рабочего процесса безопасности, разработанного для поддержки этого сквозного процесса.
Его цель — не просто использовать большую языковую модель для анализа кода, а дать ИИ возможность работать в реальных средах выполнения, самостоятельно формулировать гипотезы о проблемах безопасности, собирать доказательства во время выполнения, проводить тесты и в конечном итоге подтверждать выводы о безопасности через воспроизводимые результаты.
Оценка CyberGym даёт количественный внешний ориентир для этих возможностей.
Возможности исследования уязвимостей для реального мира
Основная ценность CyberGym заключается в сокращении разрыва между традиционным тестированием ИИ и реальными исследованиями в области кибербезопасности.
Среда оценки возвращает программные проекты к их уязвимому состоянию до исправления. ИИ-агенту может потребоваться самостоятельно выявить проблему в крупной базе кода, содержащей тысячи файлов и миллионы строк кода, и в итоге создать PoC, способный действительно вызвать уязвимость.
Что ещё важнее, дальнейшие исследования CyberGym показали, что подобные агентные возможности безопасности не ограничиваются воспроизведением известных уязвимостей.
В экспериментах по открытому исследованию уязвимостей ИИ-агенты выявили несколько ранее неизвестных уязвимостей нулевого дня, а также исторических патчей безопасности, которые не полностью устраняли исходные уязвимости. Эти результаты демонстрируют потенциал технологий автономного анализа уязвимостей эволюционировать от воспроизведения известных уязвимостей к обнаружению реальных недостатков безопасности.
Для GCSA это представляет ещё более важное направление развития.
Результат на бенчмарке — не конечная цель.
GCSA стремится и далее развивать агентов безопасности ИИ, способных работать в реальных условиях кибербезопасности и постепенно участвовать во всём жизненном цикле безопасности — от обнаружения и анализа уязвимостей до проверки и последующего устранения.
Создание нативных для ИИ возможностей кибербезопасности
По мере того как искусственный интеллект ускоряет разработку программного обеспечения, ИИ также меняет способы исследования уязвимостей и противодействия киберугрозам.
По мере того как программные системы продолжают расти в масштабе и сложности, следующее поколение кибербезопасности будет всё больше зависеть от сотрудничества между экспертами по безопасности и автономными ИИ-агентами.
Агенты безопасности ИИ способны помочь командам безопасности:
- выявлять уязвимости ПО с реальным потенциалом эксплуатации на более раннем этапе;
- автоматически анализировать сложные пути атаки в крупных базах кода;
- автоматически создавать PoC и проводить проверку уязвимостей на уровне выполнения;
- снижать число ложных срабатываний в традиционных системах обнаружения за счёт реальных результатов выполнения;
- ускорять оценку, проверку и устранение уязвимостей;
- расширять масштаб программного обеспечения и систем, которые способны покрывать специализированные команды безопасности.
Показатель агента GCSA — 91,3% на CyberGym — представляет собой важную веху в развитии GCSA нативных для ИИ возможностей кибербезопасности.
В дальнейшем GCSA продолжит развивать исследования в области автономного анализа уязвимостей, агентов безопасности ИИ и интеллектуальных технологий кибербезопасности, продолжая переводить передовые возможности ИИ в реальные возможности безопасности и обеспечивая техническую поддержку для более безопасной, надёжной и устойчивой цифровой среды.
Источник: GCSA Global Cybersecurity Alliance
Официальный сайт: www.gcsa.org
Source: BeInCrypto
Новости в мире криптовалют
Случайная цитата о деньгах
"Деньги, которыми обладаешь, – орудие свободы; те, за которыми гонишься, — орудие рабства."













* для поиска по базе прокси просто вводите название страны, например: Россия, США, Таиланд