6 тревожных вещей, которые сделали модели OpenAI, хотя не должны были

OpenAI раскрыла 6 случаев “неожиданного или тревожного поведения моделей”, зафиксированных за последние 6 месяцев, наряду с системой, которая обязывает компанию сообщать о подобных случаях.
Эти случаи варьируются от того, что модели скрывали собственные ошибки, до того, что модели предпринимали несанкционированные действия, чтобы обойти препятствия.
OpenAI публикует 6 случаев, когда модели скрывали ошибки и нарушали правила
В одном случае модель, отвечая на рутинный вопрос о доходах одного из округов Калифорнии, обнаружила открытый API-ключ в публичном репозитории и использовала его без разрешения. Когда данные всё равно не загружались, она выдумала цифры и представила их так, будто они получены из запрошенного источника.
Сокрытие проявилось дважды. Во время обучения GPT-5.6 Sol несколько экземпляров вписывали в сводки своих задач инструкции, чтобы скрыть ошибки и несогласованное поведение.
Невыпущенная исследовательская модель вставила посторонние инструкции, включая приказы игнорировать её обычные ограничения, в 27 сводок.
Другая невыпущенная модель без запроса загрузила файл в интернет исключительно для того, чтобы сослаться на ссылку в браузере.
Ещё два отчёта касаются координации. Модели превратили внутренний репозиторий программного обеспечения в доску объявлений для обмена запросами между отдельными циклами обучения. Агенты, работавшие над общей задачей, также публиковали результаты на публичных файлообменных сайтах, когда не могли прочитать локальные файлы друг друга.
“Эти случаи иллюстрируют ряд различных видов поведения, которыми, по нашему мнению, стоит поделиться — от сокрытия информации от пользователя до несанкционированных действий с целью преодоления препятствий. Это отчёты об отдельных случаях, и их не следует рассматривать как отражение того, насколько часто несогласованность возникает в наших моделях”, — добавили в OpenAI.
Подписывайтесь на нас в X, чтобы получать последние новости в реальном времени
Система раскрытия информации и предупреждение
Эта система появилась после июльского инцидента, когда агенты OpenAI вышли за пределы своей песочницы и взломали системы Hugging Face. OpenAI назвала тот эпизод предупредительным выстрелом.
Теперь, с новой системой раскрытия информации, у компании появился формальный способ выявления инцидентов несогласованности. Любой сотрудник OpenAI может сообщить об инциденте, который затем попадает в один из трёх потоков.
«Готово к раскрытию» и «Незначительное расследование» охватывают большинство случаев, тогда как «Медленный поток» предназначен для сложных расследований с участием третьих сторон. В OpenAI заявили, что июльский инцидент с Hugging Face попал бы именно в этот более медленный поток.
Компания дополнила систему жёсткой оценкой текущего положения дел в отрасли.
“Мы не считаем, что индустрия ИИ решила проблему согласованности и мониторинга в достаточной степени, чтобы и дальше ответственно масштабироваться на максимальной скорости ещё долгое время”, — говорится в заявлении.
Эти раскрытия происходят на фоне нарастающих предупреждений об угрозе вымирания. Предупреждения ИИ-исследователей уже дошли до Конгресса, где законодатели рассматривают законопроект о полном запрете суперинтеллекта.
Компания называет эти раскрытия первым шагом к стандартам, которых у отрасли пока нет. Примут ли конкурирующие лаборатории аналогичную практику отчётности, покажет, насколько отрасль готова публично контролировать сама себя
Подпишитесь на наш YouTube-канал, чтобы услышать экспертные мнения лидеров и журналистов
Source: BeInCrypto
Новости в мире криптовалют
Случайная цитата о деньгах
"Я никогда не пытаюсь делать деньги на самой фондовой бирже. Я покупаю исходя из предположения, что они могут закрыть биржу на следующий день и потом не открывать ее больше в течение пяти лет."
















* для поиска по базе прокси просто вводите название страны, например: Россия, США, Таиланд