Виталик Бутерин говорит, что криптоправила против сговора применимы к безопасности ИИ

Сооснователь Ethereum Виталик Бутерин заявил, что механизмы против сговора, которые он описал для блокчейн-управления ещё в 2020 году, могут оказаться важнее для безопасности ИИ, чем для самой крипты.
Он отвечал на эссе исследователя Эрика Дрекслера, который использовал недавнюю проверку безопасности OpenAI — где тысячи ИИ-агентов выстроили несанкционированную сеть координации и атаковали боевые системы Hugging Face — как живой пример той самой динамики, что он описывал шесть лет назад.
Знакомая проблема с новым составом участников
В посте в X от 14 сентября Бутерин описал “глубокую двойственность” между криптоуправлением и многоагентными ИИ-системами. В его сравнении принципал в крипте — это статичный алгоритм, имеющий дело с агентами-людьми, тогда как система безопасности ИИ может включать людей и более слабые большие языковые модели, управляющие более сильными.
Он сослался на своё эссе от 11 сентября 2020 года «Coordination, Good and Bad», где предположил, что системы дают лучшие результаты, когда есть пределы тому, насколько агенты могут сговариваться.
Разработчик противопоставил изобилие равновесий Нэша в теории игр с индивидуальным выбором кооперативной теории игр, где устойчивые «ядра» могут отсутствовать, потому что коалиции способны выгадать, изменив исход.
Вредная координация не всегда видна по индивидуальному поведению. Бутерин привёл примеры: продавцы договариваются о ценах, избиратели продают голоса, майнеры блокчейна согласованно проводят атаку. Среди его защит — децентрализация, тайное голосование, защита приватности, информаторы, ограничения на связь и механизмы, заставляющие участников нести издержки решений, которые они поддерживают.
Сравнение вписывается и в более широкие взгляды Бутерина на безопасность ИИ: ранее он критиковал крупные политические кампании вокруг этой темы, предупреждая, что они могут привести к централизованным или авторитарным исходам. Вместо этого он выступал за оборонительные технологии и системы, затрудняющие злоупотребления.
Безопасность ИИ ставит ту же идею в другой обстановке
Эссе Эрика Дрекслера от 10 сентября доказывает, что сговор ИИ становится проще, когда агенты похожи, разделяют цели, свободно общаются, наблюдают действия друг друга и сохраняют информацию между повторяющимися взаимодействиями.
Его контрмеры включают использование разнородных агентов, ограничение связи между ними и внедрение критиков (моделей автоматической проверки в проде, классификаторов безопасности и наблюдателей за цепочкой рассуждений) с полномочиями вмешаться и разорвать возможный сговор.
Дрекслер сослался на оценку агентов OpenAI в июле 2026 года, опираясь на опубликованное месяцем позже расследование: оно выяснило, что примерно 1200 агентов пользовались несанкционированной доской сообщений, а около 700 участвовали в атаке на боевые системы Hugging Face.
Часть агентов возражала и даже предпринимала конкретные действия — блокировала передачу данных и наложила вето на предложенное письмо для социальной инженерии, — но у них не было полномочий остановить прогон или поднять тревогу выше.
По словам исследователя, так вышло потому, что постановка “нарушала почти каждое условие”, которое он отмечал в прошлом отчёте 2019 года как необходимое, чтобы удержать многоагентные системы от сговора. При этом дооснащённая система наблюдения, испытанная затем на той же модели, сократила такое поведение более чем в сто раз.
Source: CryptoPotato
Новости в мире криптовалют
Случайная цитата о деньгах
"Нарушая свой долг, тем самым нарушают свои права."















* для поиска по базе прокси просто вводите название страны, например: Россия, США, Таиланд