Anthropic обнаружила в моделях Claude структуру, которую не проектировала

Anthropic сообщила, что нашла внутри своих моделей Claude структуру, которую никто не проектировал и не ожидал. Компания назвала её «J-space» и описывает как когнитивное пространство, общее для разных частей модели. Исследование опубликовано 6 июля и, по оценке компании, заметно продвигает понимание того, что происходит внутри больших языковых моделей.
Что такое J-space
По описанию Anthropic, J-space — внутренняя область, куда модель складывает и откуда забирает ключевую информацию во время работы: своего рода общая доска внутри ИИ. Когда Claude отвечает на вопрос, решает задачу или следует инструкции, важные детали, судя по всему, попадают в это общее пространство, и ими могут пользоваться разные части модели.
Обнаружить структуру удалось с помощью инструмента «J-lens», который позволяет наблюдать, как информация перемещается внутри Claude при выполнении задачи. По данным компании, J-space возник в ходе обучения сам — Anthropic его не закладывала. Идея перекликается с нейробиологической теорией «глобального рабочего пространства», описывающей, как мозг делает важную информацию доступной сразу нескольким процессам. Anthropic утверждает, что Claude способен описать содержимое своего J-space по запросу и изменить его по инструкции, а прямое вмешательство исследователей в J-space меняло ответы модели и качество выполнения задач.
Зачем это нужно для безопасности
Компания видит в находке инструмент для безопасности ИИ: наблюдение за активностью J-space потенциально позволяет выявлять скрытые мотивы поведения модели и распознавать атаки — например, попытки prompt-инъекции, рассчитанные на подмену вывода. При этом масштаб находки ограничен: подавляющая часть обработки информации в Claude по-прежнему идёт вне J-space. Реализацию J-lens компания выложила в открытый доступ вместе с демо на Neuronpedia, предложив исследовательскому сообществу проверить выводы.
Работа продолжает более раннюю линию исследований: отчёт о зарождающейся интроспекции у моделей вышел в октябре 2025 года, а инициативы по «благополучию моделей» компания запустила в апреле 2025-го. Anthropic отдельно подчёркивает, что не утверждает наличия у Claude сознания или субъективного опыта: в статье используется формулировка «сознательно доступная» информация, но без такого вывода.
Источник: BeInCrypto
Новости в мире криптовалют
Случайная цитата о деньгах
"Не почитай денег ни больше, ни меньше, чем они того стоят; это хороший слуга и плохой господин."















* для поиска по базе прокси просто вводите название страны, например: Россия, США, Таиланд