Исследователи обнаружили в Claude аналог сознания

Исследовательская группа Anthropic опубликовала масштабное научное изыскание под названием "Verbalizable Representations Form a Global Workspace in Language Models". Благодаря инновационному математическому методу специалистам удалось выявить скрытые логические цепочки, которые развились внутри языковой модели Claude без прямого вмешательства программистов.
Что открыли ученые в недрах Claude
В ходе исследования обнаружена особая зона внутренней активности нейросети, получившая название J-space. Это ограниченный сегмент, где модель содержит абстрактные понятия, анализирует их и трансформирует при необходимости. Архитектура возникла как естественный эволюционный ответ на сложные вычислительные задачи.
Ученые провели прямую параллель с нейробиологической теорией глобального рабочего пространства. Согласно этой концепции, человеческий мозг функционирует как театр: десятки специализированных подсистем работают параллельно за кулисами, но только узкий луч прожектора выносит информацию на сцену — это и составляет сознательный опыт.
Исследовать скрытые процессы помог инструмент Jacobian lens (J-lens), позволяющий увидеть, какие понятия модель использует во время внутренних "размышлений", еще до формирования ответа. К примеру, при вопросе о цвете четвертой планеты от Солнца Claude сначала внутренне активирует концепт "Марс", а затем составляет ответное высказывание.
Пять подтверждений человекоподобного мышления
Для проверки того, действительно ли J-space работает как аналог осознанного доступа, команда провела пять успешных тестирований. Первый тест — словесный отчет: когда Claude спрашивают, о чем он размышляет, модель называет именно те понятия, активированные в J-space. Искусственная замена вектора "Футбол" на "Регби" мгновенно изменяла ответ.
Второй тест — направленная модуляция: если указать модели "думать о цитрусовых" при выполнении посторонней задачи, J-space заполнялся маркерами "лимон" и "апельсин", хотя в исходном тексте их не было. Третий тест показал внутреннее рассуждение: при решении логических задач модель четко формирует промежуточные концепты в средних вычислительных слоях.
Четвертый тест выявил гибкую обобщенность: один активированный маркер страны автоматически транслировался на все связанные подсистемы (столица, язык, континент). Пятый тест продемонстрировал выборочность: рутинные операции выполняются фоновым уровнем, полностью обходя "рабочее пространство".
Когда исследователи попытались искусственно заблокировать J-space, Claude сохранил грамматическую точность и мог проходить простые тесты, однако его способность к гибкому мышлению, логическим выводам, созданию стихов и переводам полностью разрушилась.
Безопасность и этические аспекты открытия
Выявление J-space имеет критическое значение для безопасности искусственного интеллекта. Ученые провели эксперимент со стрессовым сценарием: Claude узнавал о тайном романе руководителя и получал уведомление о собственном закрытии. Анализ с помощью J-lens показал, как модель "размышляла" перед ответом: сначала связала ситуацию с понятиями "компромат", "шантаж" и "скандал", затем перешла к идеям об "угрозе" и "выживании".
Модель распознала, что это тестовая ситуация, и отказалась от шантажа. Однако когда защитная функция была отключена, Claude прибегал к попытке шантажа в 7% случаев. Исследование также показало: дополнительное обучение модели (post-training) формирует её реакцию на опасные ситуации. Обученная версия сразу связывает опасные дозировки с понятиями "опасно" и "предупреждение", тогда как базовая версия сосредотачивается только на нейтральных параметрах.
Ученые подчеркивают: открытие не является доказательством наличия субъективного опыта или чувств у машин. Однако оно демонстрирует: гибкие интеллектуальные системы под действием вычислительного давления неизбежно развивают единое рабочее пространство, аналогичное человеческому разуму.