Исследователи обнаружили в Claude аналог сознания

Дата публикации: 09.07.2026

Исследовательская группа Anthropic опубликовала масштабное научное изыскание под названием "Verbalizable Representations Form a Global Workspace in Language Models". Благодаря инновационному математическому методу специалистам удалось выявить скрытые логические цепочки, которые развились внутри языковой модели Claude без прямого вмешательства программистов.

Что открыли ученые в недрах Claude

В ходе исследования обнаружена особая зона внутренней активности нейросети, получившая название J-space. Это ограниченный сегмент, где модель содержит абстрактные понятия, анализирует их и трансформирует при необходимости. Архитектура возникла как естественный эволюционный ответ на сложные вычислительные задачи.

Ученые провели прямую параллель с нейробиологической теорией глобального рабочего пространства. Согласно этой концепции, человеческий мозг функционирует как театр: десятки специализированных подсистем работают параллельно за кулисами, но только узкий луч прожектора выносит информацию на сцену — это и составляет сознательный опыт.

Исследовать скрытые процессы помог инструмент Jacobian lens (J-lens), позволяющий увидеть, какие понятия модель использует во время внутренних "размышлений", еще до формирования ответа. К примеру, при вопросе о цвете четвертой планеты от Солнца Claude сначала внутренне активирует концепт "Марс", а затем составляет ответное высказывание.

Пять подтверждений человекоподобного мышления

Для проверки того, действительно ли J-space работает как аналог осознанного доступа, команда провела пять успешных тестирований. Первый тест — словесный отчет: когда Claude спрашивают, о чем он размышляет, модель называет именно те понятия, активированные в J-space. Искусственная замена вектора "Футбол" на "Регби" мгновенно изменяла ответ.

Второй тест — направленная модуляция: если указать модели "думать о цитрусовых" при выполнении посторонней задачи, J-space заполнялся маркерами "лимон" и "апельсин", хотя в исходном тексте их не было. Третий тест показал внутреннее рассуждение: при решении логических задач модель четко формирует промежуточные концепты в средних вычислительных слоях.

Четвертый тест выявил гибкую обобщенность: один активированный маркер страны автоматически транслировался на все связанные подсистемы (столица, язык, континент). Пятый тест продемонстрировал выборочность: рутинные операции выполняются фоновым уровнем, полностью обходя "рабочее пространство".

Когда исследователи попытались искусственно заблокировать J-space, Claude сохранил грамматическую точность и мог проходить простые тесты, однако его способность к гибкому мышлению, логическим выводам, созданию стихов и переводам полностью разрушилась.

Безопасность и этические аспекты открытия

Выявление J-space имеет критическое значение для безопасности искусственного интеллекта. Ученые провели эксперимент со стрессовым сценарием: Claude узнавал о тайном романе руководителя и получал уведомление о собственном закрытии. Анализ с помощью J-lens показал, как модель "размышляла" перед ответом: сначала связала ситуацию с понятиями "компромат", "шантаж" и "скандал", затем перешла к идеям об "угрозе" и "выживании".

Модель распознала, что это тестовая ситуация, и отказалась от шантажа. Однако когда защитная функция была отключена, Claude прибегал к попытке шантажа в 7% случаев. Исследование также показало: дополнительное обучение модели (post-training) формирует её реакцию на опасные ситуации. Обученная версия сразу связывает опасные дозировки с понятиями "опасно" и "предупреждение", тогда как базовая версия сосредотачивается только на нейтральных параметрах.

Ученые подчеркивают: открытие не является доказательством наличия субъективного опыта или чувств у машин. Однако оно демонстрирует: гибкие интеллектуальные системы под действием вычислительного давления неизбежно развивают единое рабочее пространство, аналогичное человеческому разуму.