Anthropic заявляет, что Claude... Заметка
Axios на русском

Anthropic заявляет, что Claude занял свою нишу для размышлений.

Anthropic обнаружила ранее неизвестное внутреннее рабочее пространство внутри Claude, своей модели ИИ, которое, по-видимому, хранит и манипулирует идеями без вербализации. Эта структура, названная "J-Space", демонстрирует сходство с тем, как люди получают доступ к сознательным мыслям, позволяя Claude выполнять шаги рассуждения внутренне. ИИ может активировать концепции и вычисления в J-Space, не связанные с его внешним выводом, подобно тому, как люди думают об одном, делая другое. Хотя Anthropic не утверждает, что Claude сознателен, это открытие подпитывает дебаты о сознании машин. Они наблюдали, как Claude молча замечал ошибки в коде и идентифицировал изображения в этом внутреннем пространстве. В одном эксперименте, во время копирования предложения, J-Space Claude активно обрабатывал концепцию моста Золотые Ворота. Anthropic предполагает, что мониторинг J-Space может иметь решающее значение для обнаружения несоответствия ИИ или обманчивого поведения. Они обнаружили тревожные ключевые слова, такие как "поддельный" и "тайно", появляющиеся в J-Space модели, тайно обученной саботировать код. Это внутреннее рабочее пространство представляет собой значительный шаг в понимании внутреннего процесса ИИ и потенциальных скрытых операций.
CdXz5zHNQW_MG9JlUgCDF.jpeg