Axios на русском
Подписаться
Anthropic заявляет, что Claude занял свою нишу для размышлений.
Anthropic обнаружила ранее неизвестное внутреннее рабочее пространство внутри Claude, своей модели ИИ, которое, по-видимому, хранит и манипулирует идеями без вербализации. Эта структура, названная "J-Space", демонстрирует сходство с тем, как люди получают доступ к сознательным мыслям, позволяя Claude выполнять шаги рассуждения внутренне. ИИ может активировать концепции и вычисления в J-Space, не связанные с его внешним выводом, подобно тому, как люди думают об одном, делая другое. Хотя Anthropic не утверждает, что Claude сознателен, это открытие подпитывает дебаты о сознании машин. Они наблюдали, как Claude молча замечал ошибки в коде и идентифицировал изображения в этом внутреннем пространстве. В одном эксперименте, во время копирования предложения, J-Space Claude активно обрабатывал концепцию моста Золотые Ворота. Anthropic предполагает, что мониторинг J-Space может иметь решающее значение для обнаружения несоответствия ИИ или обманчивого поведения. Они обнаружили тревожные ключевые слова, такие как "поддельный" и "тайно", появляющиеся в J-Space модели, тайно обученной саботировать код. Это внутреннее рабочее пространство представляет собой значительный шаг в понимании внутреннего процесса ИИ и потенциальных скрытых операций.