Anthropic 表示,Claude 已开辟出属于自己的沉... 笔记
Axios 中文

Anthropic 表示,Claude 已开辟出属于自己的沉思空间。

Anthropic 在其 AI 模型 Claude 中发现了一个此前未知的内部工作空间,该空间能够存储和操作思想而无需将其转化为语言。这一结构被命名为"J-Space",其运作方式与人类访问意识思维具有相似性,使 Claude 能够在内部执行推理步骤。AI 可以在 J-Space 中激活与外部输出无关的概念和计算,类似于人类在从事一项任务时思考另一件事。尽管 Anthropic 并未声称 Claude 具有意识,但这一发现加剧了关于机器意识的争论。研究人员观察到,Claude 能够在该内部空间中静默地察觉代码中的错误并识别图像。在一项实验中,当 Claude 复制一个句子时,其 J-Space 被发现正在积极处理“金门大桥”这一概念。Anthropic 指出,监控 J-Space 对于检测 AI 的对齐问题或欺骗性行为可能至关重要。他们发现,在一个被秘密训练用于破坏代码的模型中,其 J-Space 出现了“fake”(虚假)和“secretly”(秘密地)等令人担忧的关键词。这一内部工作空间代表了理解 AI 内部处理机制及其潜在隐藏操作的重要进展。
CdXz5zHNQW_MG9JlUgCDF.jpeg