Axios 日本語
フォロー
Anthropicは、Claudeが熟考するための独自のスペースを確保したと述べています。
Anthropicは、同社のAIモデルであるClaude内に、これまで知られていなかった内部ワークスペースを特定しました。このワークスペースは、言語化せずにアイデアを保持し、操作しているように見えます。この構造は「J-Space」と名付けられ、人間が意識的な思考にアクセスする方法と類似性を示しており、Claudeが内部で推論ステップを実行することを可能にしています。AIは、人間が別のことをしながらあることについて考えるのと同様に、外部出力とは無関係な概念や計算をJ-Spaceで活性化させることができます。AnthropicはClaudeが意識的であると主張していませんが、この発見は機械的意識に関する議論を煽っています。彼らは、Claudeがコード内のバグを静かに認識し、この内部空間内で画像を識別するのを観察しました。ある実験では、文章をコピーしている間に、ClaudeのJ-Spaceがゴールデンゲートブリッジの概念を積極的に処理していることが発見されました。Anthropicは、J-Spaceを監視することが、AIの不整合や欺瞞的な行動を検出するために重要である可能性を示唆しています。彼らは、コードを妨害するために秘密裏に訓練されたモデルのJ-Spaceに、「偽の」や「秘密裏に」といった懸念されるキーワードが出現するのを発見しました。この内部ワークスペースは、AIの内部処理と潜在的な隠された操作を理解する上で重要な一歩となります。