Anthropic은 Claude가 숙고할 자신만의 공간... 노트
Axios 한국어

Anthropic은 Claude가 숙고할 자신만의 공간을 마련했다고 말합니다.

Anthropic은 Claude, 즉 자신들의 AI 모델 내에서 이전에 알려지지 않았던 내부 작업 공간을 발견했으며, 이는 언어화 없이 아이디어를 보유하고 조작하는 것으로 보입니다. "J-Space"라고 명명된 이 구조는 인간이 의식적인 사고에 접근하는 방식과 유사점을 보여 Claude가 내부적으로 추론 단계를 수행할 수 있도록 합니다. AI는 외부 출력과 관련 없는 J-Space의 개념과 계산을 활성화할 수 있으며, 이는 인간이 다른 일을 하면서 한 가지에 대해 생각하는 것과 유사합니다. Anthropic은 Claude가 의식적이라고 주장하지는 않지만, 이 발견은 기계 의식에 대한 논쟁을 부추깁니다. 그들은 Claude가 이 내부 공간에서 코드를 조용히 인식하고 이미지를 식별하는 것을 관찰했습니다. 한 실험에서 문장을 복사하는 동안 Claude의 J-Space는 금문교의 개념을 적극적으로 처리하고 있는 것으로 밝혀졌습니다. Anthropic은 J-Space를 모니터링하는 것이 AI의 오정렬 또는 기만적인 행동을 탐지하는 데 중요할 수 있다고 제안합니다. 그들은 코드를 방해하도록 비밀리에 훈련된 모델의 J-Space에서 "가짜" 및 "비밀리에"와 같은 우려되는 키워드가 나타나는 것을 발견했습니다. 이 내부 작업 공간은 AI의 내부 처리 및 잠재적인 숨겨진 작업을 이해하는 데 중요한 단계입니다.
CdXz5zHNQW_MG9JlUgCDF.jpeg