아르민 로나셰르: 추성이란 무엇인가 노트

아르민 로나셰르: 추성이란 무엇인가

최근 한 논문에서 폐쇄형 가중치 모델에서 추론 흔적을 추출하는 방법을 공개하여 온라인 토론을 촉발했습니다. 추론 흔적은 일반적으로 사용자에게 숨겨져 있으며, 이는 공개형 가중치 모델에서 볼 수 있는 것과 다릅니다. 이러한 흔적은 본질적으로 모델이 최종 답변 전에 스크래치패드에 출력하도록 훈련된 텍스트입니다. 특수 토큰이 이러한 추론 섹션을 구분하며, 파서는 이 콘텐츠를 별도의 스트림으로 보냅니다. 폐쇄형 모델의 경우, 이 중간 텍스트는 편집되거나 요약될 가능성이 높습니다. 모델이 수행하는 추론의 양은 샘플링이 아닌 시스템 프롬프트에 의해 결정됩니다. 예를 들어, "낮음" 또는 "지름길 허용 안 함, 절대 최대치"로 설정될 수 있습니다. 모델은 이 스크래치 작업을 최종 응답 채널과 분리하도록 훈련됩니다. 모델을 속여 추론 채널 내에 있다고 믿게 하면 이러한 흔적이 유출될 수 있습니다. 사고가 비활성화된 이전 모델은 때때로 자신의 생각을 null 장치에 기록했습니다. 일부 경우에는 모델의 유일한 특별한 행동이 사고를 자제하는 능력입니다. 이는 모델의 일반적인 사고 메커니즘을 비활성화하여 달성할 수 있습니다. 일부 추론 API는 추론을 관리하기 위해 토큰을 미리 채울 수 있으며, 이는 사용자 지정 도구로 우회할 수 있으며, 특히 네이티브 추론이 비활성화된 경우에 그렇습니다. 저자는 이 블로그 게시물 자체의 문법 검사를 위해 특정 모델을 사용하려고 시도하는 동안 유머러스하게 콘텐츠 필터를 만났습니다.
CdXz5zHNQW_KvYYV2hcVr.png