컨텍스트 엔지니어링만으로는 충분하지 않음 — 루프 내 LLM이 없는 루프 엔지니어링 실험
모두 루프 엔지니어링에 대해 이야기하고 있지만, 대부분의 논의는 루프의 중심에 LLM이 있다고 가정합니다. 저는 아키텍처 자체를 분리하고 싶었습니다. 그래서 저는 모델을 간단한 규칙으로 대체하는 결정론적이고 제로 의존적인 Python 벤치마크를 구축했습니다. 이를 통해 하나의 질문을 직접 측정할 수 있었습니다. 목표 지향 컨트롤러가 전통적인 선형 파이프라인보다 실패를 더 잘 분리할 수 있을까요? 300개의 무작위 시드에 걸쳐 벤치마크를 검증하고 (처음에 제 자신의 결과를 무효화했던 미묘한 버그를 수정한 후) 컨트롤러가 선형 실행자가 결코 도달하지 못했던 독립적인 분기를 일관되게 완료한다는 것을 발견했습니다. 이 글은 아키텍처, 벤치마크 설계, 디버깅 프로세스, 그리고 협소하지만 실용적인 주장에 대한 증거를 살펴봅니다. 실패 격리는 LLM 추론과 독립적인 제어 흐름의 측정 가능한 속성입니다.