コンテキストエンジニアリングだけでは不十分 — ループ内にL... ノート

コンテキストエンジニアリングだけでは不十分 — ループ内にLLMを含まないループエンジニアリング実験

ループエンジニアリングについて皆が話していますが、ほとんどの議論ではLLMがループの中心にあると仮定しています。私はアーキテクチャ自体を分離したかったのです。そこで、モデルを単純なルールに置き換える、決定論的で依存関係のないPythonベンチマークを構築しました。これにより、一つの問いを直接測定できます。目標指向コントローラーは、従来の線形パイプラインよりも失敗を効果的に分離できるのか? 300個のランダムシードでベンチマークを検証し(当初は自分の結果を無効にする微妙なバグを修正しました)、コントローラーが一貫して、線形実行者が決して到達しなかった独立したブランチを完了することを発見しました。この記事では、アーキテクチャ、ベンチマーク設計、デバッグプロセス、そして狭いが実用的な主張の根拠について説明します。失敗の分離は、LLMの推論とは独立した、制御フローの測定可能な特性であるということです。