Metaの研究者は、8B AIモデルに、最先端の価格なしでC... ノート
VentureBeat 日本語

Metaの研究者は、8B AIモデルに、最先端の価格なしでClaude Opus 4.5に匹敵するように教え込みました。

CRMデータの移行のような長期的なタスクを実行するAIエージェントは、内部メモリ以上のものを必要とします。実行フィードバックと状態管理のために、ランタイムレイヤー、またはハーネスに依存します。従来、開発者はエージェントの動作をステップバイステップでスクリプト化しており、自律性と適応性が制限されていました。Meta AIとイリノイ大学アーバナ・シャンペーン校のEvoHarness-RLは、エージェントの機能を強化するために、Belief, Progress, and Experience (BPE) と呼ばれる統合ワークスペースを導入します。Beliefは環境を追跡し、Progressはサブゴールを管理し、Experienceは過去の知識を保存します。エージェントは、track、commit、recall、noteの4つのメタアクションを使用してBPEと対話します。このフレームワークにより、エージェントは外部状態にいつ、どのようにアクセスし、更新するかを学習できます。EvoHarness-RLは、データを構造化するための教師ありファインチューニングと、計算コストに基づいてツールの使用を最適化するためのコスト認識型強化学習を伴います。ベンチマークテストでは、EvoHarness-RLは小規模なAIモデルのパフォーマンスを大幅に向上させ、大規模なクローズドソースモデルと同等の性能を発揮しました。このフレームワークは、BPEプロンプトタイムハーネスを通じて実行を強化することで、既存のフロンティアモデルにも利益をもたらします。トレーニング中、EvoHarness-RLは「ハーネスアニーリング」を示し、エージェントはルーチンタスクで外部ツールへの依存を減らし、「ハーネスエボリューション」では、タスクの複雑さに基づいて動的に戦略を適応させます。環境アダプターは、現在のツールやエージェントフレームワークの完全なオーバーホールを必要とせずに、既存のエンタープライズシステムへの統合を容易にします。EvoHarness-RLは、エージェントの動作をスクリプト化することから、より良い動作を学習できるシステムを作成することへの移行を表しており、特に長くて複雑なタスクに価値があります。
CdXz5zHNQW_vFMdHvCqG6.jpeg