VentureBeat 日本語
フォロー
Writer's AIハーネス、精度を犠牲にすることなくトークン消費を約40%削減
エンタープライズAIは、強力な基盤モデルが本番環境では法外に高価であるという投資収益率のパラドックスに直面しています。研究者たちは、基盤モデルを中心としたオーケストレーションレイヤーであるAIハーネスを最適化することを解決策として提案しています。プロンプトキャッシュや対話履歴の圧縮などのコンポーネントを洗練させることで、品質を損なうことなく大幅なコスト削減を達成しました。このアプローチにより、エンジニアリングチームは、基盤となるモデルをファインチューニングすることなく、コスト効率の高いAIアプリケーションを構築できます。現在の業界トレンドである「トークンマキシング」は、効率的なシステム設計ではなく、大きなコンテキストウィンドウに依存することでリソースを浪費しています。このブルートフォース手法は、トークンコストを無視できるものとして扱い、時間の経過とともに増幅される根本的な非効率性を隠蔽しています。プロンプト圧縮のような既存の効率化技術は、システムの一部しか最適化せず、オーケストレーションレイヤーを無視するため失敗します。ハーネスは、歴史的には使い捨てのコードとして扱われてきましたが、AIコストを制御するために不可欠であると認識されるようになりました。ハーネスの最適化には、システムプロンプトキャッシュ、対話履歴の圧縮、ツール管理、検索戦略、エラー管理が含まれます。実験により、ハーネスの最適化により、タスクあたりのコストが41%、トークン消費量が38%削減されることが実証されました。タスクの成功率は安定したままで、エンドツーエンドのレイテンシは大幅に減少しました。開発者は、キャッシュのための「ツーゾーンプロンプト」や、コンテキストを効果的に管理するための「コンテキストオフロード」のような最適化を実装できます。トークン予算と生成制限に対するハードチェックを備えた回復力のあるループを構築することは、暴走するコストを回避するために不可欠です。基盤モデルが進化するにつれて、ハーネスはモデルの弱点を補うことから、予算やデータ境界のようなエンタープライズポリシーを強制することへと移行するでしょう。