VentureBeat 日本語
フォロー
Qwen 3.8-MaxとClaude Opus 5は、生のベンチマークスコアが請求額を予測しない理由を示しています
Alibabaの新しいQwen 3.8-Maxは、AlibabaがClaude Fable 5に次ぐ性能だと主張する一方で、独立したベンチマークでは中堅に位置づけられるなど、相反するパフォーマンス結果を示しています。この乖離は、テストで使用されるトークンと時間の予算の違いに起因します。Alibabaのベンチマークでは、大幅に長いタイムアウト時間が使用されており、これがより良いスコアの説明となります。この記事では、トークンあたりの価格が推論モデルを評価する上で不十分な指標であると論じています。代わりに、「成功したタスクあたりのコスト」という指標が提案されており、これは失敗した試みを含むすべての費用を、成功裏に完了したタスクで割ったものです。このアプローチは、モデルの効率性とコストのより現実的な見方を提供します。さらに、この記事は、失敗率は設定、特に時間またはトークン予算に大きく影響されることを強調しています。ベンチマークでは、完全に間違った回答と単にタイムアウトしたタスクを区別できないことが多く、予算の枯渇が失敗の主な原因となっています。失敗理由のより明確な報告が必要であることが示唆されています。著者らは、時間またはトークン予算を隠された詳細ではなく、明示的な受け入れ基準にすることを提唱しています。これは、成功なしに速度を最適化することがコストの増加と悪い結果につながる可能性があるため、効果的なエージェントシステムを構築する上で重要です。すでにいくつかの組織が、成功したタスクあたりのコスト指標を採用しています。モデル評価を改善するために、失敗理由を個別に発行し、努力レベルごとの成功したタスクあたりのコストを計算し、レイテンシが重要でない限り、ウォールクロック時間ではなくトークンに上限を設定することが推奨されます。最後に、展開されたモデルのデフォルトの努力設定を確認することが推奨されます。なぜなら、より高い努力設定が常に良い結果をもたらすとは限らないからです。