DEV Community 日本語
フォロー
フロンティアLLM、3件中2件の確定申告を誤る - 決定を委ねるのはやめよう
著者は、税金、割引、価格設定などの金融取引に関する最終決定を大規模言語モデル(LLM)に委ねることに反対しています。LLMはチェックアウトフローに統合されていますが、その確率的な性質は決定論的な金融選択には適していません。TaxCalcBenchのようなベンチマークでは、高度なモデルでも税金計算の正確さや一貫性に苦労していることが示されています。この信頼性の欠如は、プロモーションの適格性や割引の積み重ねなど、他の資金移動の決定にも及びます。提案された解決策は分業であり、LLMは自然言語のルールを監査可能な仕様に変換し、それを健全で決定論的なエンジンによって実行します。このアプローチは、曖昧な言語理解と正確な論理実行を分離することで、正確性と監査のしやすさを保証します。LLMは翻訳者として機能し、別のエンジンが審査員として翻訳されたルールを一貫して適用します。この手法は多数の実験やモデルファミリーで検証されており、ルールベースの問題における精度を一貫して向上させています。このアプローチの重要な要件は、形式化ステップに対応可能なLLMを持つことです。弱いモデルは誤った仕様を生み出し、決定論的エンジンからは自信を持っても誤った答えを出します。この方法は、検証可能な「ゴールドオラクル」が存在し、ルールが指定可能であり、タスクが有限かつ決定可能である場合に適用されます。税務や給与計算のように正確さと監査可能性が最優先となる作業は、このハイブリッド方式の有力な候補です。