前沿大语言模型在三项税务申报中两项出错——停止让它们做决定 笔记

前沿大语言模型在三项税务申报中两项出错——停止让它们做决定

作者反对让大型语言模型(LLM)对税务、折扣和定价等金融交易做出最终决策。虽然LLM正被整合进结账流程,但其概率性质不适合确定性金融决策。像TaxCalcBench这样的基准测试显示,即使是高级模型在税务计算的准确性和一致性上也存在困难。这种不可靠性还延伸到其他资金流动决策,如促销资格和折扣叠加。提出的解决方案是分工:LLM将自然语言规则转换为可审计的规范,然后由可靠的确定性引擎执行。这种方法通过将模糊的语言理解与精确的逻辑执行分离,确保了准确性和可审计性。LLM充当翻译器,另一个引擎作为裁判,一致地应用翻译后的规则。该方法已在众多实验和模型族中得到验证,持续提升了基于规则问题的准确性。该方法的关键要求是形式化步骤中具备能力的LLM;弱模型会产生错误的规格,导致确定性引擎给出自信但错误的答案。当存在可验证的“黄金预言机”、规则可指定且任务有限且可判定时,该方法适用。税务和工资计算等任务,准确性和可审计性至关重要,是这种混合方法的理想选择。