프론티어 LLM, 세금 신고서 3건 중 2건 오류 - 더 이상 결정하게 두지 마세요
저자는 세금, 할인, 가격 책정과 같은 금융 거래에 대한 최종 결정을 대형 언어 모델(LLM)이 내리지 못하도록 하는 것에 반대합니다. LLM이 체크아웃 플로우에 통합되고 있지만, 그 확률적 특성은 결정론적 재무 선택에는 적합하지 않습니다. TaxCalcBench와 같은 벤치마크는 고급 모델조차도 세금 계산의 정확성과 일관성에 어려움을 겪는다는 것을 보여줍니다. 이러한 신뢰성 부족은 프로모션 자격 확인이나 할인 누적 조정과 같은 다른 자금 이동 결정에도 적용됩니다. 제안된 해결책은 분업입니다: LLM은 자연어 규칙을 감사 가능한 명세로 변환하고, 이를 건전하고 결정론적인 엔진에 의해 실행됩니다. 이 접근법은 모호한 언어 이해와 정확한 논리적 실행을 분리하여 정확성과 감사 가능성을 보장합니다. LLM은 번역기 역할을 하고, 별도의 엔진이 판사 역할을 하여 번역된 규칙을 일관되게 적용합니다. 이 방법은 수많은 실험과 모델 군에서 검증되어 규칙 기반 문제에서 정확도를 꾸준히 향상시켰습니다. 이 접근법의 핵심 요구사항은 형식화 단계에 적합한 LLM입니다; 약한 모델은 잘못된 명세를 만들어 결정론적 엔진에서 자신감 있으나 잘못된 답을 내놓게 만듭니다. 이 방법은 검증 가능한 '골드 오라클'이 존재하고, 규칙이 명시화될 수 있으며, 과제가 유한하고 결정 가능할 때 적용된다. 정확성과 감사 가능성이 가장 중요한 세무 및 급여 계산 업무는 이러한 하이브리드 접근법의 주요 후보입니다.