Пограничные большие языковые м... Заметка
DEV Community на русском

Пограничные большие языковые модели допускают ошибки в 2 из 3 налоговых деклараций — прекратите позволять им принимать решения

Автор выступает против того, чтобы большие языковые модели (LLM) принимали окончательные решения по финансовым операциям, таким как налоги, скидки и ценообразование. Хотя LLM интегрируются в потоки оплаты, их вероятностный характер неподходит для детерминированных финансовых решений. Бенчмарки, такие как TaxCalcBench, показывают, что даже продвинутые модели испытывают трудности с точностью и согласованностью налоговых расчётов. Эта ненадёжность распространяется и на другие решения, связанные с денежным переводом, такие как право на участие в акции и накопление дисконтов. Предлагаемое решение представляет собой разделение обязанностей: LLM переводят правила естественного языка в проверяемые спецификации, которые затем выполняются надёжными, детерминированными движками. Такой подход обеспечивает точность и аудитируемость, отделяя нечеткое понимание языка от точного логического исполнения. LLM выступает в роли переводчика, а отдельный движок выступает в роли судьи, последовательно применяя переведённые правила. Этот метод был проверен во множестве экспериментов и семейств моделей, постоянно повышая точность по задачам, основанным на правилах. Ключевым требованием для этого подхода является способная LLM для этапа формализации; Слабая модель даст неправильные характеристики, что приведёт к уверенным, но неправильным ответам от детерминированного движка. Метод применим, когда существует проверяемый «золотой оракул», правила специфицируемы, а задача конечна и решаема. Задачи, такие как налоговые и расчеты заработной платы, где важны точность и аудитируемость, являются отличными кандидатами для такого гибридного подхода.