通过决定哪些内容根本无需送入 LLM,即可将 RAG 推理成... 笔记

通过决定哪些内容根本无需送入 LLM,即可将 RAG 推理成本降低 6 倍。

大多数用于高风险分类的检索增强生成(RAG)系统错误地将所有模糊案例直接路由至大语言模型(LLM),导致其在审计和审查中失败。作者倡导一种不同的设计哲学,强调在受监管的企业环境中,错误答案可能带来严重后果,因此需注重可审计性、成本与一致性。全 LLM 流水线会产生隐性成本:决策难以审计、大规模部署下推理成本高且延迟大,以及在本应确定性的案例上表现不一致。级联架构通过将这些挑战转化为以 LLM 作为升级路径而非一线处理机制来解决上述问题。第一阶段为确定性处理,利用规则和精确匹配解决明确案例,无需调用 LLM 即可处理大部分流量,确保完全可解释性。第二阶段采用检索层处理第一阶段未解决的案例,提取特定证据(如既往决策或上下文文档),其中检索质量至关重要。第三阶段为 LLM 调用,仅保留真正无法由第一、二阶段解决的模糊案例。该方法显著降低推理成本,并提升确定性案例的一致性。对于 LLM 阶段,采用非对称风险提示至关重要,需承认不同类型的错误成本并不相等。这意味着指示模型升级不确定性,提供包含后果的校准示例,并要求在分类的同时输出置信度分数。该置信度分数作为第二级级联点,将低置信度案例路由至人工审核。评估此类系统需要特定调整:检索质量必须独立于最终分类准确率进行衡量,且评估集需过采样第三阶段案例。若法官提示中融入相同的非对称风险框架,则“以 LLM 为裁判”的评估方法有效。最后,从确认结果反馈至检索语料库的闭环对于持续改进模糊案例的处理能力至关重要。更广泛的启示是:在高风险领域,有价值的工程工作在于决定决策的哪些部分应永远不涉及模型。
CdXz5zHNQW_U4g6f1Ap20.png