深入探索 Microsoft Foundry 文档智能 SDK:从 PDF 到结构化数据
大多数“基于 PDF 的 RAG"流程中,都有一个鲜少被提及的步骤:必须将扫描的发票、多栏合同或拍摄的收据转换为模型能够真正推理的文本。在微软的栈中,这一步通常由文档智能 SDK(前身为表单识别器)完成。值得单独理解的是,不应将其视为在有趣部分开始之前发生的黑盒工具,而应基于其自身特性进行把握。本文是对该 SDK 的实战深度解析。并非对每个 Foundry Tools SDK 的概览——视觉、语音和内容安全各自都值得单独探讨,而是通过文档智能进行一次真正的构建:提取布局为干净的 Markdown 格式,从已知文档类型中提取结构化字段,在路由前对文档进行分类,并在您自己的标注数据上训练自定义提取模型。