Microsoft Foundry Document Int... ノート

Microsoft Foundry Document Intelligence SDK を深く掘り下げる:PDF から構造化データへ

ほとんどの「PDF 上の RAG」パイプラインには、あまり話題にならないステップがあります。スキャンされた請求書、複数列の契約書、または写真に撮られた領収書を、モデルが実際に推論できるテキストに変換する必要があるのです。Microsoft のスタックでは、その役割を担うのは通常、以前は Form Recognizer と呼ばれていた Document Intelligence SDK です。これは、興味深い部分が始まる前のブラックボックスとして扱うのではなく、それ自体の terms で理解する価値があります。これは、その SDK に特化した実践的な深掘りです。Foundry Tools SDK のすべてを網羅するツアーではなく、Vision、Speech、Content Safety はそれぞれ独自の扱いが必要ですが、Document Intelligence を使用した実際の構築を行います。レイアウトをクリーンなマークダウンとして抽出する、既知のドキュメントタイプから構造化されたフィールドを抽出する、ルーティングする前にドキュメントを分類する、そして独自のラベル付きデータでカスタム抽出モデルをトレーニングする、といったことです。