Microsoft Foundry Document Int... 노트

Microsoft Foundry Document Intelligence SDK 심층 분석: PDF에서 구조화된 데이터까지

대부분의 "PDF 기반 RAG" 파이프라인에는 잘 언급되지 않는 단계가 있습니다. 바로 스캔된 송장, 다단 계약서 또는 사진으로 찍은 영수증을 모델이 실제로 추론할 수 있는 텍스트로 변환하는 것입니다. Microsoft 스택에서는 일반적으로 Document Intelligence SDK(이전에는 Form Recognizer)가 이 역할을 수행하며, 흥미로운 부분이 시작되기 전에 발생하는 블랙박스로 취급하기보다는 그 자체로 이해할 가치가 있습니다.이것은 특히 해당 SDK에 대한 실습 중심의 심층 분석입니다. 모든 Foundry Tools SDK를 둘러보는 것이 아니라 — Vision, Speech, Content Safety는 각각 별도의 설명이 필요하지만 — Document Intelligence를 사용한 실제 구축입니다. 레이아웃을 깔끔한 마크다운으로 추출하고, 알려진 문서 유형에서 구조화된 필드를 가져오고, 라우팅 전에 문서를 분류하고, 자체 레이블이 지정된 데이터로 사용자 지정 추출 모델을 학습하는 것입니다.