Azure AI Document Intelligence와 Power Automate를 이용한 송장 추출 파이프라인 구축
이 글은 Azure AI Document Intelligence에서 기본적인 API 호출을 넘어 견고한 문서 처리 파이프라인을 구축하는 방법에 대해 자세히 설명합니다. 초기 추출은 쉽지만, 실제 복잡성을 처리하는 것이 핵심 과제임을 강조합니다. 제안된 파이프라인은 수집, 분류, 추출, 신뢰도를 기반으로 한 라우팅, 그리고 기록 시스템으로의 게시를 포함합니다. 정확도를 위해 사전 구축된 모델, 사용자 지정 추출 모델, 또는 사용자 지정 분류기 중 올바른 모델을 선택하는 것이 중요합니다. 저자는 분석 문서 (사전 구축 또는 사용자 지정 모델용, v4.x API)를 선호하여 사용 중단된 커넥터 작업을 피해야 한다고 강조합니다. 정확도와 신뢰도의 차이를 이해하는 것이 필수적이며, 필드별로 반환되는 신뢰도 점수는 라우팅 결정에 사용되어야 합니다.이 시스템은 필드별 신뢰도 임계값을 기준으로 문서를 게이트하며, InvoiceTotal과 같은 재무적으로 민감한 필드에 대해서는 더 엄격한 요구 사항을 적용합니다. 산술 검사는 신뢰도 점수가 놓친 오류를 포착하기 위해 권장됩니다. 이 로직 구현은 Power Automate 또는 Azure Function 내에서 수행될 수 있습니다. 이 글은 또한 중복 처리, 다중 송장 PDF, 낮은 항목 품질, 통화/지역 문제 등 일반적인 실패 지점을 다룹니다. 성공의 핵심 지표는 단순히 모델 정확도가 아니라 직접 처리율입니다. 검토율(사유별) 및 검토자 재정의율과 같은 지표를 추적하면 개선을 위한 통찰력을 얻을 수 있습니다. 마지막으로, 지능형 문서 처리는 AI를 사용하여 비정형 문서를 신뢰도 점수가 있는 구조화되고 검증된 데이터로 변환하여 자동 라우팅을 가능하게 합니다.