Post-Stream Refinement이 Microsoft Foundry에서 정식 출시되었습니다.
Azure AI Speech의 Post-Stream Refinement(PSR)이 일반 공급(GA)에 도달하여 즉각적인 스트리밍 결과에 영향을 주지 않으면서 매우 정확한 최종 전사본을 제공합니다. 이 기술은 스트리밍과 병렬로 두 번째 인식 패스를 실행하여 발화 완료 시 초기 세그먼트를 더 정확한 버전으로 대체하는 방식으로 작동합니다. GA 릴리스는 화자 속성을 위한 발화자 분리, 도메인별 어휘를 위한 구문 목록, 22개 Azure 지역에 걸쳐 19개 로케일로 확장된 지원을 포함한 중요한 프로덕션 기능을 도입합니다. 기존 실시간 계약 및 부분 결과 스트리밍은 변경되지 않습니다. 사용자는 SpeechConfig에서 속성을 설정하여 간단히 개선 기능을 활성화할 수 있습니다.PSR의 발화자 분리 지원은 개선된 전사본에서 화자 레이블이 유지되도록 하여 회의, 컨택 센터 및 인터뷰에 이상적입니다. 구문 목록을 사용하면 인식기가 특정 용어를 우선시하여 제품 이름 및 전문 어휘의 정확도를 크게 향상시킬 수 있습니다. 내부 테스트에서 단어 오류율이 두 자릿수 상대 감소를 보였으며, 특히 긴 발화 및 고유 명사에 대해 그렇습니다. 부분 결과 지연 시간은 영향을 받지 않지만, 개선으로 인해 최종 세그먼트의 지연 시간이 약간 증가할 수 있습니다.PSR은 현재 여러 인도 언어를 포함한 19개 로케일과 미주, 유럽, 아시아 태평양의 22개 Azure 지역에서 사용할 수 있습니다. 이미 Microsoft Teams 및 Microsoft 365 Copilot에 적용되고 있는 이 기술은 Azure AI Speech 고객에게 프로덕션 등급의 전사 경험을 제공합니다. 시작하려면 사용자는 Speech SDK 1.50 이상, 지원되는 지역의 Speech 리소스, 인식기에서 설정된 세션 로케일이 필요합니다.SpeechConfig에서 'PostRefinement' 옵션을 설정해야 하며, 선택적으로 구문 목록을 추가할 수 있습니다. 여러 언어 또는 코드 전환이 포함된 시나리오의 경우 다국어 PSR 공개 미리 보기를 사용할 수 있습니다. 그러나 구문 목록 및 발화자 분리가 있는 알려진 세션 로케일의 경우 단일 언어 GA 경로를 권장합니다. 이 릴리스는 최소한의 구성 변경으로 Azure AI Speech 애플리케이션의 전사 품질에서 상당한 발전을 제공합니다.