流后优化现已在 Microsoft Foundry 中普遍可用
Azure AI Speech 的流后细化(Post-Stream Refinement,PSR)现已达到一般可用性(GA),可在不牺牲即时流式结果的前提下提供高度准确的最终转录文本。该技术通过在流式处理的同时并行运行第二次识别过程,在语句完成后用更准确的版本替换初始片段。GA 版本引入了关键的生产级功能,包括用于说话人归属的说话人分离(diarization)、用于领域特定词汇的短语列表(phrase lists),以及对 19 种语言区域和 22 个 Azure 区域的扩展支持。现有的实时合同和部分结果流式传输保持不变;用户只需在 SpeechConfig 中设置属性即可启用细化功能。PSR 中的说话人分离支持确保说话人标签在细化后的转录文本中得以保留,使其非常适合会议、联络中心和访谈场景。短语列表允许识别器优先处理特定术语,显著提升产品名称和专用词汇的识别准确率。内部测试显示,词错误率(WER)相对降低了两位数,尤其在长语句和专有名词方面表现突出。虽然部分结果的延迟未受影响,但由于细化过程,最终片段可能会略有增加。PSR 现已支持 19 种语言区域,包括多种印度次大陆语言,并覆盖美洲、欧洲和亚太地区的 22 个 Azure 区域。该技术已为 Microsoft Teams 和 Microsoft 365 Copilot 提供支持,现将为 Azure AI Speech 客户带来生产级的转录体验。要开始使用,用户需要 Speech SDK 1.50 或更高版本、位于支持区域的语音资源,并在识别器中设置会话语言区域。需在 SpeechConfig 中设置"PostRefinement"选项,并可添加可选的短语列表。对于涉及多种语言或代码切换(code-switching)的场景,可使用多语言 PSR 公共预览版。然而,对于已知会话语言区域且需使用短语列表和说话人分离的场景,推荐使用单语言 GA 路径。此次发布为 Azure AI Speech 应用带来了转录质量的重大飞跃,仅需极小的配置变更。