当编辑失败时,什么都不会被抛出
有效删除个人身份信息(PII)需要精心设计处理管道,因为模型往往会静默失败。在调用模型之前先进行基于规则的预处理,可能会因生成不自然的 token 模式而混淆模型,从而恶化结果。相反,应在原始文本上独立运行语义和结构两种处理流程,然后协调结果,确保结构偏移量保持有效,并过滤掉结构流程中置信度较低的时间检测。企业文档中的标记可能会扰乱模型输出;应提取纯文本、执行删除操作,再将其重新插入原始结构中,以显著提高召回率。针对拒绝执行删除的模型,需实施拒绝检测机制,回退至结构处理流程,并将这些实例记录在案,以便调整提示词。至关重要的是,系统设计应遵循“失败即关闭”(fail closed)而非“失败即开放”(fail open)的原则,以防止删除调用超时时发生数据泄露,将结构处理流程视为降级路径,并对此类事件发出警报。通过每次删除操作记录模型 ID 和提示词哈希值来实现提示词的版本控制,从而追踪性能随时间的变化。对于删除文本中的共指关系,应使用编号占位符而非通用标签,但需注意生成的映射表本身也属于 PII,需采取适当的安全措施;若无需可逆性,则直接丢弃该映射表。为衡量精确度,应构建一组不含 PII 的“金丝雀”文档集,并在每次变更时运行该集合;若其中出现任何删除操作,即表明性能出现回退。在扩展规模时,应超越单一模型的限制,构建路由接口,根据调用方的约束条件(如延迟、驻留地或语言)将请求分发至不同模型,同时始终将结构处理流程作为通用回退方案。针对长度超过 1,024 token 的提示词,需实施精细的缓存策略,以优化成本与吞吐量。推荐的构建顺序包括:提取文本、独立运行语义和结构处理流程、过滤时间、注入结构发现结果、将内容代回标记、检测拒绝情况,并记录关键元数据,同时持续使用金丝雀集进行测试。