Towards Data Science | Medium на русском
Подписаться
Шумный текст в RAG: опечатки, OCR и пробел, оставляемый классической проверкой орфографии
Enterprise Document Intelligence [Vol.1 #B1] - Три источника одной проблемы. Опечатки пользователей, шум при быстрой транскрипции, ошибки распознавания символов OCR. Классическая проверка орфографии справляется с одной из них. Эмбеддинги несут остальное