VentureBeat на русском
Подписаться
Фронтирные модели могут восстановить до 65% фактов, которые они не могут напрямую вспомнить — просто за счет более длительного обдумывания.
Большие языковые модели (LLM) часто генерируют фактически неверную информацию. Разработчики традиционно решают эту проблему, предполагая недостаток знаний и увеличивая размер модели или объем данных. Однако новые исследования показывают, что LLM часто обладают фактами, но не могут вспомнить их во время генерации. Передовые модели кодируют высокий процент фактов, что указывает на то, что проблема заключается в извлечении информации.Исследование предлагает "профилирование знаний" для различения между закодированными и известными фактами. Кодирование означает, что модель может воспроизвести факт при определенных условиях, в то время как знание означает, что она может надежно отвечать на вопросы о нем в различных формулировках. Сбои кодирования требуют вмешательства на этапе предварительного обучения, в то время как сбои извлечения информации выигрывают от методов пост-обучения.Факт может быть напрямую извлечен, не пройти кодирование, испытать сбой извлечения, быть извлеченным с размышлением или быть выведенным без кодирования. Эксперименты на многочисленных LLM показывают, что передовые модели кодируют большинство фактов, но испытывают трудности с прямым извлечением. Размышления во время вывода, такие как "цепочка рассуждений", значительно помогают извлечению, подобно тому, как человек вспоминает информацию.Масштабирование моделей не решает проблемы извлечения информации и может даже усугубить их, увеличивая количество недоступных закодированных фактов. Извлечение информации сильно зависит от формулировки запроса и контекста, причем редкие или обратные факты представляют большую сложность для извлечения. Разработчики должны избегать рассмотрения всех фактических ошибок как проблем извлечения и вместо этого сосредоточиться на улучшении извлечения.Выборочное использование рассуждений во время вывода и конвейеров "генерация-проверка" может повысить фактическую точность. Тестирование семантического доступа за пределами стандартных метрик точности выявляет истинные знания модели. Переформулировка запросов и повторные попытки также эффективны. Хотя эталон WikiProfile фокусируется на энциклопедических фактах, его методология может быть применена к данным конкретной предметной области, хотя кодирование может быть более значимой проблемой в специализированных областях. Это исследование смещает акцент на оптимизацию пост-обучения и времени вывода, делая улучшенную фактическую точность ИИ более доступной.