DEV Community на русском
Подписаться
Почему не следует позволять модели проверять свой собственный ИИ-код
Недавняя статья на arXiv освещает структурные слабости в моделях проверки кода с помощью ИИ. В ней представлена двухфакторная система для оценки реализации программного обеспечения в соответствии с требованиями и средой развертывания. Разрыв в требованиях существует между потребностями заинтересованных сторон и задокументированными требованиями, в то время как разрыв модели — это разница между предполагаемой и реальной средой развертывания. Галлюцинации ИИ усугубляют оба этих разрыва, фабрикуя информацию.В статье утверждается, что когда одна и та же модель ИИ, которая генерирует код, также проверяет его, она делает это, используя те же ошибочные требования и модель среды. Это приводит к ложному чувству проверки, поскольку ИИ по сути перепроверяет свои собственные предположения и слепые зоны. Самопроверка улавливает только те ошибки, которые модель уже признает проблемными, при этом пропуская код, который разделяет ее неверные предположения.Для эффективного сокращения этих разрывов в статье предлагаются две ключевые стратегии. Межмодельная проверка включает вторую, независимую модель ИИ, которая заново выводит требования и предположения о среде с нуля, смягчая общие слепые зоны. Другая важная стратегия — запуск кода в среде, максимально приближенной к производственной, поскольку реальность является окончательным верификатором.Предварительные оценки перед развертыванием являются прокси, а проверки на основе выполнения превосходят статические оценки, поскольку они требуют наблюдаемого поведения. В статье человеческое суждение рассматривается как дефицитный ресурс для разрыва в требованиях, а точная оценка — как узкое место для разрыва модели. Учитывая объем кода, сгенерированного ИИ, разумный подход включает проверку различий, сгенерированных ИИ, независимой моделью, за которой следуют проверки на основе выполнения. Затем человеческая проверка должна быть сосредоточена на коде, который проходит эти начальные этапы, максимизируя отдачу от человеческого внимания. Хотя проверка ИИ одной и той же моделью может действовать как линтер, ее не следует путать с истинной верификацией.