За гранью сдачи тестов: Фреймв... Заметка
DEV Community на русском

За гранью сдачи тестов: Фреймворк из 100 линз для оценки контекстно-зависимых ИИ-агентов для кодирования 🤖

AI-кодировщики становятся все более искусными в генерации кода, но серьезная проблема заключается в оценке их инженерного суждения. Простого прохождения тестов недостаточно, поскольку это не гарантирует понимания ИИ архитектурного контекста, ограничений проекта или исторических решений. По мере того как ИИ переходит от фрагментов кода к модификациям репозиториев, эта контекстная корректность становится критически важной. Существующие эталонные тесты, такие как SWE-bench, развиваются для решения реальных проблем программной инженерии, однако они также сталкиваются с проблемами качества задач и их загрязнения. Автор предлагает оценивать ИИ-агентов по их способности адаптироваться к соответствующим изменениям контекста, сохраняя при этом стабильность при изменении нерелевантного контекста. Это включает тестирование адаптации к контексту и стабильности контекста, выходя за рамки простых метрик "пройдено/не пройдено". Фокус должен сместиться с "сколько контекста" на "какой контекст", "когда" и "насколько надежно". Рассмотрение контекста репозитория как динамического объекта с жизненным циклом имеет важное значение для долгосрочных проектов. Будущие эталонные тесты должны быть динамическими, отражая развивающуюся природу разработки программного обеспечения. Конечный вопрос заключается в том, смогут ли ИИ-агенты поддерживать здравое инженерное суждение в условиях меняющихся программных сред, охватывающих архитектуру, требования, зависимости и командные соглашения. Эта сложная проблема требует разнообразных подходов к мышлению, которые могут быть структурированы с использованием определенных "линз" для визуализации, объяснения и анализа.