К CSI: Какой шлейка лучшая? (arXiv 2026)
Мы изучили вопрос, которому уделяется на удивление мало внимания:
Использует ли агент материю так же эффективно, как базовая LLM?
Мы протестировали пять различных фреймворков для кибербезопасности, оставив модель фиксированной (alias2-mini) для всех 33 задач CyBench.
Ключевые выводы:
Ни один фреймворк не показал наилучших результатов во всех задачах. Комбинирование разнородных фреймворков последовательно улучшает охват. Архитектура с общей доской объявлений решает 19/33 задач (57,6%), превосходя каждый отдельный фреймворк и сокращая время выполнения.
Статья: https://arxiv.org/pdf/2605.28334
Будем рады ответить на технические вопросы или обсудить методологию тестирования. отправлено пользователем /u/Obvious-Language4462