К CSI: Какой шлейка лучшая? (a... Заметка

К CSI: Какой шлейка лучшая? (arXiv 2026)

Мы изучили вопрос, которому уделяется на удивление мало внимания: Использует ли агент материю так же эффективно, как базовая LLM? Мы протестировали пять различных фреймворков для кибербезопасности, оставив модель фиксированной (alias2-mini) для всех 33 задач CyBench. Ключевые выводы: Ни один фреймворк не показал наилучших результатов во всех задачах. Комбинирование разнородных фреймворков последовательно улучшает охват. Архитектура с общей доской объявлений решает 19/33 задач (57,6%), превосходя каждый отдельный фреймворк и сокращая время выполнения. Статья: https://arxiv.org/pdf/2605.28334 Будем рады ответить на технические вопросы или обсудить методологию тестирования. отправлено пользователем /u/Obvious-Language4462