VentureBeat 한국어
팔로우
Meta 연구원들이 8B AI 모델을 Claude Opus 4.5와 동등한 수준으로 학습시켰습니다. — 최첨단 가격표 없이
CRM 데이터 마이그레이션과 같은 장기적인 작업을 수행하는 AI 에이전트는 내부 메모리 이상의 것을 필요로 합니다. 실행 피드백 및 상태 관리를 위해 런타임 레이어, 즉 하네스에 의존합니다. 전통적으로 개발자는 에이전트 동작을 단계별로 스크립팅하여 자율성과 적응성을 제한했습니다. Meta AI와 일리노이 대학교 어바나-샴페인 캠퍼스의 EvoHarness-RL은 에이전트 기능을 향상시키기 위해 Belief, Progress, Experience (BPE)라는 통합 워크스페이스를 도입합니다. Belief는 환경을 추적하고, Progress는 하위 목표를 관리하며, Experience는 과거 지식을 저장합니다. 에이전트는 네 가지 메타 액션인 track, commit, recall, note를 사용하여 BPE와 상호 작용합니다. 이 프레임워크를 통해 에이전트는 외부 상태에 언제, 어떻게 액세스하고 업데이트할지를 학습할 수 있습니다. EvoHarness-RL은 데이터를 구조화하기 위한 지도 학습 미세 조정과 계산 비용을 기반으로 도구 사용을 최적화하기 위한 비용 인식 강화 학습을 포함합니다. 벤치마크 테스트에서 EvoHarness-RL은 더 작은 AI 모델의 성능을 크게 향상시켰으며, 더 크고 폐쇄 소스 모델의 성능과도 일치했습니다. 이 프레임워크는 BPE 프롬프트 타임 하네스를 통해 실행을 향상시켜 기존의 최첨단 모델에도 이점을 제공합니다. 훈련 중에 EvoHarness-RL은 에이전트가 일상적인 작업에 대한 외부 도구 의존도를 줄이는 "하네스 어닐링"과 작업 복잡성에 따라 동적으로 전략을 조정하는 "하네스 진화"를 보여줍니다. 환경 어댑터는 현재 도구나 에이전트 프레임워크를 완전히 재검토할 필요 없이 기존 엔터프라이즈 시스템과의 통합을 용이하게 합니다. EvoHarness-RL은 에이전트 동작을 스크립팅하는 것에서 더 나은 동작을 학습할 수 있는 시스템을 만드는 것으로의 전환을 나타내며, 특히 길고 복잡한 작업에 가치가 있습니다.