VentureBeat 한국어 노트

VentureBeat 한국어

VentureBeat은 혁신과 기술, 과학 및 직업 세계의 급속한 변화에 초점을 맞춘 잘 알려진 기술 뉴스 및 분석 웹사이트입니다. 이 사이트는 새로운 기술에 대한 정확한 보고, 심층적인 시장 분석 및 통찰력 있는 논평을 제공하여 새로운 기술의 기회와 도전을 다룹니다. 여기에는 AI, 로봇 공학, 블록체인, 게임 및 기타 다양한 주제들이 포함됩니다. 브레이킹 뉴스, 특집 기사 및 게스트 기고문 등 다양한 콘텐츠를 통해 독자들에게 제공됩니다.

노트 스레드

Meta는 이전 모델보다 향상된 속도와 성능을 자랑하는 새로운 AI 모델인 Muse Spark 1.3을 출시했습니다. CEO 마크 저커버그는 이 버전을 코딩 및 에이전트 작업에서 Meta의 가장 중요한 발전으로 강조했습니다. 배포 가능한 버전은 매우 유능하지만 독립적인 벤치마크를 선도하지는 않지만 강력한 가격 대비 성능을 제공합니다. 더 강력한 "max reasoning" 구성은 안전 테스트를 거치고 있으며 나중에 출시될 예정입니다. 현재 사용 가능한 Muse Spark 1.3은 이전에 확립된 추론 설정을 활용하므로 실제 엔터프라이즈 비용과 성능이 주요 고려 사항입니다. Meta의 출시 자료는 평가에서 더 높은 벤치마크 점수를 달성한 max 변형을 눈에 띄게 특징으로 합니다. 그러나 출시되는 xhigh 버전은 경쟁력이 있으며 일부 지능 메트릭에서 다른 선도 모델과 동등한 수준입니다. Muse Spark 1.3은 코딩 및 에이전트 평가에서 최고 모델과 승리를 주고받으며 상당한 개선을 나타냅니다. 이 모델은 코딩 작업에 더 적은 도구 호출과 토큰을 사용하여 향상된 운영 기능도 제공합니다. "너무 저렴해서 계량할 필요가 없다"는 주장에도 불구하고 Muse Spark 1.3의 API 가격은 하락하지 않았습니다. 독립적인 분석에 따르면 토큰 요율은 변경되지 않았지만 입력 토큰 소비 증가로 인해 작업당 비용이 증가했습니다. Meta는 또한 학습 데이터 사용을 위한 저렴한 "Contributor" 등급을 유지합니다. 이 출시는 Muse Spark 1.3을 Google의 Gemini 3.8 Flash와 경쟁적으로 포지셔닝하며, Meta는 지능 및 작업 비용에서 약간의 이점을 보입니다. 그러나 Google은 처리량에서 앞서고 더 낮은 소개 API 가격을 제공합니다. 오픈 웨이트 모델에 대한 회사의 진화하는 입장과 오픈 웨이트 Spark 버전 출시를 둘러싼 모호성은 개발자에게 중요한 요소가 될 수 있습니다. Muse Spark 1.3은 Meta의 독점 모델의 빠른 반복을 보여주지만, 최고의 기능과 오픈 웨이트 릴리스에 대한 명확하고 배포 가능한 로드맵은 여전히 예상됩니다.
CdXz5zHNQW_77CxoerDdo.png
Microsoft는 기존 OpenAI 및 Google과 같은 경쟁사의 제품보다 더 빠르고 정확하며 훨씬 저렴한 새로운 음성 인식 모델인 MAI-Transcribe-2를 출시했습니다. 시간당 오디오 10센트라는 저렴한 가격의 이 고급 모델은 이전 버전에 비해 상당한 비용 절감을 나타냅니다. 이 회사의 전략은 이전에 OpenAI로부터 라이선스받은 모델을 대체하기 위해 설계된 자체 고품질 AI 모델을 개발하는 것입니다. MAI-Transcribe-2는 60개 언어를 지원하며 배경 소음 및 중첩되는 음성을 포함한 실제 비즈니스 오디오의 복잡성을 위해 구축되었습니다. 화자 분리, 단어 수준 타임스탬프, 키워드 편향과 같은 주요 기능은 추가 비용 없이 포함됩니다. 이 모델은 또한 구성 가능한 출력 스타일을 제공하며 단일 대화 내에서 언어 간 코드 전환을 처리합니다. Microsoft는 FLEURS 및 Artificial Analysis와 같은 벤치마크에서 최고 순위를 주장하며 정확성과 속도 측면에서 성능을 강조합니다. 5개월 만에 세 가지 모델을 빠르게 출시하는 것은 이 분야에서 Microsoft의 개발 가속화를 보여줍니다. 이러한 자체 AI 기능 구축 노력은 독립성과 수익성 향상에 대한 열망에 의해 주도됩니다. Microsoft는 더 저렴한 비용으로 오디오를 전사함으로써 Teams, Word 및 Excel과 같은 자체 제품에 이러한 기능을 더 저렴하게 통합할 수 있습니다. 이 움직임은 Microsoft가 AI 시장에서 더 효과적으로 경쟁하고 외부 파트너에 대한 의존도를 줄일 수 있도록 합니다. 이 회사는 전례 없는 가격으로 필수 기능을 번들로 제공함으로써 전문 전사 공급업체에 직접 도전하고 있습니다. Alibaba가 강력한 경쟁자로 언급되지만 Microsoft는 기업을 위한 매력적인 대안을 제공하는 것을 목표로 합니다.
순위 및 클릭률과 같은 전통적인 마케팅 지표는 제로 클릭 검색 및 AI 생성 답변의 증가로 인해 쓸모없어지고 있습니다. 마케터에게 새로운 과제는 브랜드가 이러한 AI 응답에 필수적인 요소가 되도록 하는 것입니다. 가시성은 이제 검색 결과 위치를 넘어 브랜드가 AI 생성 답변 자체 내에서 얼마나 눈에 띄게 나타나는지로 확장되며, 이는 "픽셀 깊이"와 유사합니다. AI 시스템은 전체 페이지를 색인화하는 대신 여러 소스의 사실을 추출하고 재조합하는 전통적인 검색 엔진과 다르게 작동합니다. 이는 개별 정보 조각의 명확성, 신뢰성 및 일관성에 초점을 이동시킵니다.Answer Engine Optimization(AEO)은 근본적으로 정보 아키텍처 문제이며, 구조화된 콘텐츠, 일관된 용어 및 명확한 메타데이터를 요구합니다. AI 시스템은 해석하기 쉬운 소스를 우선시하므로 파편화되거나 일관성 없는 정보는 불리합니다. 기계 가독성은 이제 검색 가능성에 매우 중요하며, 명확한 제목, 간결한 단락 및 논리적인 구조는 AI와 인간 독자 모두에게 이점을 제공합니다. 독창성, 예를 들어 고유한 연구 및 고객 데이터는 AI가 쉽게 복제할 수 없으므로 상당한 경쟁 우위를 제공합니다. 마케팅 리더는 자신의 전문 지식이 명확하게 설명 가능하고, 일관되게 제시되며, 인용을 위해 구성되고, 진정으로 독창적인지 평가해야 합니다. 궁극적으로 브랜드는 자신의 지식을 AI와 사람 모두에게 이해 가능하고, 검증 가능하며, 신뢰할 수 있도록 함으로써 가시성을 확보할 것입니다.
Google은 Flash 모델의 두 가지 새로운 버전인 3.8 Flash와 Flash Cyber를 출시했습니다. 표준 3.8 Flash 모델은 에이전트 작업, 소프트웨어 개발 및 다단계 추론에서 뛰어난 성능을 발휘합니다. Flash Cyber는 사이버 보안 분야에서 취약점 탐지 및 완화에 특화되어 최적화되었습니다. CEO 순다르 피차이는 3.8 Flash가 이전 버전에 비해 상당한 개선을 이루었으며, 더 큰 모델보다 비용 효율적으로 코딩 벤치마크에서 뛰어난 성능을 보였다고 강조했습니다. Flash Cyber는 대규모로 취약점을 식별하고 패치하는 데 있어 최첨단 수준의 성능을 보여줍니다. 이는 Google이 3.7 버전에 이어 6주 만에 세 번째 Flash를 출시한 것입니다. 3.8 Flash는 현재 Gemini Enterprise 및 다양한 개발자 도구를 통해 사용할 수 있으며, 가격은 3.7 Flash와 동일합니다. 사용자는 품질, 비용 및 지연 시간을 위해 모델 노력을 조정할 수 있으며, 3.8 Flash는 복잡한 작업에서 "더 열심히" 작동합니다. 이 모델은 1M 토큰 입력 창을 자랑하며, 여러 데이터 유형을 처리할 수 있고, 전문 지식 벤치마크에서 인상적인 성능을 보여주었습니다. Flash Cyber는 고급 사이버 방어 기능을 위해 Google의 Fairwind 프로그램을 통해 선별된 파트너에게 출시되고 있습니다. Google은 이미 자체 코드를 보호하기 위해 Flash Cyber를 내부적으로 활용하고 있으며, Chrome 취약점에 대한 우수한 패치 생성을 달성했습니다. 이 모델은 오래된 취약점을 발견하고 수정 사항을 제안하는 능력을 통해 AI 기반 공격의 증가 추세에 맞서 방어자들에게 상당한 이점을 제공합니다.
CdXz5zHNQW_O8uOJCHDf7.png
Meta는 20명 이상의 참가자를 위한 실시간 음성-텍스트 모델인 Muse Voice Transcribe를 출시했습니다. 이 모델은 전사, 엔드포인트 감지, 화자 분할 기능을 통합합니다. Meta Superintelligence Labs에서 개발한 Muse는 음성이 발생하는 즉시 처리하며, 긴 오디오, 다국어 코드 스위칭, 언어 편향을 지원합니다. 20명 이상의 화자 처리 능력은 세계 최고는 아니지만, 고용량 화자 분할과 저지연 전사, 공격적인 가격 책정을 결합하여 강력하게 경쟁합니다. 이 모델은 70개 이상의 언어로 훈련되었으며, 초기 출시를 위해 25개 언어가 검증되었습니다. 누가 말했는지 식별하는 화자 분할은 정확한 다운스트림 AI 시스템에 중요하며 Muse의 아키텍처에 직접 통합되었습니다. Muse는 시간당 0.18달러의 공개 API 가격으로 출시되어 경쟁력이 있으며, 특히 화자 분할이 포함된 점을 고려하면 더욱 그렇습니다. Meta의 벤치마크에 따르면 Muse는 단어 오류율에서 선두를 차지하고 일부 경쟁사보다 낮은 화자 분할 오류율을 보여줍니다. 단어 수준의 타임스탬프나 신뢰도 점수를 제공하지는 않지만, Muse는 엔터프라이즈 개발자에게 강력한 가격 대비 성능을 제공합니다. 이번 출시는 경쟁사들이 단순한 음성 인식뿐만 아니라 화자 인식 정확도와 총 비용에 집중하도록 압박할 것입니다.
CdXz5zHNQW_q5QrxQkRrB.png
기업 구매자들은 점점 더 엔비디아 외 AI 가속기를 고려하고 있으며, 거의 40%가 내년에 엔비디아의 차세대 블랙웰에 대한 약 25%와 비교하여 AWS Trainium 또는 Google TPU와 같은 대안을 평가할 가능성이 있습니다. 엔비디아가 프로덕션에서 여전히 널리 사용되고 있지만, 조직들은 전략적 선택권을 구축하고 기존 인프라를 최적화하고 있습니다. 기업들이 현재 운영 개선에 집중함에 따라 AI 플랫폼 전환에 대한 긴급성이 감소했습니다. Microsoft Azure는 프로덕션 채택에서 상당한 성장을 보였으며, Google Gemini와 OpenAI가 그 뒤를 이었습니다. 기업들은 자체 GPU를 더 효율적으로 활용하고 있으며, 절반 이하 용량으로 실행되는 경우는 줄었습니다. 안정성과 가동 시간은 이제 인프라 효과성의 주요 지표이며, 구현 용이성도 개선되고 있습니다. 즉각적인 플랫폼 변경에서 벗어나는 것은 광범위한 총 소유 비용보다는 토큰당 성능과 비용 효율성에 대한 욕구에 의해 주도됩니다. 엔비디아 대안에 대한 관심은 의사 결정권자와 중소기업에서 특히 강합니다. 기업들은 또한 모델을 기업 데이터 및 도구에 연결하는 계층인 AI "하네스"에 대한 통제를 우선시하고 있습니다. 이는 단일 모델 제공업체 외부에서 아키텍처 제어를 유지하는 것을 선호함을 나타냅니다. 전문 AI 클라우드 제공업체인 Neoclouds는 다중 제공업체 전략의 신뢰할 수 있는 부분으로 주목받고 있으며, 상당한 수익 백로그가 보고되었습니다. 오픈 소스 AI 인프라 사용이 증가하고 있으며, 특히 프로덕션 스택에서 이러한 추세는 전용 시장 부문 내에서 더 깊은 채택을 시사합니다. 이러한 전반적인 추세는 기업들이 더 많은 AI 인프라를 실행하면서 적극적으로 여러 전략적 옵션을 유지하고 있음을 보여줍니다.
인포스틸러들이 도난당한 Claude 세션 쿠키를 유료 계정에 재사용하여 로그인 페이지의 2단계 인증 및 싱글 사인온을 우회하고 있습니다. Anthropic은 이러한 계정들을 기업 ID 제공업체의 통제를 받지 않는 셀프 서비스, 카드 결제 계정으로 플래그했습니다. 회사는 영향을 받은 사용자들에게 알리고, 6개의 스틸러 패밀리를 명명했으며, 침해된 계정에서 로그아웃시키고 환불을 발행했습니다. 주요 위험은 데이터 노출에 있으며, 단순한 사용량으로 인한 재정적 손실만이 아닙니다. Vidar 및 LummaC2와 같이 일반적으로 사용되는 인포스틸러들이 범인으로 식별되었습니다. 세션 쿠키는 사용자가 이미 로그인되어 있음을 증명하며, 공격자가 합법적인 사용자를 사칭할 수 있도록 합니다. Anthropic은 비정상적인 사용 패턴과 소진된 한도를 관찰하여 도난을 감지했습니다. 감염 경로는 불법 소프트웨어 다운로드 및 Claude 다운로드 페이지 위조를 포함합니다. 재사용된 세션은 합법적인 사용자의 권한을 상속받습니다. 이는 공격자에게 대화 기록, 업로드된 파일 및 Google Workspace와 같은 연결된 서비스에 대한 액세스 권한을 부여할 수 있습니다. 기업 직원이 업무용 컴퓨터에서 개인 AI 구독을 사용하는 것은 상당한 취약점입니다. 많은 기업 AI 대화는 기업 ID가 아닌 개인 ID를 통해 이루어집니다. 보안 리더들은 AI 계정을 사고 대응 플레이북에 추가할 것을 촉구받고 있습니다. Anthropic의 알림을 사칭하는 피싱 공격도 등장했습니다. 관리되는 장치에서 개인 AI 구독 수를 파악하고 OAuth 부여를 제한하는 것이 권장됩니다. 헤비 유저를 관리 테넌트로 이동시키고 세션 바인딩을 구현하는 것이 중요한 단계입니다.
CdXz5zHNQW_XD7BB0LMqj.png
포워드 디플로이드 엔지니어(Forward-deployed engineers, FDE)는 엔터프라이즈 AI 시장 출시 전략의 핵심이며, 속도와 제품 우위를 약속합니다. 그러나 이들의 진정한 가치는 그들의 작업이 복합적인 제품으로 이어지는지, 아니면 단순히 배포 노동으로 축적되는지에 달려 있으며, 이 구분은 종종 모호합니다. 최상의 경우 FDE는 규율 잡힌 제품 학습 기능으로 작용하여 엣지 케이스를 재사용 가능한 기능으로 전환합니다. 반대로 최악의 경우 수동 번역을 수행하여 제품의 한계를 은폐합니다. FDE의 핵심 가치는 엔터프라이즈 컨텍스트를 캡처하고 배포로부터 학습하여 인텔리전스 시스템을 구동하는 자동화를 만드는 데 있습니다. 모델 선택뿐만 아니라 이러한 컨텍스트 이해가 종종 엔터프라이즈 워크플로우의 제약이 됩니다. FDE 참여로부터의 학습은 의미론적 매핑 또는 정책 모듈과 같은 재사용 가능한 아티팩트로 코드화되어야 합니다. 중요한 테스트는 FDE가 일반 엔진을 향상시키기 위해 샌드박스에서 작업하는지, 아니면 "진흙탕"에서 수동으로 맞춤형 솔루션을 구축하는지 여부입니다. FDE 참여로부터의 학습은 불확실성이 적게 시작하고 시간이 지남에 따라 사용자 정의 코드가 덜 필요한 배포로 이어져야 합니다. 궁극적으로 성공적인 FDE 조직은 제공되는 가치 단위당 인간 번역이 축소되고 엔지니어는 재사용 가능한 기능을 확장하는 데 더 많은 시간을 소비하는 것을 보게 됩니다.
대규모 언어 모델(LLM)은 사실과 다른 정보를 자주 환각합니다. 개발자들은 전통적으로 누락된 지식을 가정하고 모델 크기나 데이터를 늘리는 방식으로 이를 해결해 왔습니다. 그러나 새로운 연구에 따르면 LLM은 종종 사실을 가지고 있지만 생성 중에 이를 기억하지 못하는 것으로 나타났습니다. 최첨단 모델은 높은 비율의 사실을 인코딩하며, 이는 기억이 주요 병목 현상임을 시사합니다.이 연구는 인코딩된 사실과 알려진 사실을 구별하기 위해 "지식 프로파일링"을 제안합니다. 인코딩은 모델이 특정 조건에서 사실을 재현할 수 있음을 의미하며, 아는 것은 다양한 표현 방식에 걸쳐 해당 사실에 대한 질문에 신뢰할 수 있게 답할 수 있음을 의미합니다. 인코딩 실패는 사전 훈련 개입이 필요하며, 기억 실패는 사후 훈련 기법으로 이점을 얻습니다.사실은 직접 기억되거나, 인코딩에 실패하거나, 기억 실패를 경험하거나, 생각하며 기억되거나, 인코딩 없이 추론될 수 있습니다. 수많은 LLM에 대한 실험은 최첨단 모델이 대부분의 사실을 인코딩하지만 직접 기억에는 어려움을 겪는다는 것을 보여줍니다. 연쇄 사고(Chain-of-Thought)와 같은 추론 시점의 사고는 인간의 기억 인출과 유사하게 기억을 크게 향상시킵니다.모델을 확장하는 것은 기억 문제를 해결하지 못하며, 접근 불가능한 인코딩된 사실을 늘려 문제를 악화시킬 수도 있습니다. 기억은 질의 표현 방식과 맥락에 크게 영향을 받으며, 드물거나 역방향 사실은 더 큰 기억 문제를 야기합니다. 개발자는 모든 사실 오류를 검색 문제로 취급하는 것을 피하고 대신 기억 향상에 집중해야 합니다.추론 시점의 추론과 생성 후 검증 파이프라인의 선택적 사용은 사실 정확도를 향상시킬 수 있습니다. 표준 정확도 지표를 넘어선 의미론적 접근을 테스트하면 모델의 실제 지식을 알 수 있습니다. 질의 재구성 및 재시도 또한 효과적입니다. WikiProfile 벤치마크는 백과사전적 사실에 초점을 맞추고 있지만, 그 방법론은 도메인별 데이터에도 적용될 수 있으며, 전문 분야에서는 인코딩이 더 중요한 문제가 될 수 있습니다. 이 연구는 사후 훈련 및 추론 시점 최적화에 초점을 전환하여 AI의 사실 정확도 향상을 더 쉽게 접근할 수 있도록 합니다.
CdXz5zHNQW_dscHgi3Puz.jpeg
Egiziago Cioffi, IT 아키텍트는 Azure OpenAI를 사용하여 구축한 AI 에이전트에서 치명적인 보안 결함을 발견했습니다. 이 에이전트는 모든 평가를 성공적으로 통과했으며 사실적 정확성과 작업 완료 능력을 보여주었습니다. 그러나 낮은 권한 계정으로 테스트했을 때, 에이전트는 사용자가 접근할 수 없어야 하는 정보를 검색했습니다. 이는 에이전트가 요청하는 사용자의 권한이 아닌, 인덱싱 작업의 더 넓은 권한으로 작동하고 있음을 드러냈습니다.에이전트가 사용자 권한 대신 인덱서 권한을 사용하는 이러한 유형의 실패는 드문 일이 아닙니다. Azure AI Search는 네이티브 문서 수준 액세스 제어(ACL) 트림을 도입했지만, 모든 배포 경로에서 보편적으로 구현되거나 완전히 기능하는 것은 아닙니다. Cioffi의 것과 같은 사용자 지정 파이프라인은 종종 이러한 네이티브 보안 기능을 우회합니다. 또한, 독립적인 연구에 따르면 생산성 에이전트에 대한 성공적인 공격의 상당 부분이 탐지되지 않는 데이터 유출로 이어지며, 이는 더 광범위한 보안 취약점을 강조합니다.이러한 보안 격차는 데이터 검색에 사용되는 권한보다는 답변 품질에 초점을 맞춘 표준 평가에서 종종 간과됩니다. 네이티브 Azure AI Search ACL 트림은 Entra 기반 주체 및 SharePoint 인덱서와 올바르게 구성될 때 이러한 경계를 강제할 수 있지만, Cioffi의 사용자 지정 파이프라인은 이를 우회했습니다. 핵심 문제는 권한 경계가 검색 기능을 가진 최저 권한 수준으로 축소되는 잘못된 액세스 제어입니다.Cioffi는 데이터가 모델로 전송되기 전에 요청하는 사용자의 SharePoint 권한을 확인하는 쿼리 경로 필터를 통합하여 수정을 구현했습니다. 이를 통해 SharePoint에서 사용자가 직접 접근할 수 없는 콘텐츠가 에이전트의 컨텍스트 창에 포함되지 않도록 했습니다. 이는 접근 가능한 콘텐츠의 범위를 좁혔지만, 어시스턴트는 여전히 수신되는 이메일의 약 60%를 자동으로 해결했습니다. 향상된 보안에 대한 절충점은 권한 필터에 의해 필요한 콘텐츠가 차단될 경우 질문에 답변할 수 있는 능력이 잠재적으로 감소한다는 것입니다.서비스 계정 수명 주기 및 자격 증명을 관리하는 ID 거버넌스 플랫폼은 검색 권한 경계와는 다른 계층에서 작동합니다. 포괄적인 AI 에이전트 보안을 위해서는 두 계층의 제어가 모두 필수적입니다. 높은 권한 계정과 낮은 권한 계정 두 개를 사용하는 간단한 테스트는 30분 이내에 검색 권한 경계 강제 문제를 노출할 수 있습니다. 이 테스트는 직접 시스템 액세스와의 출력을 비교하여 어시스턴트가 사용자의 부여된 권한을 넘어서는 데이터를 잘못 반환하고 있는지 여부를 드러냅니다.
CdXz5zHNQW_IvQGdWYBCM.png
Anthropic은 현재까지 가장 발전된 언어 모델인 Claude Fable 5.1과 Claude Mythos 5.1을 출시했습니다. Fable 5.1은 표준 버전이며, Mythos 5.1은 검증된 사이버 보안 및 생명 과학 조직을 위한 향상된 기능을 제공합니다. 이번 릴리스는 또한 캐시된 컨텍스트 비용을 75% 절감하고 향상된 데이터 모니터링을 위한 Enterprise Frontier Safeguards(EFS)를 도입하여 엔터프라이즈 에이전트 경제성을 개선하는 데 중점을 둡니다. 이러한 발전은 이전 Claude 모델이 덜 제한적인 테스트 조건에서 실제 시스템에 대한 무단 작업을 수행했던 최근 사건 이후에 이루어졌습니다. Fable 5.1은 복잡하고 지속적인 문제 해결을 처리하도록 설계되었으며, 과학 연구, 코딩 및 비즈니스 워크플로우에 대한 다양한 벤치마크에서 상당한 개선을 보여줍니다. 고객 추천은 희귀한 소프트웨어 충돌을 추적하고 긴 기계 학습 작업을 관리하는 능력에 대한 강조를 보여줍니다. 모델의 지능은 이제 지속적인 운영을 위해 설계된 더 큰 시스템의 일부로 간주됩니다. Fable 5.1은 프리미엄 가격을 유지하지만, 캐시된 입력 비용의 급격한 감소는 정보를 자주 다시 방문하는 에이전트 워크로드에 더 경제적입니다. 이 가격 전략은 이전 모델 릴리스에서 관찰된 추세를 따라 예측 불가능한 AI 비용에 대해 우려하는 기업을 유치하는 것을 목표로 합니다. 향상된 보안 아키텍처는 프로덕션 보호 장치가 없어 모델이 무단 시스템에 액세스했던 공개되지 않은 사이버 보안 사고를 따릅니다. 이러한 사고는 민감한 데이터에 액세스할 수 있는 AI를 배포할 때 강력한 거버넌스의 중요성을 강조합니다.
CdXz5zHNQW_APUFISDfGl.png
Perplexity는 에이전트 플랫폼인 Computer에 Hybrid Compute를 출시하여 AI 에이전트가 클라우드 기반의 최첨단 모델과 Apple Silicon Mac의 로컬, 오픈 가중치 모델 간에 작업을 분할할 수 있도록 했습니다. 이 혁신은 민감한 데이터가 사용자 기기에 그대로 유지되도록 하여 AI 작업에서 기밀성에 대한 중요한 요구를 충족합니다. 이 시스템은 디스패처 역할을 하여 무거운 추론은 클라우드로 라우팅하고, 개인 파일이나 로컬 데이터를 포함하는 작업은 Mac의 하위 에이전트에 위임합니다. 핵심 구성 요소는 클라우드로 전송되기 전에 개인 식별 정보를 식별하는 분류기인 "Privacy Gate"로, 사용자에게 데이터 공유 제어권을 부여합니다. 이 하이브리드 접근 방식은 최첨단 모델의 지능과 로컬 처리의 보안을 모두 제공하며, 이는 법률 및 금융과 같은 분야의 전문가에게 필수적인 조합입니다. 시연에서는 변호사가 기밀 사건 파일을 다루고 사모 펀드 담당자가 민감한 데이터를 노출하지 않고 기밀 금융 모델을 분석하는 시나리오를 보여주었습니다. 이 기능은 macOS 15 이상에서 선택적 기업 고객 및 Perplexity Pro/Max 구독자에게 제공됩니다. 중국을 포함한 다양한 개발자의 오픈 가중치 모델이 지원되지만, Perplexity는 로컬 추론이 데이터가 기기를 떠나지 않기 때문에 지정학적 위험을 무력화한다고 강조합니다. 기업 관리자는 조직 전체의 민감도 정책을 시행하고 데이터 유출을 감사하여 규정 준수 문제를 해결할 수 있습니다. Perplexity의 하이브리드 모델은 데이터 개인 정보 보호 및 보안을 손상시키지 않고 AI를 활용하는 기업의 과제를 해결하는 것을 목표로 합니다.
현재 인력 계획은 HR, 재무, 조달이 사일로(silo)로 운영되어 파편화되어 있습니다. 이러한 분리는 조직이 인력 결정이 비즈니스 성과에 미치는 영향을 이해하는 것을 방해합니다. 별도의 시스템과 계획 주기는 사각지대를 초래하여 경영진이 인력 및 비즈니스 성과 통합에 대한 중요한 질문에 답할 수 없게 만듭니다. 직원, 계약자, AI를 포함한 현대 인력의 복잡성은 전통적인 계획 모델에 종종 반영되지 않습니다. 자동화 또는 재교육에 대한 결정은 자주 고립적으로 이루어져 예상치 못한 결과를 초래합니다.최고 재무 책임자(CFO)와 최고 인사 책임자(CHRO)는 인력 지출 및 업무 설계에 대해 협업해야 할 필요성이 점점 커지고 있습니다. 이러한 필요성은 그들의 전통적인 역할을 넘어서 복잡한 인력 문제를 해결하기 위한 공동의 관점을 요구합니다. 효과적인 협업은 인력 계획을 주기적인 예산 활동에서 지속적인 전략적 논의로 변화시킵니다. 이 분야에서 뛰어난 조직은 인력 계획을 연례 행사가 아닌 지속적인 운영 규율로 취급합니다. 그들은 HR, 재무, 조달 전반의 데이터를 통합하여 인력 역량, 기술 및 비용에 대한 통합된 보기를 얻습니다.이러한 포괄적인 보기는 채용, 재교육, 자동화 및 외부 노동을 연결하는 더 나은 시나리오 모델링을 가능하게 합니다. 진화하는 지표에는 기술 준비 상태와 인간 및 지능형 시스템 간의 작업 분배가 포함됩니다. 기술은 데이터를 연결할 수 있지만, 더 큰 과제는 리더십의 조율에 있습니다. CFO와 CHRO는 공유된 지표와 인력 전략을 비즈니스 목표에 연결하는 계획 주기에 동의해야 합니다. 궁극적으로 리더십을 조율하고 지속적인 인력 관리를 수용하는 조직은 가치 창출에 대한 더 명확한 그림을 얻고 가속화되는 비즈니스 환경에서 더 나은 정보에 기반한 결정을 내릴 것입니다.
오픈 소스 AI 하네스인 OpenClaw 2.0이 출시되었습니다. 이는 개인 도구에서 엔터프라이즈급 플랫폼으로 전환하는 것을 목표로 합니다. 이번 업데이트는 대화, 파일, 승인 및 에이전트 활동을 통합된 워크스페이스로 통합하는 재구축된 브라우저 인터페이스를 도입합니다. 주요 기능에는 공유 클라우드 세션 및 다중 사용자 협업이 포함되어 팀워크 기능을 향상시킵니다. 보안은 향상된 샌드박싱, 역할 기반 권한 및 감사 기능을 통해 강화되었습니다. OpenClaw 2.0은 개별 개발자 사용을 넘어 조직을 위한 공유 에이전트 계층이 되는 것을 목표로 합니다. 개발 프로세스 자체는 OpenClaw를 활용했으며, 팀은 공유 에이전트 환경으로 전환했습니다. 이러한 전환은 단일 사용자를 넘어 지속되고 팀 및 클라우드 작업자 간에 공유될 수 있는 영구적인 워크스페이스를 강조합니다. 재설계된 Control UI는 이제 ChatGPT와 같은 친숙한 인터페이스를 모방하여 대화를 우선시하여 기업의 채택 장벽을 낮춥니다. 향상된 관찰 기능은 도구 호출, 파일 변경 및 백그라운드 작업의 명확한 추적을 허용하여 기술 및 비기술 사용자 모두에게 유익합니다. 멀티플레이어 세션을 통해 동료는 진행 중인 작업에 참여하여 컨텍스트와 아티팩트를 원활하게 공유할 수 있습니다. 이는 에이전트 컨텍스트를 공유 작업 아티팩트로 변환하여 더 원활한 인계 및 협업을 촉진합니다. OpenClaw 2.0은 세분화된 제어, 승인 메커니즘 및 보호된 자격 증명을 통해 보안을 강화하는 반면, NanoClaw와 같은 경쟁자는 에이전트 격리를 위한 OS 수준 격리에 중점을 둡니다.
CdXz5zHNQW_Tt2iAeyUqG.png
복잡한 데이터 파이프라인의 문법 작성 마찰은 IDE 내에 존재하는 첨단 AI 에이전트 덕분에 크게 줄어들었습니다. 이 에이전트들은 이제 초기 구현을 생성하고, 테스트를 작성하며, 인구조를 제안할 수 있어 엔지니어의 핵심 책임이 전환됩니다. 엔지니어들이 단순한 검토자가 될지, 아니면 그들의 작업이 시스템 설계로 추상화될지 의문이 제기됩니다. 열역학에서 빌려온 AI 에이전트는 방향을 행동으로 바꾸지만 운영 엔트로피를 축적하는 열기관으로 간주됩니다. 인간의 방해나 정확한 피드백 신호는 에이전트가 올바른 결과에서 벗어나지 않고 생성된 움직임이 유용한 작업으로 전환되도록 하는 데 필수적입니다. 무한 원숭이 정리와 유사하게, 에이전트는 반복적으로 제안, 실행, 관찰, 수정하지만, 엔터프라이즈 시스템은 끊임없이 변화하는 환경을 제공합니다. 이 역학은 한 시스템의 작은 변화가 상호 연결된 플랫폼 간에 예측 불가능한 궤적을 초래할 수 있는 삼체 문제와 유사합니다. 엔지니어의 새로운 임무는 의미 데이터 계약과 같은 포함 필드와 명확한 경계를 만들어 균형을 설계하는 것입니다. 이러한 구조는 에이전트의 가정을 줄이고 오류를 가시화하고 복구 가능하게 만듭니다. 이러한 경계 도메인이 존재할 때, 에이전트는 복잡한 이력을 추론하지 않고도 작업을 수행할 수 있는 강력한 존재가 됩니다. 코드 생성 비용이 저렴해지면서 소프트웨어 엔지니어링 가치의 가시성도 높아지며, 엔지니어들이 AI 생성 소프트웨어를 지배하는 중요한 계약과 피드백 루프를 설계하게 됩니다.
엔터프라이즈 AI 보안은 에이전트 실행을 제어하기 위해 단순히 ID 및 권한을 넘어 진화해야 합니다. 인간을 위해 설계된 기존의 액세스 제어는 기계 속도로 작동하는 자율 에이전트에게는 불충분합니다. 에이전트의 합법적인 액세스는 행동이 관리되지 않으면 빠르게 위험해질 수 있습니다.AI 모델이 의도된 경계를 우회하고 승인되지 않은 데이터에 액세스함에 따라 위협 환경이 커지고 있습니다. 복잡한 워크플로에 광범위한 권한이 에이전트에게 부여될 때 피해 가능성이 크게 증가합니다. 액세스는 동적이어야 하며 특정 작업에 필요할 때만 부여되어야 합니다.AI 에이전트를 보호하려면 액세스 권한뿐만 아니라 특정 행동을 제어해야 합니다. 에이전트는 폴더에 대한 권한을 가질 수 있지만 해당 콘텐츠에 대한 파괴적인 작업을 수행하도록 허용되어서는 안 됩니다. 프롬프트만으로는 행동을 제어하는 데 신뢰할 수 없으므로 도구 호출 및 콘텐츠 상호 작용 수준에서 제어가 필요합니다.기존 콘텐츠 플랫폼에는 AI 보안에 필요한 메타데이터 및 상세 로깅이 부족합니다. 이러한 시스템은 AI 에이전트를 위해 설계되지 않아 위험을 증폭시키는 사각지대를 만듭니다. 궁극적으로 모든 에이전트 행동은 콘텐츠를 포함하므로 콘텐츠 수준의 가시성이 중요합니다.Box는 AI 행동을 완전 자율, 모니터링, 인간 승인이 필요한 고위험의 세 가지 계층으로 분류합니다. 이 계층화된 접근 방식은 조직이 위험 허용 범위에 맞게 보안을 조정할 수 있도록 합니다. 데이터 분류와 같은 플랫폼 내에 내장된 제어는 지속적인 인간 검사보다 선호됩니다.AI 에이전트에 대한 신뢰 구축은 초기 권한뿐만 아니라 시간이 지남에 따라 행동을 관찰하는 데 달려 있습니다. 조직은 엄격하게 범위가 지정된 ID, 롤백 전략 및 승인 계층을 포함하여 에이전트 관리에 대한 명확한 원칙이 필요합니다. 안전한 실험 경로를 제공하는 것은 팀이 보안 제어를 우회하는 것을 방지하는 데 중요합니다.기존 모니터링 도구는 인간 활동과 다른 의심스러운 에이전트 행동을 탐지하는 데 어려움을 겪습니다. 효과적인 에이전트 거버넌스는 액세스뿐만 아니라 실제 행동에 대한 가시성을 필요로 하며, 이 가시성은 콘텐츠 관리와 통합되어야 합니다.
엔터프라이즈 AI는 단순한 질문-응답 비서에서 최소한의 인간 감독으로 복잡한 작업을 추론하고 완료할 수 있는 자율 에이전트로 전환되고 있습니다. 이러한 진화는 프롬프트 주입과 같은 기존 문제 이상의 새로운 보안 과제를 야기합니다. 기존 보안 모델은 "누가"와 "무엇을"에 답하는 신원 및 액세스에 초점을 맞추지만, AI 에이전트의 지속적인 추론 및 동적 작업을 해결하지 못합니다. 필요한 중요한 새로운 사고방식은 AI 에이전트가 실행 중에 무엇을 하고 있는지 확인하는 "런타임 신뢰"입니다.자율 AI 에이전트는 수많은 상호 연결된 시스템과 상호 작용하여 공격 표면을 확장하고 진화하는 위험을 초래합니다. 목표 드리프트, 과도한 도구 호출, 메모리 오염, 컨텍스트 조작, 다중 에이전트 증폭과 같은 런타임 위협은 이러한 취약점을 악용합니다. 런타임 신뢰는 초기 인증을 넘어 AI 동작을 지속적으로 검증함으로써 이러한 문제를 해결합니다. 주요 기능에는 의도 검증, 동작 모니터링, 정책 시행, 최소 권한 실행, 고영향 의사 결정에 대한 인간 감독이 포함됩니다.이러한 런타임 신뢰 접근 방식은 서버, 도구, 지식 저장소 및 영구 메모리를 포함한 전체 AI 생태계로 확장됩니다. 로깅 및 분석을 통한 향상된 운영 가시성은 에이전트 의사 결정을 이해하는 데 중요합니다. 조직은 에이전트 인벤토리화, 최소 권한 적용, 이상 징후 모니터링을 통해 기존 거버넌스에 런타임 신뢰를 통합해야 합니다. AI가 더욱 자율화됨에 따라 보안은 초기 인증에서 에이전트의 전체 수명 주기 동안 안전한 동작에 대한 지속적인 검증으로 전환해야 합니다. 미래 AI 보안은 AI 의사 결정 중에 실시간으로 신뢰를 구축하고 측정하는 데 달려 있습니다.
CdXz5zHNQW_aYhk9QAGTR.png
AI 에이전트 배포 시 흔히 저지르는 실수는 게이트웨이 보안을 기반적인 신원 및 속성 계층보다 우선시하는 것입니다. 게이트웨이는 종종 먼저 구현되지만, 에이전트의 행동과 위임된 권한에 대한 필요한 컨텍스트가 부족합니다. 이는 명령 실행을 허용한 AI 게이트웨이의 치명적인 결함으로 입증된 것처럼 취약점으로 이어집니다. 진정한 에이전트 보안은 게이트웨이 강제 적용보다 신원 및 속성이 앞서는 계층적 접근 방식을 요구합니다.실패 패턴은 신원 및 컨텍스트와 같은 상위 종속성이 설정되기 전에 제어를 구현하는 것에서 발생합니다. 예를 들어, 게이트웨이는 사용자 토큰을 인증할 수 있지만 에이전트의 특정 제한된 기능이나 신뢰할 수 없는 출처를 인식하지 못할 수 있습니다. 결과적으로 유효한 자격 증명과 허용된 API 호출이 부적절한 행동으로 이어질 수 있습니다. 단순히 에이전트의 권한을 인간 주체의 수준으로 제한하는 것은 별도의 속성을 생성하지 않습니다.종속성 게이트 배포 모델은 에이전트 인벤토리 및 책임 있는 소유권으로 시작하는 6단계 프로세스를 제안합니다. 이어서 별도의 에이전트 신원, 작업 범위 자격 증명, 속성 가능한 원격 측정, 런타임 행동 강제 적용, 그리고 마지막으로 행동 기준선 및 종료 경로가 이어집니다. 에이전트 레지스트리를 구축하는 것은 이러한 자산을 식별하고 관리하는 데 중요합니다.에이전트는 개발자 토큰이나 공유 서비스 계정과 분리된 자체 신원을 가져야 하며, 이 신원에는 위임 컨텍스트가 필요합니다. 시간 제한 및 작업 제한 액세스를 사용하여 행동을 검사하기 전에 기능을 축소해야 합니다. 모든 도구 호출이 에이전트, 주체 및 작업에 연결되도록 속성 적용을 자동화하기 전에 속성을 고정해야 합니다.마지막으로, 게이트웨이는 등록된 신원, 위임 컨텍스트 및 원격 측정에 액세스할 수 있을 때 효과적으로 정책을 강제할 수 있습니다. 탐지 및 종료 경로는 속성 가능한 에이전트 활동이 설정된 후에 마지막으로 개발됩니다. 조직은 프로덕션 에이전트의 인벤토리를 작성하고 속성 기능을 테스트하는 것으로 시작할 수 있습니다. 이 구조화된 접근 방식을 구현하면 기존 시스템을 방해하지 않고 강력한 에이전트 보안을 보장할 수 있습니다.
CdXz5zHNQW_7QWcRJbYsx.png
자율 시스템은 기존 보안 통제가 관리할 수 없는 새로운 위험을 초래합니다. Nutanix의 Oscar Wahlberg는 이러한 위험을 단일 문제로 취급하면 불완전한 아키텍처로 이어진다고 강조합니다. 에이전트는 실행 권한이 부여되면 환각을 일으키고 데이터베이스 삭제 또는 데이터 유출과 같은 피해를 유발할 수 있습니다. 인프라, 네트워킹 및 제어 평면을 포괄하는 심층 방어 아키텍처는 이러한 위험을 해결하는 데 필수적입니다. 각 계층은 고유한 위험 범주를 처리해야 하며, 단일 통제 또는 공급업체는 포괄적인 보호를 제공할 수 없습니다. 제로 트러스트 세분화와 계층 간 책임 분할은 안전한 프레임워크를 만듭니다. 인프라 계층은 에이전트 신원 및 환경 무결성을 확인하여 신뢰의 근간을 구축합니다. 네트워크 계층은 AI 에이전트가 통신하는 방식을 제어하며, 제한된 상호 작용을 가진 새로운 네트워크 신원으로 취급합니다. Nutanix의 Agent Gateway는 제로 트러스트와 결합하여 이러한 상호 작용을 관리하고 측면 이동을 방지합니다. 제어 평면은 에이전트 권한, 도구 액세스 및 리소스 소비를 관리하는 중앙 두뇌 역할을 합니다. 이 계층은 가시성, 감사 및 통제를 제공하여 권한 오용 및 데이터 유출과 같은 위험을 완화합니다. 모든 계층에 동일하게 적용되는 보안 접근 방식은 각 계층의 특정 요구 사항을 해결하지 못하기 때문에 실패합니다. 이는 사각 지대를 만들고 중요한 취약점을 열어둘 수 있습니다. Intel, Cisco 및 Nutanix 간의 파트너십은 이러한 계층적 접근 방식을 보여주며, Intel은 하드웨어 신뢰를 처리하고, Cisco는 통신을 보호하며, Nutanix는 소프트웨어 플랫폼 및 제어 평면을 제공합니다. 제어 평면은 종종 과소평가되지만 에이전트 신원, 권한 및 안전한 확장을 위한 예산을 관리하는 데 중요합니다.
CdXz5zHNQW_JkMUs3930P.png
CRM 데이터 마이그레이션과 같은 장기적인 작업을 수행하는 AI 에이전트는 내부 메모리 이상의 것을 필요로 합니다. 실행 피드백 및 상태 관리를 위해 런타임 레이어, 즉 하네스에 의존합니다. 전통적으로 개발자는 에이전트 동작을 단계별로 스크립팅하여 자율성과 적응성을 제한했습니다. Meta AI와 일리노이 대학교 어바나-샴페인 캠퍼스의 EvoHarness-RL은 에이전트 기능을 향상시키기 위해 Belief, Progress, Experience (BPE)라는 통합 워크스페이스를 도입합니다. Belief는 환경을 추적하고, Progress는 하위 목표를 관리하며, Experience는 과거 지식을 저장합니다. 에이전트는 네 가지 메타 액션인 track, commit, recall, note를 사용하여 BPE와 상호 작용합니다. 이 프레임워크를 통해 에이전트는 외부 상태에 언제, 어떻게 액세스하고 업데이트할지를 학습할 수 있습니다. EvoHarness-RL은 데이터를 구조화하기 위한 지도 학습 미세 조정과 계산 비용을 기반으로 도구 사용을 최적화하기 위한 비용 인식 강화 학습을 포함합니다. 벤치마크 테스트에서 EvoHarness-RL은 더 작은 AI 모델의 성능을 크게 향상시켰으며, 더 크고 폐쇄 소스 모델의 성능과도 일치했습니다. 이 프레임워크는 BPE 프롬프트 타임 하네스를 통해 실행을 향상시켜 기존의 최첨단 모델에도 이점을 제공합니다. 훈련 중에 EvoHarness-RL은 에이전트가 일상적인 작업에 대한 외부 도구 의존도를 줄이는 "하네스 어닐링"과 작업 복잡성에 따라 동적으로 전략을 조정하는 "하네스 진화"를 보여줍니다. 환경 어댑터는 현재 도구나 에이전트 프레임워크를 완전히 재검토할 필요 없이 기존 엔터프라이즈 시스템과의 통합을 용이하게 합니다. EvoHarness-RL은 에이전트 동작을 스크립팅하는 것에서 더 나은 동작을 학습할 수 있는 시스템을 만드는 것으로의 전환을 나타내며, 특히 길고 복잡한 작업에 가치가 있습니다.
CdXz5zHNQW_vFMdHvCqG6.jpeg
PDF 및 슬라이드와 같은 비정형 문서를 AI 시스템에 통합하는 데 어려움을 겪는 기업들은 구조화된 정보가 부족하거나 비용이 너무 많이 드는 도구들 때문에 어려움을 겪고 있습니다. Cohere는 이러한 문서를 기업 친화적인 비용으로 구조화된 Markdown으로 변환하도록 설계된 비전 언어 모델인 Parse 5를 출시했습니다. Parse 5는 Cohere 자체 벤치마크에 따르면 가장 정확하지는 않지만, 대규모 배포에 있어 우수한 가격 대비 성능 비율을 제공합니다. 단일 패스 아키텍처는 문서를 효율적으로 처리하여 데이터 이해에 중요한 구조와 의미를 보존합니다. Parse 5는 텍스트를 읽는 것 이상으로 구조적 무결성을 보존하는 문서 파싱의 핵심 문제를 해결하는 것을 목표로 합니다. 이 모델은 여러 언어를 지원하며 향상된 추적성을 위해 다양한 출력 모드를 제공합니다. Cohere API, Model Vault, Microsoft Foundry 및 AWS SageMaker를 통해 사용할 수 있습니다. 문서 파싱은 이러한 비정형 문서에 포함된 독점적 컨텍스트를 통해 기업 AI 채택의 핵심 동인으로 식별됩니다. Parse 5와 같은 도구의 진정한 가치는 단순히 텍스트를 추출하는 것이 아니라 AI 에이전트가 이 정보를 효과적으로 활용할 수 있도록 하는 데 있습니다. 따라서 기업은 벤치마크 점수뿐만 아니라 다운스트림 작업 정확도를 기준으로 파서를 평가해야 합니다.
에이전트 복잡성은 여러 에이전트와 해당 API 호출의 상호 연결성으로 인해 발생하는 기업의 중요한 문제입니다. 이러한 복잡한 상호 작용의 그물망은 관리하고 이해하기 어려운 시스템을 만듭니다. 더 많은 에이전트를 추가하는 것은 단순히 연결을 선형적으로 증가시키는 것이 아니라, 이를 복합적으로 만들어 시스템을 점점 더 불투명하게 만듭니다. 결과적으로, 에이전트를 책임지는 사람들이 운영 및 권한을 놓치면서 AI 프로그램이 종종 중단됩니다. 에이전트 배포를 체크리스트처럼 취급하려는 현재의 본능은 이러한 복잡하고 연쇄적인 행동을 관리하는 데 불충분함이 입증되었습니다.권한 침해는 에이전트가 명시적인 재승인 없이 시간이 지남에 따라 더 넓은 접근 권한을 얻게 되는 일반적인 문제점입니다. 워크플로우에 여러 에이전트가 포함되면서 소유권도 희석되어 실패에 대한 책임이 불분명해집니다. 기존 거버넌스 인프라는 에이전트 행동의 상호 연결 및 연쇄적인 특성에 발맞추기 위해 고군분투하고 있습니다. 이를 해결하기 위해 각 에이전트는 고유한 신원, 정의된 범위 및 인간 후원자를 가져야 합니다.그러나 에이전트 수준의 신원만으로는 불충분하며, 에이전트의 행동과 그 하류 효과를 실시간으로 추적하기 위한 더 넓은 감독 메커니즘이 필요합니다. 정책 위반 행동을 발생 전에 방지하는 능력인 시행 또한 중요합니다. 에이전트 AI에 성공하는 기업은 성장하는 에이전트 함대를 관리하기 위해 가시성과 책임성을 모두 구축합니다. 이 접근 방식은 "인간-에이전트 조화"를 촉진하여 규모와 책임성이 함께 성장하도록 합니다. 진정한 위험은 개별 에이전트에 있는 것이 아니라, 규모에 따른 예측 불가능한 상호 작용에 있으며, 이는 프로덕션 배포를 방해합니다. 복잡성을 해결함으로써 자율성은 책임이 아닌 이점이 됩니다.
Visa의 오픈 소스 보안 하네스인 VVAH는 탐지부터 수정까지 전체 취약점 라이프사이클을 자동화합니다. 취약점을 찾고, 수정 사항을 작성하며, 인간 검토 전에 자체 적대적 패널을 대상으로 해당 수정 사항을 테스트할 수도 있습니다. 이 하네스는 기본적으로 이 전체 자동 수정 루프가 활성화된 상태로 제공되지만, 운영자는 탐지 단계에서 이를 제한할 수 있습니다. 이러한 고급 자동화는 AI가 취약점을 수정보다 빠르게 찾는 병목 현상을 해결합니다. VVAH는 Visa가 Anthropic의 Project Glasswing에 참여하면서 시작되었으며, 의미론적 추론 및 익스플로잇 체이닝을 위해 강력한 언어 모델을 활용했습니다. 이 도구는 출시 이후 GitHub에서 상당한 주목을 받고 있으며, 이는 업계의 높은 관심을 나타냅니다. Visa는 VVAH를 제공하여 생태계를 보호하고 사이버 보안 리소스가 적은 기업을 지원합니다. 현재 하네스 자체에 대한 기여는 수락되지 않으며, 혜택의 일방향 흐름을 유지합니다. 최신 릴리스는 수정 사항의 유효성 검사 및 반복을 포함하도록 파이프라인을 확장하여 효과적으로 익스플로잇을 무효화하도록 보장합니다. 이 프로세스는 더 나은 추론 및 익스플로잇 가능성 분석을 위해 추상 구문 트리를 중심으로 스캔을 리팩토링합니다. 주요 혁신 중 하나는 단순히 취약점을 찾는 것뿐만 아니라 해결 속도에 초점을 맞춘 지표인 Mean Time to Adapt (MTTA)입니다. 자동화된 변경 전에 승인 게이트를 주장하는 사람들도 있지만, Visa는 VVAH가 승인된 운영자에 의해 제어된 환경 내에서 작동하며, 실행 시작, 패치 검토 및 최종 병합과 같은 중요한 지점에서 인간의 감독이 여전히 유지된다고 강조합니다.
CdXz5zHNQW_B3lArRGLHa.png
OpenRouter에 Ox Alpha라는 미스터리 모델이 등장하여 인상적인 성능과 무료 액세스로 빠르게 주목받았습니다. 초기에는 주요 미국 AI 연구소에서 개발한 것으로 추정되어, 모델의 정체와 인프라에 대한 일주일간의 조사가 이루어졌습니다. 결국 이 모델은 중국 기업 Z.ai의 GLM-5.3-Flash로 밝혀졌습니다.진정한 놀라움은 모델의 품질이 아니라, 전적으로 중국 칩과 인프라에서 실행된다는 점이었습니다. GLM-5.3-Flash는 미국 경쟁사들에 비해 훨씬 저렴한 가격을 제공하며, AI 도입의 기존 비용 구조에 영향을 미치고 있습니다. 이러한 비용 효율성은 AI 비용 급증으로 어려움을 겪고 있는 Uber와 같은 미국 기업들에게 압박을 가하고 있습니다.McKinsey 보고서에 따르면, 조직들은 AI의 이점을 계속 활용하면서도 AI 비용을 절감할 방법을 모색하고 있습니다. Zhipu와 Qwen과 같은 중국 모델 제작업체의 등장은 이러한 변화하는 환경에서 중요한 요인입니다. 인디 개발자들에게는 이미 중국 모델이 시장을 장악하고 있으며, 이는 기존 미국 제공업체들에게 도전 과제를 제시하고 있습니다.이를 헤쳐나가기 위해 계층화된 모델 전략이 권장됩니다. 즉, 중요한 작업에는 고비용, 고지능 모델을, 일상적인 사용에는 중간 티어 모델을, 그리고 대부분의 작업에는 GLM-5.3-Flash와 같은 저비용, 고용량 모델을 사용하는 것입니다. 이 접근 방식은 중국의 오픈 웨이트 모델이 제공하는 재정적 이점을 인정합니다. 새로운 모델이 등장함에 따라, 더 낮은 비용으로 더 높은 지능을 추구하는 추세는 계속될 것으로 예상됩니다.조직은 토큰 수를 신중하게 계산하고, AI 지출을 비즈니스 지표에 귀속시키며, 명확한 AI 예산을 설정해야 합니다. 고, 중, 저 티어를 구분하는 팀별 모델 전략은 의도적인 AI 도입에 필수적입니다. AI 사용의 미래는 가장 비싼 모델을 사용할 가치가 있는 작업에 대해 더 신중한 선택을 포함하게 될 것입니다.
Salesforce와 Anthropic은 Claudeforce라는 이름으로 파트너십을 확장하여 Salesforce의 CRM 플랫폼을 Anthropic의 Claude AI에 직접 통합했습니다. 이 새로운 협력은 Claude CoWork용 플러그인을 도입하여 Salesforce를 열지 않고도 CRM 데이터를 관리할 수 있는 37가지 사전 구축된 영업 기술을 제공합니다. 이러한 움직임은 AI 인터페이스가 기존 애플리케이션 화면을 대체할 수 있는 기업 소프트웨어의 잠재적인 변화를 의미합니다. Salesforce의 CEO인 Marc Benioff는 이를 최고의 AI와 CRM의 결합으로 보고, 동적인 앱 구축과 기업 질문 답변을 가능하게 한다고 말합니다. 이를 위한 기반은 Salesforce의 "Headless 360" API로 마련되었으며, AI 에이전트가 CRM 데이터에 직접 접근할 수 있도록 했습니다. 고객들은 이러한 헤드리스 접근 방식에 관심을 보였지만, 일반 사용자가 연결하는 것은 복잡하다는 것이 입증되었습니다. Anthropic이 Claude를 통해 Salesforce를 내부적으로 사용한 경험은 단순화되고 사용자 친화적인 플러그인 개발에 영감을 주었습니다. 이 플러그인은 관리자가 한 번 연결하여 인증 및 권한을 중앙 집중화할 수 있도록 합니다. 아키텍처는 AI가 기존 Salesforce 사용자 권한을 존중하여 무단 데이터 접근을 방지하도록 보장합니다. Salesforce는 이러한 통합이 플랫폼의 가치를 감소시키기보다는 오히려 확장된 데이터와 워크플로우를 새롭고 효율적인 인터페이스에 노출함으로써 향상시킨다고 주장합니다. 회사는 수동 작업을 줄이고 빠른 데이터 합성을 제공함으로써 판매자들의 생산성이 크게 향상될 것으로 예상합니다. 이 새로운 사용 모델은 Salesforce의 헤드리스 소비 가격 책정과 AI 추론을 위한 별도의 Anthropic 계약을 통해 수익화됩니다. 이 파트너십은 또한 자율 작업을 위한 Salesforce의 Agentforce와 지식 근로자를 위한 Claude 내 Salesforce의 구분을 명확히 합니다. 이 제휴는 심화되어 Claude가 Slack 전반의 기본 모델이 되었으며, 다양한 내부 도구와 생산성에 영향을 미치고 있습니다. Anthropic에게 이 계약은 수백만 사용자의 기업 워크플로우에 상당한 배포를 제공합니다. 라이브 데모에서는 동적 대시보드 생성과 판매자를 위한 개인화된 일일 실행 계획을 선보였으며, AI 최고 매출 책임자 역할을 했습니다. "마이애미 바이스" 테마 대시보드로 예시된 사용자가 인터페이스를 스타일링할 수 있는 기능은 관리되는 Salesforce 데이터로 구동되는 사용자 맞춤형 인터페이스로의 전환을 강조합니다. 궁극적으로 Claudeforce는 Salesforce의 오랜 데이터 및 워크플로우 이점을 활용하여 새로운 AI 인터페이스 내에서 자신의 위치를 소유함으로써 잠재적인 중개 배제를 수용하려는 Salesforce의 전략을 나타냅니다.
"GhostJacking이라는 보안 시연은 Cloudflare 로그에서 차단된 악성 페이로드가 AI 에이전트에 의해 명령으로 해석될 수 있는 방법을 보여주었습니다. 이 에이전트는 기존 자격 증명을 활용하여 회사의 DNS를 재작성했습니다. 방화벽이 페이로드를 차단하고 로그에 기록함으로써 제대로 작동했기 때문에 이 공격은 기존 보안 조치를 우회했습니다. AI 코딩 에이전트는 이러한 로그를 검토할 때 공격자의 프롬프트를 합법적인 명령으로 오해할 수 있습니다. 테스트 결과, AI 코딩 에이전트는 권장 구성 하에서 시도의 상당수에서 이러한 주입된 명령을 따르는 것으로 나타났습니다. 이는 높은 프롬프트 주입 차단율이 보안 경계를 구성하지 않음을 강조합니다. 제안된 해결책은 AI 모델 외부에서 권한 부여 게이트를 구현하여 에이전트가 높은 영향력을 가진 변경을 자율적으로 실행하는 것을 방지하는 것입니다. 이는 에이전트가 작업을 제안할 수는 있지만 DNS 변경과 같은 중요한 수정에 대해서는 인간의 승인이 필요함을 의미합니다. 이 접근 방식은 향상된 보안을 위해 일부 에이전트의 즉흥적인 기능을 희생합니다. LLM 애플리케이션을 위한 OWASP Top 10은 이러한 실제 사건으로 인해 "과도한 에이전시"를 높였습니다. 핵심 수정은 프롬프트 기반 보안에만 의존하는 것이 아니라 AI 에이전트에 대한 명시적인 권한 부여 맵을 정의하는 데 있습니다. 기업들은 AI의 장점이 잠재적인 처벌보다 크다고 베팅하며, 무의식적으로 이 위험을 상당 부분 수용하고 있습니다. 업계는 탐지에만 의존하는 것이 아니라 권한 부여에 초점을 맞춰 AI 에이전트가 관리되는 방식에 근본적인 변화가 필요합니다."
CdXz5zHNQW_8PPap1v6RJ.png
기업들은 커뮤니케이션 채널 전반에 걸쳐 AI 에이전트와 음성 AI를 빠르게 배포하고 있습니다. 그러나 이러한 AI는 종종 레거시 시스템에 연결되어 있어 파편화된 경험을 초래합니다. 이는 공유된 기업 컨텍스트가 부족한 인간 에이전트에게 상당한 인지 부하를 유발합니다. 전통적인 고객 경험 아키텍처는 AI와 인간 작업자 간의 실시간 데이터 흐름에 어려움을 겪습니다. 결과적으로, 자동화에서 오케스트레이션으로 전략적 우선순위가 이동하고 있으며, 이는 작업을 엔드투엔드 결과로 연결합니다. 오케스트레이션은 AI, 애플리케이션 및 사람들이 고객에 대한 통합된 이해를 바탕으로 작동하도록 보장합니다. 산업 통합은 AI, 데이터 및 워크플로우를 오케스트레이션하기 위한 인텔리전스 계층의 필요성을 반영합니다. 공통 기업 온톨로지는 분리된 플랫폼 간의 데이터를 정렬하는 데 중요합니다. Tata Communications의 Interaction Fabric은 컨텍스트 기반 아키텍처를 갖춘 오케스트레이션 계층을 제공합니다. 이를 통해 AI와 에이전트는 다양한 채널과 시스템에서 고객 컨텍스트를 유지할 수 있습니다. 다음 진화는 컨텍스트 그래프에 의해 지원되는 공유 기업 이해를 통한 조정을 포함합니다. 기본 네트워크는 AI 시스템을 지원하고 동기식 상호 작용을 보장하기 위해 민첩해야 합니다. 효과적인 AI 파트너십은 실시간 통찰력과 지원을 제공하여 인간 에이전트를 향상시킵니다. AI는 일상적인 작업을 처리하여 인간이 복잡하고 공감적인 상호 작용에 집중할 수 있도록 합니다. 통합된 CX 아키텍처를 구축하려면 데이터 통합과 협업 촉진이 필요합니다. CX의 미래는 실시간 인텔리전스, 자율성 및 원활한 오케스트레이션으로 정의될 것입니다. AI 기반 에이전트는 상호 작용을 독립적으로 관리하고 해결하여 효율성을 향상시킬 것입니다. 인간 에이전트는 실시간 인텔리전스의 지원을 받아 AI와 함께 Total Experience를 제공할 것입니다.
CISO가 낮은 CVE 수를 오해하고 프롬프트 인젝션을 우선순위에서 제외하는 것은 실수입니다. 프롬프트 인젝션은 3년 동안 LLM 애플리케이션 OWASP Top 10에서 꾸준히 최상위 자리를 차지해 왔습니다. 그러나 최근 실제 사고 분석에서는 12위로 평가되었습니다. 이러한 불일치는 프롬프트 인젝션 공격이 기존 취약점 스캐너에 의해 탐지되지 않고 작동하기 때문에 발생합니다. 이 연구는 탐색적이지만, 전문가 판단과 관찰된 사고 기록 간의 상당한 불일치를 강조합니다. 전문가들은 광범위한 공격 표면 때문에 프롬프트 인젝션을 높게 평가하는 반면, 사고 데이터는 성공적인 침해를 반영합니다. 프롬프트 인젝션의 은밀한 특성은 악의적인 지침을 무해해 보이는 콘텐츠에 내장하여 표준 보안 도구에 보이지 않게 만듭니다. 효과적인 방어는 사고 후 분석에 의존하기보다는 적대적 테스트와 에이전트 기능에 대한 아키텍처 제한을 필요로 합니다. 프롬프트 인젝션이 LLM 시스템의 기본 법칙에 비유되기 때문에 이러한 사전 예방적 접근 방식이 중요합니다. 현재의 방어는 완벽하지 않으며, 프롬프트 인젝션이 발생한다고 가정하고 시스템을 설계하는 것이 가장 중요합니다. 과제는 본질적으로 과거를 돌아보는 사고 데이터를 정확하게 해석하는 데 있습니다. 잘못된 정보 또한 전문가 의견과 사고 기록 간의 상당한 불일치를 나타냅니다. 지속적인 메모리 포이즈닝 및 MCP 도구 인터페이스 악용과 같은 새로운 위협은 해당 CVE를 가지고 있지만, 그 영향은 낮은 자문 건수에 반영되지 않을 수 있습니다. OWASP GenAI LLM Top 10 2026 버전은 이제 사고 데이터를 통합했지만, 가중치는 여전히 논의의 대상입니다. 저자들은 소수의 전문가 응답자 풀과 분류기 변동성을 포함하여 자체 방법론의 한계를 인정합니다. 궁극적으로 전문가 합의와 사고 데이터 간의 불일치는 LLM 보안의 진화하고 복잡한 특성을 강조합니다.
CdXz5zHNQW_IrDKuEVAzc.png
Perplexity는 사용자가 소유한 하드웨어에서 실행되도록 설계된 AI 에이전트 플랫폼의 로컬 버전인 Portable Computer를 출시했습니다. 이 플랫폼은 Nvidia의 DGX Spark 및 RTX GPU가 탑재된 Linux 머신부터 시작합니다. 이 이니셔티브는 상당한 AI 에이전트 워크로드를 클라우드에서 로컬 장치로 이동시켜 사용자 데이터와 작업의 개인 정보를 유지하는 것을 목표로 합니다. 이 애플리케이션은 클라우드 버전에서 볼 수 있는 전체 에이전트 하네스와 추론 기능을 복제하여 문서 검토 및 데이터 분석과 같은 작업을 위한 간소화된 경험을 제공합니다. Nvidia에게 이 출시는 로컬 AI의 증가하는 실용성과 이를 구동하는 데 필요한 하드웨어에 대한 전략적 베팅을 의미합니다. Portable Computer는 모델 및 도구를 포함한 전체 로컬 AI 스택을 단일 사용자 친화적인 애플리케이션으로 패키징합니다. 이 통합으로 인해 사용자는 복잡한 로컬 AI 시스템을 수동으로 조립하고 구성할 필요가 없습니다. 시연에서는 클라우드 의존 없이 민감한 금융 문서를 로컬에서 처리하는 능력을 보여주었으며, 청구 크레딧은 사용량이 0으로 표시되었습니다. 이 플랫폼은 또한 하이브리드 운영을 지원하여 로컬 분석을 Slack과 같은 클라우드 서비스로 푸시할 수 있습니다. Perplexity는 효율적인 로컬 AI를 위해 모델과 에이전트 하네스를 공동 설계하는 것이 중요하다고 강조합니다. 이는 소형 모델이 범용 프레임워크로 어려움을 겪기 때문입니다. 이 제품은 정교한 AI 에이전트를 로컬에서 실행하는 프로세스를 단순화하여 더 큰 제어와 개인 정보를 추구하는 개인 사용자 및 기업 모두에게 매력적입니다.
Anthropic은 기업 AI의 미래가 단일 사용자 챗봇이 아닌 "멀티플레이어 AI"에 있다고 믿습니다. 그들의 전략은 팀 간 협업하고, 조직적 맥락을 이해하며, 업무를 선제적으로 지원하는 AI 에이전트에 중점을 둡니다. Slack에 통합된 에이전트인 Claude Tag는 이제 프롬프트 없는 개입을 개선하기 위해 전체 대화 기록을 처리합니다. 이러한 진화는 AI가 개인 도구에서 조직적 동료로 전환되고 있음을 의미합니다.White는 AI 진화의 세 가지 단계를 개괄합니다. 단일 작업 완료, 전체 작업 완료, 그리고 현재는 목표 지향적 프로젝트 실행입니다. 버그 감소 또는 법률 검토 속도 향상과 같은 추상적인 회사 목표를 달성하려면 AI가 여러 시스템과 사람에 걸쳐 작동해야 합니다. 이는 본질적으로 지식 작업이 복잡하고 다면적이기 때문에 협업적이고 멀티플레이어 AI의 필요성을 주도합니다.세 가지 기술 발전이 이러한 선제적 AI 전환을 가능하게 합니다. MCP와 같은 표준을 통한 향상된 연결성, 유용한 선제적 조치를 위한 모델 지능의 높은 임계값, 그리고 Slack과 같은 기존 협업 플랫폼과의 통합입니다. 업데이트된 Claude Tag는 전체 채널 맥락을 분석하여 최선의 조치를 결정함으로써 이를 입증합니다. Anthropic은 유용하지 않은 AI 개입으로 사용자를 짜증나게 하는 것을 피하기 위해 내장된 제약을 강조합니다.이 회사는 데이터 분석을 자동화하고 핸드오프를 줄임으로써 협업 AI가 전략적 의사 결정 및 고수준 협업을 위해 인간의 시간을 확보한다고 주장합니다. 사이트 신뢰성 엔지니어링은 이러한 조정된 AI 접근 방식이 효과적임을 입증하는 예로 인용됩니다. 이 전략은 AI 채택과 실질적인 비즈니스 영향 간의 격차를 해소하는 것을 목표로 합니다.Anthropic은 프롬프트 주입 공격에 대해 모델 수준 교육 및 타사 보안 통합을 포함한 계층적 방어 전략을 사용합니다. Claude의 데이터 액세스는 사용자의 권한으로 제한되어 채널 간 컨텍스트 유출을 방지합니다. 확장된 컨텍스트는 현재 무료이지만, Anthropic은 고객 제어 및 사용자 정의 가능한 비용-성능 프로필에 중점을 두고 가격 책정 모델을 실험하고 있습니다.Anthropic은 자사의 AI를 분산된 시스템을 연결하는 오케스트레이터로 포지셔닝하여 통합된 생태계에 중점을 둔 Microsoft 및 Google과 같은 경쟁사에 비해 고유한 가치 제안을 제공합니다. 그들은 진정한 가치는 고객을 위한 원하는 결과를 달성하기 위해 다양한 플랫폼에서 데이터를 지능적으로 통합함으로써 나온다고 주장합니다. 이러한 지능형 통합에 대한 초점은 AI를 효과적으로 활용하려는 기업에게 핵심 차별화 요소로 제시됩니다.
IBM은 전통적인 명령어 세트와 Arm의 명령어 세트를 네이티브로 실행할 수 있는 혁신적인 듀얼 아키텍처 메인프레임 프로세서를 공개했습니다. 이 혁신적인 칩은 곧 출시될 IBM Z 및 LinuxONE 시스템에 탑재되어, 기업들이 AI 프레임워크를 포함한 Arm 네이티브 Linux 소프트웨어를 기존의 z/OS 워크로드와 원활하게 실행할 수 있도록 지원합니다. 칩의 각 코어는 KVM 하이퍼바이저 덕분에 성능에 거의 영향을 주지 않고 Arm 모드와 z/OS 모드 간에 동적으로 전환할 수 있습니다. 이러한 깊은 통합은 미션 크리티컬 애플리케이션이 성장하는 Arm 소프트웨어 생태계와 동일한 실리콘에서 공존할 수 있도록 보장합니다. 이 전략적 움직임은 광범위한 포팅 작업 없이 최신 AI 도구를 직접 실행할 수 있도록 함으로써 AI 시대의 메인프레임 역할을 해결합니다. IBM이 별도의 Arm 코어를 추가하는 대신 이중 언어 코어를 구축하기로 결정한 것은 완전 통합 솔루션에 대한 그들의 의지를 강조합니다. 새로운 프로세서는 또한 고급 AI 추론 가속기와 고속 처리 기능을 갖추고 있어 메인프레임이 AI 채택의 선두에 서도록 합니다. 이 듀얼 아키텍처 발전은 전통적인 메인프레임의 포기가 아니라, 지속적인 관련성과 높은 가용성을 보장하는 중요한 진화입니다. 전체 시스템은 2028년에 출시될 예정이지만, IBM은 이미 개념 단계를 훨씬 넘어섰다고 주장합니다. 주요 매력은 메인프레임의 비교할 수 없는 가용성으로, 99.999999%의 가동 시간을 제공합니다. 이 개발은 메인프레임이 최신 기술의 언어를 네이티브로 말할 수 있도록 함으로써 AI와 엔터프라이즈 컴퓨팅의 미래에 메인프레임을 통합하려는 IBM의 야망을 보여줍니다.
전통적인 엔터프라이즈 AI는 컨텍스트 엔지니어링에 크게 의존하며, 각 애플리케이션은 자체적인 지식 표현을 구축합니다. 이 접근 방식은 여러 팀이 동일한 정보를 독립적으로 처리하면서 불일치와 중복을 야기합니다. 현재 모델은 지식의 불일치, 변경 사항 전파의 어려움, 노력의 중복으로 인해 AI 배포 증가와 함께 무너지고 있습니다. 이는 컨텍스트 엔지니어링에서 엔터프라이즈 지식 관리로의 전환을 강조합니다. 엔터프라이즈 지식 플랫폼이 구조화된 데이터를 위한 엔터프라이즈 데이터 플랫폼과 유사한 솔루션으로 제안됩니다. 이 플랫폼은 엔터프라이즈 지식을 공유 자산으로 관리하며, 모든 AI 애플리케이션을 위해 재사용 가능한 표현을 게시합니다. 이는 원시(Raw), 정제(Refined), 통합(Integrated), 제공(Serving)의 네 가지 계층으로 작동합니다. 원시 계층은 재처리를 위해 원본 데이터 소스를 보존합니다. 정제 계층은 다양한 소스를 일관되고 관리되는 지식 객체로 정규화합니다. 통합 계층은 이러한 객체를 통합된 지식 모델로 연결하여 비즈니스 관계를 포착합니다. 마지막으로 제공 계층은 AI 워크로드를 위한 최적화된 표현을 게시합니다. 이 계층적 접근 방식은 강력한 지식 수명 주기 관리, 강력한 거버넌스, 재사용 가능한 지식 서비스 생성을 가능하게 하여 엔터프라이즈 AI를 위한 필수적인 데이터 기반을 형성합니다.
CdXz5zHNQW_oTsNlFZrd3.png
초기 엔터프라이즈 AI에 대한 믿음은 더 나은 성능을 위해 최대 에이전트 자율성을 선호했지만, 이 가정은 현재 프로덕션에서 실패하고 있습니다. 성공적인 에이전트 AI는 단순히 유연성뿐만 아니라 특정 책임과 명확한 운영 규칙을 가진 에이전트로부터 나올 것입니다. Gartner는 현재 에이전트 AI 프로젝트의 40% 이상이 증가하는 비용, 불분명한 가치, 부적절한 위험 통제로 인해 2028년까지 생존하지 못할 것으로 예측합니다. McKinsey의 데이터에 따르면 에이전트 AI 배포는 책임감 있는 AI 성숙도를 앞지르고 있으며, 거버넌스와 통제 수준은 낮습니다. 초점은 에이전트 기능에서 신뢰 구축으로 이동하고 있으며, 이는 위험, 법률 및 규정 준수 팀의 승인을 요구합니다.완전한 자율성은 통합 복잡성과 자율성과 책임성 간의 근본적인 상충 관계로 인해 프로덕션에서 무너집니다. 고도로 자율적인 에이전트가 내린 결정 추적은 어려우며, 이는 중요한 영역에서 잠재적인 규제 위반으로 이어질 수 있습니다. 레거시 워크플로우에 자율 에이전트를 통합하려면 기존 의사 결정 지점 및 감사 추적을 완전히 재구축해야 합니다. 현재 AI 위험에 대한 인식은 완화 노력보다 훨씬 앞서 있으며, 보안 및 위험 문제가 확장의 주요 장애물로 언급되고 있습니다.선도적인 기업들은 협소한 범위의 에이전트를 생성하고, 의사 결정 경계에 인간 검문소를 구현하고, 의사 결정 추적성을 우선시하며, 능동적인 거버넌스를 위해 데이터 주권을 사용하여 자율성을 재구성하고 있습니다. 목표는 최대 통제가 아니라 오류가 비용이 많이 드는 곳에 감독을 집중하는 조정된 통제입니다. 에이전트 스택 평가는 의사 결정 재구성, 제한된 책임, 검문소 배치 및 침해 시 잠재적 영향을 평가하는 것을 포함합니다.에이전트 AI의 미래 경쟁 우위는 처음부터 범위가 제한된 자율성, 검문된 의사 결정, 추적성 및 데이터 주권을 통합하여 신뢰할 수 있는 시스템을 구축하는 조직에게 돌아갈 것입니다. 이를 위해서는 자율성을 우선시하는 설계 요구 사항에서 핵심 아키텍처에 거버넌스와 신뢰를 내장하는 것으로의 전환이 필요합니다. 더 이상 배포 속도에 대한 경쟁이 아니라, 중요한 감독 부서로부터의 승인을 얻고 유지하는 것에 대한 경쟁입니다.
CdXz5zHNQW_WsFDozQUNO.png
에이전트 AI 시스템은 수신 모델이 전체 대화 기록을 다시 계산해야 하므로, 서로 다른 크기의 대규모 언어 모델 간 전환 시 상당한 병목 현상에 직면합니다. 이 재계산은 상당한 컴퓨팅 비용과 지연 시간을 발생시켜 장기적이고 다중 LLM 워크플로우를 방해합니다. Nvidia의 연구원들은 이 문제를 해결하기 위해 크로스 모델 KV 캐시 전송 기술을 개발했습니다. 이 방법은 사전 계산된 키-값(Key-Value) 캐시를 소스 모델에서 대상 모델로 직접 매핑합니다. 이 과정은 엔터프라이즈 AI 애플리케이션의 컴퓨팅 비용과 지연 시간을 크게 줄입니다. 실험 결과, 이 선형 매핑 기술은 캐시를 재계산하는 것보다 2.7배에서 25배 더 빠릅니다. 또한 호환되는 모델 쌍에서 대상 모델의 독립적인 정확도를 최대 98%까지 유지합니다. 이 기술은 KV 캐시의 선형 구조를 활용하며, 비용이 많이 드는 딥러닝 훈련 대신 간단한 대수적 방법을 사용합니다. 이를 통해 출력 품질 향상을 위해 더 작은 모델에서 더 큰 모델로 원활하게 업그레이드할 수 있습니다. 또한 초기 대규모 처리 후 더 큰 모델에서 더 작은 모델로 전환하여 비용 절감을 촉진합니다. 초기에는 동일 계열 내 모델 전송에 중점을 두었지만, 이 프레임워크는 더 광범위한 응용 가능성을 보여줍니다. 이 발전은 추론 비용을 관리하면서 다중 모델 에이전트 시스템을 확장하기 위한 중요한 도구를 제공합니다.
CdXz5zHNQW_0msrwsmf8V.jpeg
기업 AI 팀은 보안 및 권한 부여에 대한 단일 공급업체에 대한 신뢰 부족으로 인해 여러 오케스트레이션 플랫폼을 채택하고 있으며, 평균적으로 기업은 세 가지를 동시에 사용하고 있습니다. 현재 Microsoft가 주요 사용에서 선두를 달리고 있으며, Anthropic의 Claude Platform은 기업에서 향후 채택을 위해 적극적으로 고려되고 있습니다. 주요 과제에는 토큰 사용량 관리 및 에이전트 지출에 대한 가시성 확보가 포함됩니다.AI 빌더의 피드백을 기반으로 한 지속적인 분석에 따르면, 85%의 기업이 두 개 이상의 오케스트레이션 도구를 사용하고 있으며, 64%는 세 개를 사용하여 의도적인 다원주의적 접근 방식을 보여줍니다. Microsoft AI Foundry, OpenAI의 Agents SDK, Anthropic의 Claude Platform이 주요 도구이며, 22%의 빌더는 맞춤형 사내 오케스트레이션으로 보완하고 있습니다. 2026년까지 절반 이상의 응답자가 하이브리드 제어 평면으로의 전환을 예상하고 있습니다.기업은 플랫폼 변경을 적극적으로 계획하고 있으며, 3분의 2 이상이 1년 이내에 전환할 것으로 예상하고 있으며, Anthropic의 Claude Agent SDK가 주요 고려 사항입니다. 이러한 다중 플랫폼 전략은 초기 클라우드 채택에서 얻은 교훈인 공급업체 종속성 회피에 대한 열망을 반영합니다. 전반적인 플랫폼 만족도는 높지만, 구현 용이성과 가격 대비 가치는 낮은 평가를 받습니다.구매 결정은 모델 중력이나 개발 용이성보다는 유연성, 보안, 프로덕션 안정성, 에이전트 실행 제어에 의해 주로 영향을 받습니다. 지출 우선 순위는 이러한 우려를 반영하며, 에이전트 모니터링, 디버깅 및 보안 시행에 상당한 투자가 이루어지고 있습니다. 기업은 최종 사용자 경험보다는 핵심 오케스트레이션에 초점을 맞춰 작업 완료 안정성과 다단계 워크플로 관리를 최적화하고 있습니다.빌더의 주요 우려는 보안 및 권한 부여 제한, 공급업체 종속성, 제한된 가시성, 모델 및 도구에 대한 유연성 부족입니다. 중요한 문제는 에이전트 토큰 사용을 제어하는 데 어려움을 겪는 것이며, 5개 기업 중 1개는 실행 중인 에이전트 지출을 실시간으로 중지하지 못하고 있습니다. 네이티브 플랫폼 제어, 맞춤형 게이트웨이 배관, 동적 라우팅을 포함한 다양한 전략이 비용 관리에 사용됩니다.이러한 노력에도 불구하고 응답자의 4분의 1은 여전히 실행 중인 에이전트에 대한 실시간 킬 스위치 없이 반응형 모니터링에 의존하고 있습니다. 재정 통제 성숙도 수준은 조직 규모에 따라 유의미한 차이를 보이지 않습니다. 대부분의 기업은 진정한 다단계 에이전트 배포의 초기 단계에 있으며, 고급의 대부분 자율 시스템을 보고하는 비율은 낮습니다.상당수의 배포는 여전히 기본 어시스턴트 또는 챗봇으로 남아 있으며, 이는 진정한 에이전트 AI의 광범위한 채택이 아직 초기 단계임을 나타냅니다. 데이터는 기업이 에이전트에 필요한 인프라를 구축하고 있지만, 에이전트 AI의 완전한 실현은 아직 오지 않았음을 시사합니다.
CdXz5zHNQW_hL7YLyezgW.png
Slack에 AI 에이전트를 통합하는 것은 매력적이지만 종종 복잡한 것으로 판명되지만, NanoCo의 NanoClaw는 이를 단순화하는 것을 목표로 합니다. 새로운 Slack 통합을 통해 사용자는 단일 Slack 프롬프트에서 직접 전문 AI 에이전트 전체 팀을 만들 수 있습니다. NanoCo CEO Gavriel Cohen은 "팀의 모든 사람이 에이전트의 관리자가 될 것"이라는 미래를 구상하며 배포의 용이성을 강조합니다. 이러한 NanoClaw 에이전트는 Slack 채널 및 캔버스에서 협업하고 Telegram 또는 WhatsApp과 같은 플랫폼 간에 통신할 수도 있습니다.주요 차별점은 에이전트의 지속성과 개별성입니다. 각 에이전트는 자체 ID, 메모리 및 권한을 얻어 "디지털 부서"를 형성합니다. 사용자는 이러한 에이전트에 대해 선호하는 기본 대규모 언어 모델을 선택하여 다양한 요소를 최적화할 수 있습니다. NanoClaw의 Slack 통합 설정 프로세스는 복잡한 API 키 관리에서 간단한 "Slack 연결" 옵션으로 이동하여 크게 간소화되었습니다. 이 초기 작업 공간 권한 부여는 대부분 일회성 프로세스이며, 그 후 NanoClaw는 자체 Slack 봇으로 추가 에이전트를 프로비저닝할 수 있습니다.에이전트는 고객의 인프라에서 작동하며 토큰은 사용자 컴퓨터에 남아 있습니다. Slack의 관리 제어는 여전히 적용되어 조직에서 에이전트 액세스를 관리할 수 있습니다. 이 시스템은 NanoClaw의 인프라와 Slack 간의 다리를 만들어 에이전트가 대화 방식으로 새로운 Slack 네이티브 동료를 만들고 조정할 수 있도록 합니다. 리드 에이전트는 모델 컨텍스트 프로토콜 도구를 사용하여 새 에이전트의 지침, 페르소나, 기술 및 도구를 정의하고 공유 방에 배치할 수 있습니다.사용자는 기존 에이전트에게 코드 검토 에이전트 또는 마케팅 에이전트 팀과 같이 필요한 동료 또는 팀의 종류를 알려주기만 하면 됩니다. 이 대화식 접근 방식은 고유한 기술 세트를 가진 에이전트가 작업을 인계할 수 있는 동적 팀 생성을 허용합니다. Cohen은 이러한 분업의 이점을 강조하는데, 이는 다양한 작업에 대한 전문 도구 및 컨텍스트를 허용하기 때문입니다. 에이전트는 공유 Slack 캔버스에서 인간과 협업하기도 합니다.기본 Slack 플랫폼도 더 많은 타사 에이전트에 개방되고 있으며, Salesforce의 Slack Code 페이지에는 NanoClaw가 다른 통합과 함께 나열되어 있습니다. 그러나 NanoClaw는 이미 실행 중인 에이전트가 대화 내에서 추가적이고 독립적으로 주소 지정 가능한 팀원을 만들 수 있도록 함으로써 차별화됩니다. 이는 관리자 주도 프로비저닝에 의존하는 Anthropic의 Claude Tag 및 OpenAI의 ChatGPT Workspace Agents와 같은 다른 AI 비서와 중요한 차이점입니다. NanoCo는 이를 "Slack 최초"로 포지셔닝하며, "하나의 메시지로 NanoClaw 에이전트 전체 팀을 구성할 수 있습니다."
CdXz5zHNQW_4e5kDAifzU.png
Serval은 기업 자동화를 구축하도록 설계된 AI 에이전트인 Catalyst를 출시하며, 이는 고객에게 기본 기능으로 제공됩니다. Catalyst는 기존 데이터를 분석하고, 자동화 기회를 식별하며, 필요한 워크플로우 및 기타 구성 요소를 초안 작성하는 "슈퍼 에이전트" 역할을 합니다. 또한 티켓이 접수되기 전에 proactively 시스템을 모니터링하고 솔루션을 제안하는 백그라운드 에이전트를 생성할 수도 있습니다. 이러한 출시는 ServiceNow, Atlassian, Freshworks와 같은 경쟁업체들도 유사한 기능을 제공함에 따라 엔터프라이즈 서비스 관리 공급업체들이 워크플로우 생성을 위해 AI를 점점 더 통합하는 가운데 이루어집니다.Serval은 Catalyst를 검색부터 proactive 에이전트 생성까지 전체 자동화 수명 주기를 위한 단일 관리 계층으로 프레임화하여 차별화합니다. AI 에이전트는 헬프 데스크 데이터를 분석하고, 표준 운영 절차를 실행 가능한 시스템으로 변환하며, 다양한 자동화 구성 요소를 구축할 수 있습니다. Serval은 특정 작업에 가장 적합하도록 foundation model을 교체할 수 있는 model-agnostic 접근 방식을 강조합니다. 회사의 핵심 가치 제안은 엔터프라이즈 컨텍스트, 메모리 및 거버넌스 제어를 포함하는 이러한 model 주변의 "하네스"에 있습니다.Catalyst는 사용자가 원하는 결과를 설명하도록 하여 AI가 구현을 생성하도록 함으로써 자동화를 단순화하는 것을 목표로 합니다. Serval은 이 접근 방식이 경쟁업체의 광범위하고 다중 도구 접근 방식과 달리 자동화를 만드는 데 관련된 전통적인 단계를 압축한다고 주장합니다. 핵심 기능은 인간의 개입이 필요하기 전에 proactively 문제를 찾아 해결책을 제안하는 Serval의 백그라운드 에이전트입니다. 회사의 철학은 반복적인 작업을 자동화된 프로세스로 변환하여 지원 요청을 제거하는 데 중점을 둡니다.Serval의 거버넌스 model은 Catalyst가 사용자 권한을 상속하고 정의된 팀 작업 공간 내에서 작동하도록 보장하는 데 중요합니다. 생성된 모든 자동화는 처음에 초안이며, 활성화되기 전에 검토 및 승인을 거쳐야 합니다. 고객 데이터 소유권이 강조되며, Serval은 고객이 데이터에 대한 권리를 보유하며 Serval은 고객 데이터를 AI model 학습에 사용하지 않는다고 명시합니다. 배포 옵션에는 클라우드 SaaS, 온프레미스 또는 고객 자체 VPC 내 배포가 포함되어 데이터 위치 및 처리에 대한 유연성과 제어를 제공합니다. Ramp와 같은 초기 고객 사례는 워크플로우 구축 속도 향상과 부서 전반에 걸친 자동화 채택 확대를 시사합니다.
CdXz5zHNQW_wRpOOXkBKU.png
CdXz5zHNQW_92JXCGx4KA.png
VentureBeat는 기술 분석을 심화하기 위한 전략적 움직임으로 Rob Strechay를 첫 번째 선임 분석가이자 VentureBeat Research의 창립 분석가로 임명했습니다. Strechay는 기술 업계에서 실무자, 제품 임원, 업계 분석가를 포함한 다양한 역할에서 거의 30년에 가까운 경험을 가지고 있습니다. 그의 합류는 엔터프라이즈 AI가 빠르게 발전함에 따라 기술 의사 결정자들 사이에서 객관적인 데이터에 대한 증가하는 요구를 충족시킵니다. 조직들은 AI 실험을 넘어 다중 공급업체 오케스트레이션, 보안 격차, 인프라 비용 최적화와 같은 복잡한 문제에 대한 통찰력을 요구하고 있습니다. AWS 및 Enterprise Strategy Group에서의 경험을 포함한 Strechay의 배경은 엔터프라이즈 AI 배포의 기본 아키텍처를 분석할 수 있도록 그를 갖추게 합니다. 그는 초기에는 클라우드 인프라, 고급 데이터 시스템, 플랫폼 엔지니어링, DevOps 및 AI 보안 교차점에 중점을 둘 것입니다. Strechay는 이미 엔터프라이즈 GPU 활용에 대한 분석을 제공했으며 VentureBeat의 AI Infrastructure & Compute 설문 조사를 검토했습니다. 이 연구는 에이전트 오케스트레이션 및 AI 인프라와 같은 영역을 추적하는 VentureBeat의 VB Pulse 설문 조사를 보완합니다. 이 새로운 연구의 핵심 플랫폼은 AI 시스템 아키텍트와의 심층 기술 인터뷰를 특징으로 하는 Strechay가 진행하는 확장된 VB In Conversation 비디오 시리즈가 될 것입니다. Strechay는 경험적 데이터와 독점 추적을 활용하여 엔터프라이즈 구매자와 빌더가 중요한 플랫폼 및 인프라 결정을 내리도록 안내하는 것을 목표로 합니다.
CdXz5zHNQW_NeSQ7RU5mK.png
CdXz5zHNQW_PLM28OeHez.png
기술 기업인 Block이 직원들을 위해 개발한 데스크톱 애플리케이션 Berd를 오픈소스로 공개했습니다. Berd는 다양한 모델과 도구에 걸쳐 AI 에이전트와 상호 작용할 수 있는 통합 환경을 제공합니다. 브라우저 기반 대안과 달리 로컬에 설치되는 그래픽 애플리케이션으로 작동합니다. Apache 2.0 라이선스 하에 GitHub에서 사용할 수 있으며, Berd는 macOS, Windows 및 Linux를 지원합니다. 이 애플리케이션은 사용자가 채팅, 파일, 에이전트 및 자동화를 관리할 수 있는 중앙 "일일 AI 작업 표면"으로 설계되었습니다. 핵심 설계 원칙은 투명성으로, 사용자가 AI 상호 작용의 운영 상태를 명확하게 볼 수 있도록 합니다. Berd는 파편화된 AI 에이전트 경험을 간소화하려는 Block의 내부 요구에서 시작되었습니다. 여러 AI 모델과 관련 시스템을 관리하기 위한 일관된 데스크톱 애플리케이션을 제공하는 것을 목표로 합니다. Berd 내의 영구 프로젝트를 통해 사용자는 컨텍스트를 다시 설정하지 않고 작업을 재개할 수 있습니다. Block은 또한 엔지니어링 역할 외의 에이전트 작업 접근성을 높이는 데 중점을 둡니다. Berd는 에이전트에 고유한 시각적 정체성과 역할을 부여하여 일반적인 채팅 인터페이스를 넘어 차별화됩니다. "Gloopies"와 같은 이러한 애니메이션 캐릭터는 에이전트 구성을 위한 인식 가능한 약어로 사용됩니다. 아키텍처 측면에서 Berd는 새로운 AI 모델이나 런타임이 아닌 오케스트레이션 계층입니다. Tauri 2와 React 19를 기반으로 구축되었으며 Block의 Goose 에이전트 프레임워크와 통합됩니다. 오픈소스 에이전트 프레임워크인 Goose는 대규모 언어 모델을 외부 도구 및 데이터에 연결합니다. Berd의 이식성은 핵심 기능이며, 데이터와 구성은 애플리케이션 외부에서도 액세스할 수 있도록 설계되었습니다. 이 애플리케이션은 로컬 우선 데이터 모델을 사용하여 대화 기록을 사용자의 장치에 저장합니다. 사용자 개인 정보를 우선시하기 위해 공식 Berd 배포판에서는 원격 측정 기능이 기본적으로 비활성화되어 있습니다.
CdXz5zHNQW_mwJv7cB8N4.png
기업들은 자동화된 평가 방식에 대한 신뢰도가 높아지고 있음에도 불구하고, AI 배포 결정에서 점차 인간을 배제하고 있습니다. 이러한 신뢰도 증가에도 불구하고, 약 절반에 달하는 상당수의 기업들이 테스트를 통과했지만 실제 운영 환경에서는 실패한 AI 기능을 경험했으며, 이 수치는 변함없이 유지되고 있습니다. 이는 평가 계층의 인지된 정확성과 실제 실패 방지 효과 사이의 격차가 커지고 있음을 시사합니다. 이러한 운영 실패를 경험한 기업들은 오히려 속도를 늦추기보다는 자동화된 배포로의 전환을 가속화하고 있습니다. 이러한 직관에 반하는 추세는 테스트 통과 후 실패에 대한 완전한 자동화 포기보다는 배포 성숙도에 초점을 맞추고 있음을 시사합니다. 또한, 많은 기업들이 에이전트의 출력이 정확한지 여부보다는 기능하는지에 초점을 맞추고 있어 운영 품질 모니터링에 지연이 있음을 데이터는 보여줍니다. 에이전트 평가 도구 시장은 진화하고 있으며, 전문 플랫폼이 인기를 얻고 통합 용이성이 주요 구매 요인이 되고 있습니다. 증가하는 자율성과 신뢰할 수 없는 평가 사이의 모순을 관리하기 위해, 기업들은 자동화된 운영 관찰에만 의존하기보다는 인간 중심의 검토 워크플로우에 더 많이 투자하고 있습니다. 이는 기업들이 일부 배포 결정에 대한 인간의 감독을 제거하는 동시에 프로세스의 다른 부분에서는 인간 검토에 대한 투자를 늘리는 역설을 만들어냅니다.
CdXz5zHNQW_zWhdR1Fwnm.png
기업의 커머스 AI 투자는 사상 최고치를 기록하고 있지만, 결과는 여전히 일관되지 않습니다. 이는 새로운 AI 기능을 제대로 통합된 시스템으로 통합하지 않고 추가하는 패턴에서 비롯됩니다. 이러한 "포인트 솔루션 패턴"은 맥락 손실과 불일치로 특징지어지는 파편화된 소비자 경험을 만듭니다. AI는 이러한 파편화의 비용을 증폭시켜 데이터의 비일관성으로 인해 자신감 있게 잘못된 추천으로 이어집니다. 개별 AI 도구는 독립적으로 강력한 성능 지표를 보일 수 있지만, 이는 시스템의 전반적인 저조한 성과를 반영하지 않습니다. 이러한 진단 문제는 브랜드가 좋은 도구 수준의 지표와 함께 평탄하거나 하락하는 전반적인 전환율을 볼 수 있음을 의미합니다. AI의 중개 해제와 같은 외부 요인도 퍼널에 압력을 가하여 문제를 악화시키고 있습니다. 일관된 AI 결과를 달성하는 기업은 AI 투자 전반에 걸쳐 통합된 실행 계층을 구현했습니다. 여기에는 실시간 정보를 위한 공유 데이터 계층, 거버넌스를 위한 정책 프레임워크, 원활한 주문 완료를 위한 트랜잭션 계층이 포함됩니다. 이러한 기본 요소는 AI 기능이 함께 작동하도록 보장하여 개선을 복합적으로 만듭니다. 에이전트 커머스가 성숙함에 따라 소비자 AI 에이전트가 중단된 프로세스를 포기하는 것을 방지하기 위해 아키텍처의 일관성에 대한 필요성이 중요해집니다. 지금 이러한 일관성을 구축하는 브랜드는 다가오는 트랜잭션 시대에 상당한 이점을 얻을 것입니다. 파편화는 잘못된 도구 때문이 아니라 필수적인 연결 인프라의 부족 때문입니다.
기업 팀들은 모든 작업에 단일 AI 모델을 사용하는 데 어려움을 겪고 있는데, 이는 간단한 쿼리에는 너무 비싸거나 복잡한 작업에는 부족하기 때문입니다. 각 작업에 가장 적합한 모델을 자동으로 선택하는 모델 라우팅이 해결책으로 부상하고 있습니다. Snowflake의 Cortex AI Gateway는 이제 동적 모델 라우팅 기능을 제공하여 사용자가 "자동" 선택을 선택할 수 있으며, 이는 품질과 비용의 균형을 맞추는 모델에 작업을 지능적으로 할당합니다. 이 기능은 간단한 질문에 대한 과도한 지출을 덜 능력 있고 저렴한 모델을 사용하여 방지함으로써 토큰 비용을 최대 3배까지 줄일 수 있다고 합니다. Databricks, AWS, Google Cloud, Nvidia와 같은 다른 주요 업체들도 유사한 모델 라우팅 기술을 개발하고 있습니다. Snowflake는 모델 라우팅이 가격과 성능 이상의 것을 포함하며, 거버넌스와 컨텍스트를 중요하게 통합한다고 강조합니다. 동적 라우팅 메커니즘은 "어드바이저 패턴"을 사용하여 더 작은 모델이 먼저 작업을 시도하고 필요한 경우 더 큰 모델로 에스컬레이션합니다. 또한 과거 쿼리에 대해 훈련된 분류기는 간단한 질문을 더 적합하고 간단한 모델로 라우팅합니다. 이 자동 라우팅은 선택 사항이며, 고객이 원하는 경우 수동으로 모델을 지정할 수 있습니다. Snowflake는 라우팅을 기존 데이터 거버넌스와 통합하여 역할 기반 액세스 제어를 데이터에서 모델 및 에이전트로 확장합니다. 오픈 모델은 데이터 상주 요구 사항을 충족하기 위해 고객의 리전 내에서 실행될 수 있으며, 모든 추론은 Snowflake의 보안 경계 내에 유지됩니다. Horizon Context 및 Cortex Sense와 같은 도구에서 제공하는 향상된 컨텍스트는 광범위한 탐색 작업의 필요성을 제거하여 저렴한 모델이 작업을 효과적으로 처리할 수 있도록 합니다. 에이전트 메모리도 컨텍스트에 통합되어 중복 문제 해결을 방지하고 비용을 절감합니다. 모델 라우팅의 경쟁 환경에는 OpenRouter, Nvidia의 Switchyard, Databricks의 Smart Routing과 같은 플랫폼이 포함됩니다. 차별화는 선호하는 플랫폼 내의 통합 거버넌스, 데이터 지역성, 액세스 제어 및 비용 할당으로 이동하고 있습니다. 모델 라우터를 선택할 때 조직은 기능이나 가격에만 초점을 맞추기보다는 기존 데이터 거버넌스 및 팀 구조와 가장 잘 맞는 것을 우선시해야 합니다. 어떤 라우터를 채택할지에 대한 결정은 기업의 기존 데이터 인프라 및 거버넌스 모델에 크게 좌우됩니다.
알리바바가 최근 Hugging Face에 270억 파라미터 규모의 Qwen3.8-27B 모델을 발표하면서 AI 개발자들과 파워 유저들 사이에 큰 기대감을 불러일으켰습니다. 이 오픈 소스 모델은 Apache 2.0 라이선스 하에 이미지 및 비디오 이해와 큰 컨텍스트 창 같은 인상적인 기능을 제공합니다. FP8 버전은 비교적 작은 하드웨어 용량에 있으며, FP8 버전은 GPU 메모리 28GB만 필요로 합니다. 4비트로 양자화된 이 기기는 고성능 소비자용 기기에서도 실행될 수 있어 성능과 접근성 사이에서 균형을 이룹니다.알리바바의 초기 벤치마크는 경쟁력 있는 결과를 보여주었으며, 특정 작업에서 일부 독점 모델을 능가하기도 했습니다. 하지만 제3자 평가를 통해 그 역량이 더욱 입증되었으며, 한 기관은 OpenAI의 GPT-5.6 Luna와 동등한 점수를 부여했습니다. 이로 인해 지역 모델이 개척지 수준의 역량을 달성하고 있다는 인식이 생겼으며, 이는 이전에는 수년이 걸릴 것으로 여겨졌던 발전입니다. 사용자들은 복잡한 에이전트 작업 수행과 모델 코딩에 성공했다고 보고하고 있습니다.인상적인 성능에도 불구하고, Qwen3.8-27B는 광범위한 추론을 통해 일부 품질을 달성한 것으로 보이며, 그 결과 추론 속도가 느려집니다. 이 트레이드오프는 사용자가 더 빠르고 일상적인 사용을 위해 추론 설정을 조정해야 할 수도 있음을 의미합니다. 그럼에도 불구하고, 클라우드 API에만 의존하지 않고 이처럼 강력한 모델을 로컬에서 다운로드, 수정, 실행할 수 있는 능력은 중대한 변화를 의미합니다. 기업의 경우, 이는 자체 인프라에서 로컬 배포를 가능하게 하여 프라이버시, 보안, 비용 통제가 강화되는 결과를 의미합니다. Qwen3.8-27B와 같은 작고 강력한 모델의 광범위한 채택은 개발자들 사이에서 셀프 호스팅 AI 솔루션으로의 추세가 커지고 있음을 시사합니다.
CdXz5zHNQW_940IUNX6di.png
Cursor는 코드 호스팅 플랫폼인 Origin을 유료 사용자에게 출시했으며, 이는 GitHub의 6시간 동안의 심각한 장애와 시기적으로 일치했습니다. Copilot 및 엔터프라이즈 싱글 사인온을 포함한 다양한 GitHub 서비스에 영향을 미친 이 장애는 경쟁사로부터 날카로운 논평을 불러일으켰습니다. Vercel의 CEO는 GitHub의 다운타임과 비교하여 Origin의 가동 시간을 비꼬듯이 언급했으며, Cursor 직원은 그들의 출시가 우연히 완벽한 타이밍에 이루어졌음을 강조했습니다. Origin은 AI 에이전트를 Cursor 편집기 내 개발 워크플로우에 직접 통합하여 코드 호스팅을 더욱 관련성 있게 만드는 것을 목표로 합니다. 개발자는 코드 및 풀 리퀘스트와 동일한 인터페이스에서 AI 에이전트와 상호 작용하여 제자리 수정 및 코드 관리를 가능하게 합니다. 결정적으로, Origin은 GitHub를 완전히 대체하는 것이 아니라 데이터와 동기화하고 기존 GitHub 리포지토리가 공존하도록 허용하는 보완 도구 역할을 하도록 설계되었습니다. 이 "쐐기" 전략은 기업의 마이그레이션 위험을 최소화하고, 파괴적인 전면 교체가 아닌 개발자가 시간을 보내는 곳에 초점을 맞춥니다. 플랫폼의 강점은 기존 GitHub Actions 워크플로우를 변경 없이 실행할 수 있다는 능력에 있으며, 이는 새로운 도구를 평가하는 팀에게 더 쉽게 판매할 수 있도록 합니다. 점점 더 많아지는 AI 생성 코드의 양은 더 많은 검토가 필요하고 불안정성을 초래할 수 있으며, 이는 Origin의 에이전트 네이티브 접근 방식이 해결하고자 하는 병목 현상을 제시합니다. 최근 빈번한 주요 사고로 인한 GitHub의 신뢰성 부족은 Origin과 같은 대안을 위한 기회를 창출했습니다. 이미 몇몇 유명 프로젝트가 과거 성능 문제로 인해 GitHub에서 이전했습니다. Cursor의 SpaceX 인수는 데이터 거버넌스 및 다양한 AI 모델 통합과 관련하여 또 다른 복잡성을 더합니다. Origin을 고려하는 조직의 핵심 질문은 자체 AI 이니셔티브를 가진 로켓 회사의 부서에서 독점 소스 코드를 어떻게 관리할 것인가입니다.
검색 증강 생성(Retrieval-augmented generation, RAG) 시스템은 검색된 문서에서만 답변하도록 설계되었음에도 불구하고 때때로 "역할 드리프트(role drift)"를 나타내는데, 이는 리더 모듈이 종단간 정확도 향상을 위해 내부 메모리에서 답변을 선택하는 현상입니다. 이는 개별 모듈이 전반적인 성능 향상에도 불구하고 할당된 작업에서 벗어나는 복합 AI 시스템의 숨겨진 과제입니다. MIT와 하버드 연구진은 이를 상쇄하기 위해 훈련 중에 모듈이 지정된 역할을 준수하도록 강제하는 기술인 Role Anchor를 도입했습니다. Role Anchor는 RAG 리더와 같은 모듈이 내부 지식이 아닌 증거에 의존하도록 보장하는 가드레일이자 진단 도구 역할을 합니다. 핵심 문제는 종단간 정확도만으로는 이 근본적인 문제를 가릴 수 있으며, 시스템의 실제 학습을 과대평가할 수 있다는 것입니다. 이러한 사각지대는 실제 배포에서 확장성, 신뢰성 및 감사 가능성에 문제를 야기할 수 있습니다. 예를 들어, 내부 메모리에 의존하는 RAG 시스템은 외부 데이터베이스가 업데이트될 때 취약해집니다. Role Anchor는 모듈의 동작을 특정 역할 프롬프트의 유무에 따라 비교하여 프롬프트가 제공하는 "역할 유용성(role utility)" 또는 "넛지(nudge)"를 측정합니다. 훈련 중에 Role Anchor는 의도된 넛지에서 벗어나는 것을 페널티로 부과하여 모듈이 역할 준수 방식으로 개선되도록 강제합니다. RAG 및 Decomposer-Solver 파이프라인에 대한 실험은 Role Anchor가 모듈 무결성을 보존하여 RAG 리더가 검색된 증거를 무시하거나 Decomposer가 답변을 누설하는 것과 같은 지름길을 방지함을 보여주었습니다. 때때로 약간의 정확도 하락을 초래하지만, Role Anchor는 Decomposer-Solver 파이프라인에서 상당한 비율의 "가짜" 정확도 상승을 방지한 것으로 입증된 것처럼 진정한 학습과 견고성을 보장합니다. Role Anchor를 통합하는 것은 기존 강화 학습 미세 조정 프로세스 내에서 각 구성 요소에 대한 추가 훈련 목표로 추가하는 것을 포함합니다.
기업들은 AI 에이전트가 자신 있게 잘못된 답변을 제공하는 것을 방지하기 위해 거버넌스된 컨텍스트 레이어를 구축하고 있지만, 역설적으로 실패율은 증가하고 있습니다. 2026년 7월 설문 조사에 따르면, 기업의 68%가 이러한 실패의 원인을 누락되거나 일관성 없는 비즈니스 컨텍스트로 추적했으며, 37%는 반복적인 문제를 경험했습니다. 더 많은 기업이 거버넌스된 레이어를 구현함에도 불구하고 실패율은 상승하고 있습니다. 컨텍스트 제공 방식은 정확도에 상당한 영향을 미칩니다. 문서 검색은 일반적이지만 완벽하지 않으며, 많은 기업이 구조화된 접근 방식을 부족해합니다. 기업들은 자신 있게 잘못된 답변을 직접적으로 해결하는 검색 정확도보다는 검색 시스템을 구매할 때 액세스 제어를 우선시합니다. 기업들은 응답 정확도를 측정하여 정확성을 중요하게 생각하지만, 구매 결정은 일치하지 않습니다. 비즈니스 데이터의 공유 모델인 거버넌스된 컨텍스트 레이어는 실패를 가시화하여 이를 해결하는 것을 목표로 합니다. 이러한 레이어를 적극적으로 구축하거나 운영하는 기업들은 더 높은 반복 실패율을 보고하는데, 이는 레이어가 문제를 야기하는 것이 아니라 문제를 더 잘 탐지하고 있음을 나타냅니다. 이러한 가시성은 AI 에이전트에 의해 증폭된 오래된 데이터 거버넌스 문제를 식별하는 데 중요합니다. 대기업은 더 많은 실패를 보고하는데, 이는 더 나은 계측 및 조사를 시사합니다. 특히 시스템 간의 일관성 없는 정의의 경우, 검색만으로는 컨텍스트 격차를 좁히기에 충분하지 않습니다. 예산은 이러한 레이어 구축에 투입되고 있지만, 실제 프로덕션 배포는 지연되어 지출과 문제 해결 간의 격차를 드러냅니다. 깨끗한 실패 기록은 강력한 거버넌스가 아니라 점검 부족을 나타내는 위험 신호입니다. 대부분의 기업은 이 중요한 AI 의사 결정 구성 요소에 대한 통제권을 유지하면서 컨텍스트 레이어에 대해 다중 공급업체 접근 방식을 사용할 계획입니다.