Recent Announcements 한국어 노트

Recent Announcements 한국어

AWS(Amazon Web Services)는 컴퓨트, 스토리지, 보안 및 애플리케이션 서비스를 포함하여 다양한 서비스를 제공합니다. 최근의 발표 및 업데이트는 다음과 같습니다. 1. AWS Outposts: AWS Outposts는 컴퓨트, 스토리지 및 데이터베이스 기능을 포함하는 완전히 관리되는 서비스입니다. 최근 업데이트에는 다양한 국가에서 Outposts를 출시하는 것이 포함됩니다. 2. AWS Lambda: 온디맨드 리소스를 제공하는 컴퓨트 서비스입니다. 최근 업데이트에는 동시 제어 향상 및 Amazon API Gateway와의 통합이 포함됩니다. 3. Amazon S3: 지구력 있는 스토리지를 제공합니다. 최근 업데이트에는 애플리케이션 마이그레이션 API의 출시 및 스냅샷 암호화가 포함됩니다. 4. AWS Billing: AWS 리소스에 대한 자세한 청구 정보를 볼 수 있습니다. 최근 업데이트에는 청구 세부 정보 개선이 포함됩니다. 5. AWS Config: AWS 리소스에 대한 모니터링, 보고 및 자동 수정을 제공합니다. 최근 업데이트에는 알림 액션 및 AWS Step Functions이 포함됩니다. 6. AWS Multi-Region Access Point for Amazon S3: S3의 Multi-Region Access Points는 S3에 대한 글로벌 네임스페이스를 제공하여 빠른, 안전한, 복원력이 있는 스토리지 서비스를 제공합니다. 7. Amazon Route 53: 도메인 등록 및 DNS 서비스를 제공합니다. 최근 업데이트에는 S3의 Multi-Region Access Points 지원이 포함됩니다. 8. AWS Lake Formation: 데이터 엔지니어링, 데이터 변환 및 데이터 거버넌스 서비스입니다. 최근 업데이트에는 워크플로우 생성 및 JDBC 드라이버를 사용한 데이터베이스 자격 증명 연결이 포함됩니다. 9. Amazon EMR: 빅데이터 처리, 분석, 머신 러닝(ML) 등을 위한 빅데이터 처리 서비스입니다. 최근 업데이트에는 클러스터 버전 관리 및 버그 수정이 포함됩니다. 10. AWS Step Functions: 분산 애플리케이션 및 마이크로 서비스 지향 아키텍처의 구성 요소를 조정하는 서비스입니다. 최근 업데이트에는 향상된 태스크 토큰 입력 처리 및 자동 대체가 포함됩니다.

노트 스레드

AWS Continuum for penetration testing은 개발 수명 주기 전반에 걸쳐 애플리케이션을 선제적으로 보호하는 프론티어 에이전트로, 실제 악용 가능성 테스트를 포함한 온디맨드 맞춤형 침투 테스트를 제공합니다. 개발자와 보안 팀은 이제 침투 테스트 실행 전에 로그인 자격 증명을 테스트하고 제안된 도메인을 받을 수 있습니다. 이를 통해 처음부터 정확한 네트워크 범위를 쉽게 구성할 수 있으며, 잘못된 구성과 테스트 주기 낭비를 줄일 수 있습니다.이전에는 애플리케이션이 도달하는 모든 URL을 식별하는 데 수동 노력이 필요했으며, 인증 실패는 전체 테스트 주기가 완료된 후에야 발견되어 시간과 리소스를 소모했습니다. 이번 출시를 통해 테스트 구성 중에 로그인 자격 증명을 추가하면 AWS Continuum은 실제 사용자처럼 애플리케이션에 인증하여 로그인 중에 도달한 모든 액세스 가능한 도메인을 캡처하고 이를 범위 내 URL 제안으로 표시합니다. 실제 테스트가 시작되기 전에 액세스 가능한 도메인을 검토하고, 자격 증명을 검증하며, 에이전트가 올바른 엔드포인트를 다루는지 확인할 수 있습니다. 액세스 가능한 도메인은 자격 증명 테스트가 성공하든, 실패하든, 시간 초과되든 관계없이 반환됩니다. 이 기능에 대한 자세한 내용은 업데이트된 문서를 참조하십시오.이 기능은 AWS Continuum for penetration testing를 사용할 수 있는 모든 리전에서 사용할 수 있으며, AWS Continuum 제품 페이지에 자세히 설명되어 있습니다.
AWS Resilience Hub의 차세대 버전은 AWS에서 실행되는 워크로드의 복원력을 평가하고 강화하는 데 도움이 되는 AWS의 중앙 집중식 위치입니다. 자동화된 종속성 검색, 생성형 AI 기반 장애 모드 분석, 모듈식 복원력 정책, 복원력 테스트 및 조직 전체 복원력 상태 보고 기능을 제공합니다. 오늘 AWS Resilience Hub는 세 가지 새로운 기능을 추가했습니다. 서비스 입력 소스에 대한 EKS 레이블 지원, 종속성 인사이트, AWS Organizations를 통한 복원력 정책 공유입니다.서비스 입력 소스에 대한 EKS 레이블 지원. Resilience Hub는 이제 네임스페이스 내의 EKS 레이블을 서비스 입력 소스로 지원하므로 고객은 기존 Kubernetes 레이블 지정 규칙을 사용하여 장애 모드 분석 중에 Resilience Hub가 검색하고 사용하는 리소스를 정확하게 범위 지정할 수 있습니다. 이를 통해 평가는 팀이 EKS 워크로드를 구성하는 방식과 일치하게 유지됩니다.종속성 인사이트. 종속성 검색을 활성화한 고객은 이제 새로운 생성형 AI 기반 기능인 종속성 인사이트를 생성할 수 있습니다. 이 기능은 검색된 애플리케이션 종속성을 분석하고 의미 있는 패턴을 강조 표시합니다. 종속성 인사이트는 새로운 종속성을 표시하고, 리전 간 종속성을 식별하며, 특이한 사용 패턴을 표시합니다. 이를 통해 팀은 종속성 분석을 가속화하고 잠재적인 새로운 위험을 식별할 수 있습니다.AWS Organizations를 통한 복원력 정책 공유. Resilience Hub는 이제 AWS Organizations를 통해 복원력 정책 공유를 지원하여 중앙 팀이 여러 계정에 적용할 수 있는 정책을 구축하고 관리할 수 있도록 합니다. 이를 통해 어떤 서비스가 각 정책을 사용하고 있는지 조직 전체에서 관찰할 수 있어 채택을 모니터링하고 조직 전체에서 일관된 복원력 상태를 보장하기가 더 쉬워집니다.시작하려면 AWS 콘솔을 방문하십시오. 자세히 알아보려면 제품 페이지를 보거나 설명서를 방문하십시오.
AWS RTB Fabric이 이제 응답자 게이트웨이에 대한 구성 가능한 가용 영역(AZ) 선호도를 지원합니다. 이 기능을 통해 파트너가 응답자 게이트웨이에 연결하는 방식을 구성할 수 있습니다. 즉, 파트너 자체 가용 영역에 연결하거나 게이트웨이가 걸쳐 있는 모든 가용 영역에 연결할 수 있습니다. 이번 출시를 통해 광고 기술(AdTech) 기업은 RTB Fabric에 대한 추가 요금 없이 인프라를 더욱 효율적으로 사용할 수 있습니다.수요 측 플랫폼(DSP) 및 공급 측 플랫폼(SSP)은 여러 가용 영역에 걸쳐 입찰 시스템을 운영합니다. 이전에는 AWS RTB Fabric이 각 요청을 요청자의 자체 가용 영역(AZ)에서 사용 가능한 게이트웨이 용량으로 보냈으므로 다른 AZ의 용량이 사용되지 않을 수 있었습니다. 이제 클라이언트 라우팅 정책을 설정하여 이를 제어할 수 있습니다. 경계를 넘는 추가 지연 시간을 피하기 위해 요청자의 자체 AZ를 선호하거나, 응답자 게이트웨이가 걸쳐 있는 모든 AZ를 사용하여 각 요청자가 더 많은 게이트웨이 용량에 액세스하도록 할 수 있습니다. 구성 가능한 가용 영역 선호도는 AWS RTB Fabric을 사용할 수 있는 모든 AWS 리전에서 사용할 수 있습니다. 활성화하기 전에 AWS RTB Fabric 사용자 가이드에서 플릿 요구 사항을 참조하십시오.AWS RTB Fabric은 Amazon Ads, GumGum, Kargo, MobileFuse, Sovrn, TripleLift, Viant, Yieldmo 등과 같은 AdTech 파트너와 3단계로 연결하고, 개인화된 고성능 네트워크 환경을 통해 단일 자릿수 밀리초 지연 시간을 제공하도록 지원합니다. RTB Fabric은 표준 클라우드 네트워킹 비용을 최대 80%까지 절감하며 선결제 약정이 필요하지 않습니다. AWS RTB Fabric은 다음 AWS 리전에서 일반적으로 사용할 수 있습니다. 미국 동부(버지니아 북부), 미국 서부(오레곤), 아시아 태평양(싱가포르), 아시아 태평양(도쿄), 유럽(프랑크푸르트), 유럽(아일랜드). 자세한 내용은 AWS RTB Fabric 제품 페이지를 참조하십시오.
Amazon Bedrock은 고객이 신뢰하는 동일한 보안 및 거버넌스를 유지하면서 오픈 가중치 모델 포트폴리오를 계속 확장하고 있습니다. 오늘날 Moonshot AI의 Kimi K3가 Amazon Bedrock에서 일반에 공개되어 코딩 및 지식 작업에 대한 강력한 새로운 옵션을 제공합니다.Moonshot AI에 따르면 Kimi K3는 가장 성능이 뛰어난 모델이며 2.8조 개의 매개변수에 도달한 최초의 오픈 모델입니다. 네이티브 비전 기능과 100만 토큰 컨텍스트 창을 결합하여 대규모 리포지토리에 걸친 장기 코딩 세션, 스캔된 페이지 및 스크린샷을 포함한 다중 문서 분석, 확장된 에이전트 워크플로우에 적합합니다. Moonshot AI는 Kimi K2에 비해 확장 효율성이 약 2.5배 향상되었다고 보고합니다. Amazon Bedrock에서 Kimi K3는 독점 모델과 동일한 보안 경계 내에서 실행되며, 액세스, 암호화 및 감사에 대한 동일한 제어가 모델 포트폴리오 전체에 적용됩니다. Kimi K3는 Amazon Bedrock에서 명시적 프롬프트 캐싱을 지원하는 최초의 오픈 가중치 모델로, 모델 호출 간에 컨텍스트를 재사용할 때 지연 시간과 입력 비용을 줄이는 데 도움이 됩니다.Kimi K3는 교차 리전 추론을 통해 Amazon Bedrock을 사용할 수 있는 모든 AWS 리전에서 사용할 수 있습니다. 시작하려면 Amazon Bedrock 콘솔을 방문하십시오. 자세히 알아보려면 Amazon Bedrock 설명서를 참조하고 출시 블로그 게시물을 읽어보십시오.
오늘 AWS는 Amazon Bedrock AgentCore 내의 서버리스 마이크로VM 컴퓨팅인 AgentCore Runtime의 차세대 버전을 출시한다고 발표했습니다. 새로운 Runtime은 세션 전체에서 사용되지 않는 메모리를 회수하는 탄력적인 메모리 관리 기능을 제공하여 피크 사용량이 아닌 실제 사용량에 대해서만 비용을 지불하게 하며, 컨테이너 이미지 크기나 동시성과 관계없이 일관된 콜드 스타트 시간을 제공합니다. 이미 사용하고 있는 서버리스 모델을 그대로 이용할 수 있습니다. 사전 프로비저닝 없음, 제로 스케일링, 하드웨어 기반 세션 격리, 사용한 만큼만 지불하는 기능은 그대로 유지하면서 이제 더 낮은 비용과 더 빠른 시작 시간을 제공합니다.새로운 Runtime을 통해 각 세션은 작고 효율적인 메모리 프로필로 시작됩니다. 워크로드 요구에 따라 추가 메모리가 온디맨드로 할당되며, 더 이상 활발하게 사용되지 않는 메모리는 세션이 끝날 때까지 유지되는 대신 회수됩니다. 콜드 스타트의 경우, 새로운 Runtime은 에이전트 환경을 한 번 준비하고 스냅샷을 찍습니다. 모든 새 인스턴스는 전체 시작 시퀀스를 반복하는 대신 해당 스냅샷에서 복원되어 이미지 크기에 관계없이 시작 시간을 일관되게 유지합니다. 테스트에서 새로운 Runtime은 V1의 5.4~30초에 비해 200MB에서 2GB까지의 컨테이너 이미지에 대해 P75 콜드 스타트 시간을 1.9~2.0초로 제공했습니다.새로운 AgentCore Runtime은 다음 리전에서 사용할 수 있습니다: us-east-1, us-east-2, us-west-2, eu-west-1, ap-northeast-1. 시작하려면 런타임을 생성하거나 업데이트할 때 platformVersion을 V2로 설정하십시오.자세히 알아보려면 AgentCore Runtime 설명서 또는 AWS News Blog를 방문하십시오. 가격 정보는 AgentCore 가격을 참조하십시오.
AWS PrivateLink 고객은 이제 VPC 엔드포인트를 사용하여 다른 VPC/계정의 네트워크 세그먼트에 비공개로 안전하게 액세스할 수 있습니다. 새로운 유형의 VPC 엔드포인트인 '터널' 엔드포인트를 사용하여 네트워크 세그먼트로 터널링하고 내부에 있는 리소스에 액세스할 수 있습니다.AWS PrivateLink는 로드 밸런싱된 서비스, 어플라이언스, 데이터베이스 및 도메인과 같은 리소스에 VPC 및 계정 경계를 넘어 비공개 액세스를 제공하는 고가용성 및 확장 가능한 기술입니다. 이번 출시 이전에는 외부 공급업체와 같은 다른 당사자와 리소스를 공유하려는 고객은 각 리소스에 대해 리소스 구성을 하나씩 생성하여 개별적으로 공유해야 했습니다. 이제 고객은 네트워크의 CIDR 범위를 나타내는 리소스 구성을 생성하고 AWS Resource Access Manager(RAM)를 통해 공급업체와 공유할 수 있습니다. 공급업체는 터널 엔드포인트를 생성하고 GENEVE 캡슐화를 사용하여 고객이 지정한 CIDR 범위 내에 있는 리소스에 액세스하기 위해 고객의 VPC로 터널링할 수 있습니다. 터널 엔드포인트에는 시간당 요금이 부과되며, 이를 통해 처리되는 데이터에는 GB당 요금이 부과됩니다. AWS PrivateLink 가격 책정 페이지를 참조하십시오. 이 기능은 다음 AWS 리전에서 사용할 수 있습니다: 미국 동부(버지니아 북부), 미국 동부(오하이오), 미국 서부(캘리포니아 북부), 미국 서부(오레곤), 아프리카(케이프타운), 아시아 태평양(홍콩), 아시아 태평양(하이데라바드), 아시아 태평양(자카르타), 아시아 태평양(말레이시아), 아시아 태평양(멜버른), 아시아 태평양(뭄바이), 아시아 태평양(오사카), 아시아 태평양(서울), 아시아 태평양(싱가포르), 아시아 태평양(시드니), 아시아 태평양(도쿄), 캐나다(중부), 캐나다 서부(캘거리), 유럽(프랑크푸르트), 유럽(아일랜드), 유럽(런던), 유럽(밀라노), 유럽(파리), 유럽(스페인), 유럽(스톡홀름), 유럽(취리히), 멕시코(중부), 남아메리카(상파울루).이 기능에 대해 자세히 알아보고 시작하려면 AWS PrivateLink 설명서를 참조하십시오.
AWS Transfer Family는 이제 VPC 호스팅 엔드포인트를 사용하는 SFTP 서버 앞에 Network Load Balancer(NLB)를 배치할 때 Proxy Protocol v2(PPv2)를 사용하여 클라이언트의 소스 IP 주소를 보존합니다. 이제 자체 NLB를 사용할 때 IP 기반 감사, 액세스 제어 및 규정 준수를 위해 클라이언트의 소스 IP 가시성을 유지할 수 있습니다.이전에는 NLB가 클라이언트의 소스 IP를 자체 개인 IP 주소로 대체했기 때문에 Transfer Family 로그 및 이벤트는 클라이언트의 소스 IP 대신 NLB의 주소를 기록했습니다. NLB의 개인 IP는 인증 중에 사용자 지정 ID 공급자에게 제시되는 주소였기 때문에 실제 소스 IP를 기반으로 사용자를 승인할 수 없었습니다. 이번 출시를 통해 SFTP 서버에서 소스 IP 보존을 활성화하여 클라이언트의 소스 IP를 보존할 수 있습니다. 보존된 소스 IP는 로그 및 이벤트에 기록되고 인증 중에 사용자 지정 ID 공급자에게 제시됩니다. 콘솔, CLI 또는 API를 통해 각 Transfer Family 서버에서 개별적으로 기능을 활성화할 수 있습니다.SFTP 서버에 대한 소스 IP 보존은 AWS Transfer Family를 사용할 수 있는 모든 AWS 리전에서 사용할 수 있습니다. 시작하려면 AWS Transfer Family 콘솔을 방문하거나 AWS CLI/SDK를 사용하십시오. 자세히 알아보려면 Transfer Family 사용자 가이드를 방문하십시오.
AWS HealthOmics가 이제 IAM 세션 정책을 지원하여 여러 IAM 역할을 생성하고 관리할 필요 없이 개별 실행에 대한 권한을 제한할 수 있습니다. 지금까지 단일 실행에 대한 권한을 동적으로 축소할 방법이 없어 각 테넌트 또는 실행마다 별도의 IAM 역할을 생성해야 했습니다. AWS HealthOmics는 의료 및 생명 과학 고객이 완전히 관리되는 생물정보학 워크플로우를 통해 과학적 발전을 가속화하는 데 도움이 되는 HIPAA 적격 서비스입니다.IAM 세션 정책은 기본 서비스 역할의 권한을 수정하지 않고 실행의 최대 권한을 제한하는 인라인 정책입니다. 실행 중 효과적인 권한은 기본 ID 기반 정책과 임시 세션 정책 모두에서 허용하는 권한의 교집합입니다. 예를 들어, 멀티테넌트 애플리케이션을 운영하는 경우 해당 테넌트의 Amazon S3 버킷에만 실행의 액세스를 제한하는 세션 정책을 전달할 수 있으며, 해당 테넌트에 대한 전용 IAM 역할을 프로비저닝할 필요가 없습니다. 또한 IAM 세션 정책을 사용하여 단일 실행에 대한 특정 Amazon S3 객체에 대한 임시 액세스 권한을 부여하고 실행별로 민감한 리소스에 대한 액세스를 격리할 수 있습니다.IAM 세션 정책 지원은 AWS HealthOmics를 사용할 수 있는 모든 AWS 리전에서 사용할 수 있습니다: 미국 동부(버지니아 북부, 오하이오), 미국 서부(오레곤), 유럽(프랑크푸르트, 아일랜드, 런던), 이스라엘(텔아비브), 아시아 태평양(도쿄, 싱가포르, 서울). 실행에 대한 IAM 세션 정책을 구성하는 방법에 대한 자세한 내용은 AWS HealthOmics 사용자 가이드의 권한 섹션을 참조하십시오. 서비스에 대한 자세한 내용은 AWS HealthOmics를 참조하십시오.
AWS는 새로운 저비용 버스트 가능 Amazon EC2 T8i 인스턴스의 일반 공급을 발표합니다. 이 인스턴스는 AWS에서만 독점적으로 제공되는 맞춤형 6세대 Intel Xeon 6 프로세서로 구동되며, 최신 6세대 AWS Nitro 카드 기반으로 구축되었습니다. T8i 인스턴스는 이전 세대 T3 인스턴스 대비 최대 30% 향상된 가격 대비 성능을 제공하며, 나노, 마이크로, 스몰, 미디엄의 네 가지 크기로 제공됩니다. 이 인스턴스는 데이터 처리, 로그인 게이트웨이, 소규모 데이터베이스, 배치 처리, 이벤트 기반 함수, CI/CD 파이프라인, 마이크로서비스, 저 트래픽 웹사이트 등 낮은 수준에서 중간 수준의 CPU 활용도를 요구하는 워크로드에 최적화되어 있습니다.T8i 인스턴스는 T3 인스턴스 대비 최대 70% 높은 컴퓨팅 성능, 1.25배 높은 네트워크 대역폭, 2.4배 높은 EBS 대역폭을 제공합니다. T3와 동일한 CPU 크레딧 시스템을 표준 및 무제한 모드로 사용하므로, 기존 T3 고객은 T8i로 업그레이드하여 즉시 향상된 가격 대비 성능의 이점을 누리고 총 소유 비용(TCO)을 절감할 수 있습니다. AWS 신규 고객 또는 온프레미스에서 마이그레이션하는 고객에게 T8i 인스턴스는 다양한 워크로드를 실행할 수 있는 가장 비용 효율적인 진입점 중 하나를 제공합니다.T8i.micro 및 T8i.small은 AWS 프리 티어에서 사용할 수 있습니다. T8i 인스턴스는 미국 동부(버지니아 북부, 오하이오), 미국 서부(오레곤, 캘리포니아 북부), 유럽(프랑크푸르트, 아일랜드, 런던, 파리), 아시아 태평양(하이데라바드, 말레이시아, 뭄바이, 서울, 싱가포르, 시드니, 도쿄), 캐나다(중부) 리전에서 사용할 수 있습니다. T8i 인스턴스는 온디맨드 인스턴스 및 스팟 인스턴스로 구매 가능하며, 세이빙스 플랜 옵션은 곧 제공될 예정입니다. 자세한 내용은 Amazon EC2 T8i 인스턴스 페이지를 방문하십시오.
Amazon Simple Email Service (SES)가 이제 Virtual Deliverability Manager (VDM)에서 테넌트 수준의 전달 가능성 인사이트를 지원합니다. 테넌트 관리를 통해 이메일 발신자는 고객, 비즈니스 단위 또는 애플리케이션별로 이메일 발신을 분리할 수 있습니다. 이전에는 VDM이 계정, ISP, 발신 ID 및 구성 세트 수준에서 전달 가능성 지표를 제공했습니다. 이제 테넌트를 사용하고 VDM을 활성화한 고객은 각 테넌트의 전달 가능성도 모니터링할 수 있습니다.VDM 대시보드에 테넌트별 지표(발신 볼륨, 전달, 반송, 불만, 열람, 클릭)를 제공하는 테넌트 보기와 메일함 제공업체별, 관련 ID 및 구성 세트별로 해당 지표를 세분화하는 상세 페이지가 추가되었습니다. 고객은 테넌트의 발신 메시지를 검색 및 내보내거나, BatchGetMetricData API 작업의 새로운 TENANT_NAME 차원을 사용하여 프로그래밍 방식으로 테넌트 지표를 쿼리할 수도 있습니다. 이를 통해 발신자는 전달 가능성 문제를 일으키는 테넌트를 식별하고 다른 테넌트에 영향을 주지 않고 수정할 수 있습니다.Virtual Deliverability Manager는 Amazon SES를 사용할 수 있는 모든 AWS 리전에서 사용할 수 있습니다.자세한 내용은 Amazon SES 콘솔을 방문하거나 Amazon SES 개발자 가이드의 Virtual Deliverability Manager 대시보드 문서를 참조하십시오.
Amazon QuickSight는 이제 두 가지 새로운 대시보드 생성 방식으로 Generate Analysis 기능을 확장합니다. 기존 분석 내에서 자연어를 사용하여 단일 시트를 생성하거나, 기존 대시보드 이미지에서 새 분석을 생성할 수 있습니다.Generate Sheet를 사용하면 원하는 시트를 설명하면 Amazon QuickSight가 데이터에 맞는 시각화, 필터 컨트롤 및 연간 성장률, 월별 비교와 같은 계산된 필드를 포함하여 현재 분석에 추가합니다. 각 시각화를 수동으로 구축하지 않고도 분석을 확장할 수 있습니다.이미지에서 분석 생성 기능을 사용하면 분석을 생성할 때 다른 BI 도구의 대시보드를 포함하여 대시보드 이미지를 프롬프트에 첨부할 수 있습니다. Amazon QuickSight는 이를 편집 가능한 분석으로 다시 생성하며, Amazon QuickSight에서 지원되는 기능을 구축합니다. 두 기능 모두 기존 게시 워크플로, 임베딩, CI/CD 파이프라인 및 포인트 앤 클릭 편집과 함께 작동합니다.출시 시점에 Generate Sheet 및 이미지에서 분석 생성 기능은 Enterprise 구독/Author Pro 사용자에게 제공됩니다. 또한 조직에서 액세스를 제한하지 않은 경우 Amazon QuickSight Enterprise의 일부로 2026년 12월까지 작성자는 이 기능에 대한 프로모션 액세스 권한을 갖습니다.자세히 알아보려면 Amazon QuickSight 사용자 가이드의 "자연어 프롬프트를 사용하여 분석 생성"을 참조하십시오. 시작하려면 분석을 열고 Generate Sheet를 선택하거나 프롬프트에 이미지를 첨부하고 Generate analysis를 선택하십시오.
Amazon SageMaker AI가 이제 NVIDIA Nemotron 3.5 Lightning 모델에 대한 서버리스 모델 맞춤 설정을 지원합니다. 이는 지도 미세 조정(SFT), 직접 선호도 최적화(DPO), 강화 학습 미세 조정(RFT)을 통해 가능합니다. 이 모델은 NVIDIA의 최신 오픈 가중치 모델 중 하나로, 30억 개의 활성 매개변수와 총 300억 개의 매개변수를 가진 하이브리드 Mixture-of-Experts 아키텍처를 사용합니다. SageMaker AI에 이 모델을 배포하는 것 외에도, 이제 특정 도메인 및 워크플로우에 맞게 모델을 조정할 수 있습니다.모델 맞춤 설정은 자체 데이터를 사용하여 기반 모델을 맞춤화할 수 있도록 하여, 더 작고 적절한 크기의 모델이 최전선 모델과 동등한 품질을 작업에서 달성하도록 함으로써 비용과 지연 시간을 줄입니다. SFT를 사용하여 레이블이 지정된 데이터로 특정 도메인 작업의 정확도를 향상시키거나, DPO를 사용하여 선호도 데이터로 조직의 톤에 맞게 출력을 조정하거나, RFT를 사용하여 보상 신호로 새로운 작업의 성능을 향상시킬 수 있습니다. 서버리스 맞춤 설정을 통해 SageMaker AI는 모든 인프라 프로비저닝 및 학습 오케스트레이션을 처리하므로, 클러스터 관리 대신 데이터와 평가에 집중할 수 있으며 사용한 만큼만 비용을 지불하면 됩니다.SageMaker AI에서 NVIDIA Nemotron 3.5 Lightning에 대한 서버리스 모델 맞춤 설정은 US East (N. Virginia), US West (Oregon), Asia Pacific (Tokyo), Europe (Ireland) 리전에서 사용할 수 있습니다. 시작하려면 Amazon SageMaker Studio의 모델 페이지로 이동하여 맞춤 설정 작업을 시작하거나, SageMaker Python SDK를 사용하여 프로그래밍 방식으로 액세스할 수 있습니다. 자세한 내용은 Amazon SageMaker AI 모델 맞춤 설정 문서를 참조하십시오.
Amazon Elastic Container Service (Amazon ECS)는 이제 Amazon ECS Managed Daemons에 대한 통합 배포 보기를 제공하여, 배포가 얼마나 진행되었는지, 무엇이 실패하고 있는지, 그리고 무엇이 배포를 중단시킬 수 있는지를 한 곳에서 확인할 수 있습니다. 이를 통해 Managed Daemon 배포를 한눈에 모니터링하고, 롤아웃이 진행 중이든 완료 후 발생한 상황을 검토하든 관계없이 문제를 더 빠르게 해결할 수 있으며, 여러 소스에서 배포 상태를 취합할 필요가 없어집니다. 배포 보기는 각 단계별 타임스탬프와 총 배포 시간을 포함하는 라이프사이클 타임라인을 제공하며, 배포가 중단될 경우 롤백 경로도 포함합니다. 각 용량 제공업체에 대한 진행률 표시줄은 완료된 인스턴스, 진행 중인 인스턴스, 남은 인스턴스를 추적하며, 용량 제공업체가 제거될 때 드레인되고 교체되는 인스턴스도 표시합니다. 모니터링 패널은 배포 서킷 브레이커, 배포 알람, 컨테이너 상태 확인 상태를 보여주며, 각 항목은 실시간 Amazon CloudWatch 알람 세부 정보와 배포를 중단시킬 수 있는지 여부를 표시합니다. 데몬 태스크가 실패하면, 영향을 받은 용량 제공업체는 중지 이유와 함께 태스크, 해당 로그, 그리고 롤백을 유발한 실패를 포함한 관련 문제 해결 가이드에 대한 링크를 표시합니다. 이 보기는 또한 인스턴스 수, 드레인 비율, 베이크 시간을 포함한 대상 및 소스 리비전을 표시합니다. 이 기능은 추가 비용 없이 모든 AWS 상용 리전에서 콘솔 전용 보기로 제공됩니다. Amazon ECS Managed Daemons를 시작하려면 당사 문서를 참조하십시오.
AWS는 빌더들이 아이디어를 AWS에서 실행되는 코드로 전환하는 과정을 가속화할 수 있도록 간소화된 경험을 출시했습니다. 이 새로운 서비스는 신규 프로젝트를 위해 광범위한 AWS 서비스 옵션을 구성해야 했던 이전의 복잡성을 해결합니다. 합리적인 기본값으로 자동 환경 구성을 제공하여 즉각적인 프로젝트 구현을 가능하게 함으로써 가입 절차를 간소화합니다. 사용자는 기존 Google, GitHub, Apple 또는 Amazon 자격 증명을 사용하여 가입할 수 있으며, 종종 신용카드 없이도 무료 AWS 크레딧을 받을 수 있습니다. 가입 완료 후, 단일 프롬프트가 코딩 에이전트를 AWS에 연결하여 필요한 도구를 설치하고 모범 사례를 사용하여 리소스를 배포합니다. 이메일을 통해 팀원을 초대하여 협업을 촉진하며, 자동 액세스 구성이 제공됩니다. 새로운 IAM 역할 관리자는 AWS 리소스가 다른 AWS 서비스에 자동으로 액세스할 수 있도록 합니다. 비용 관리를 위해 사용자는 프로젝트별 월별 지출 한도를 설정할 수 있으며, 월별 한도에 도달하면 프로젝트가 일시 중지됩니다. 추가 프로젝트는 고유한 구성 및 팀원과 함께 쉽게 생성할 수 있습니다. 다중 리전 지원 및 사용자 지정 거버넌스와 같은 고급 기능은 마이그레이션이나 다운타임 없이 활성화할 수 있습니다.
Amazon WorkSpaces Personal 및 Amazon WorkSpaces Core에서 이제 NVIDIA RTX PRO 4500 Blackwell Server Edition GPU와 Intel Xeon 6 프로세서를 기반으로 하는 Graphics G7 번들을 지원합니다. Graphics G7은 이전 세대 Graphics G6 번들에 비해 그래픽 집약적인 워크로드에서 최대 2.1배 더 나은 성능을 제공합니다. 8 vCPU, 32GB 메모리, 1개의 GPU부터 48 vCPU, 192GB 메모리, 2개의 GPU까지 네 가지 번들 크기를 사용할 수 있습니다.Graphics G7을 사용하면 CAD/CAM, 3D 렌더링, 과학적 시각화, 비디오 편집 및 AI 기반 설계 워크플로우와 같은 까다로운 전문 애플리케이션을 더 높은 충실도와 프레임 속도로 실행할 수 있습니다. 각 GPU는 32GB의 GDDR7 메모리를 제공하여 더 크고 복잡한 3D 장면 및 모델을 처리할 수 있습니다. Graphics G7 번들은 라이선스 직접 구매(BYOL)를 포함한 Windows와 함께 사용할 수 있으며 AlwaysOn 및 AutoStop 실행 모드를 모두 지원합니다.Graphics G7 번들은 US East (N. Virginia), US East (Ohio), US West (Oregon)에서 WorkSpaces Personal 및 WorkSpaces Core 모두에 대해 사용할 수 있습니다. 가용성이 확장됨에 따라 추가 리전이 추가될 예정입니다.시작하려면 Amazon WorkSpaces 콘솔에서 워크스페이스를 생성할 때 Graphics G7 번들을 선택하거나 Workspaces Core 파트너 솔루션을 통해 선택하십시오. 사용 가능한 인스턴스 유형에 대한 자세한 내용은 WorkSpaces Personal 인스턴스 패밀리를 참조하십시오. G7 GPU 기능에 대한 자세한 내용은 EC2 G7 인스턴스 유형 페이지를 방문하십시오. 가격 정보는 Amazon WorkSpaces Personal 가격 또는 Core 번들 가격을 참조하십시오.
AWS Elemental MediaTailor가 이제 수익 창출 기능에 대한 두 가지 추가 수명 주기 후크를 지원합니다: 광고 결정 서버(ADS) 응답 후, 매니페스트 삽입 전. MediaTailor는 라이브 및 온디맨드 스트림에 광고를 개인화하고 삽입하는 비디오 서비스입니다. 수익 창출 기능은 광고 개인화 재생 세션의 정의된 지점에서 고객 정의 로직을 실행하여 MediaTailor와 ADS 간의 미들웨어 계층의 필요성을 제거합니다.ADS 응답 후 후크는 MediaTailor가 ADS 응답을 구문 분석하고 모든 Video Ad Serving Template(VAST) 래퍼를 해결한 후, 광고가 선택 및 트랜스코딩되기 전에 실행됩니다. 고객은 이를 사용하여 기본 ADS가 광고 브레이크가 수용할 수 있는 것보다 적은 수요를 반환할 때 보조 광고 소스를 호출하거나, 콘텐츠 또는 브랜드 정책에서 허용하지 않는 광고를 제거하거나, 자체 마케팅 시스템의 하우스 광고 또는 프로모션을 추가하는 데 사용합니다. 매니페스트 삽입 전 후크는 MediaTailor가 시청자에게 광고 팟을 반환하기 직전 마지막 지점에서 실행되며, 모든 새롭게 개인화된 광고 브레이크를 단일 호출로 받습니다. 고객은 이를 재생될 내용에 대한 최종 확인으로 사용하며, 다른 방법으로 브레이크를 채울 수 없을 때 개인화된 슬레이트를 삽입하는 것을 포함합니다. MediaTailor 콘솔의 사전 구축된 레시피는 고객에게 각 사용 사례에 대한 시작점을 제공합니다. 두 후크 모두 실패 개방형입니다: 타임아웃, 표현식 오류 또는 리소스 제한 시 MediaTailor는 함수 출력을 폐기하고 기본 광고 삽입을 계속하므로 시청자 재생에 영향을 미치지 않습니다.새로운 후크는 AWS Elemental MediaTailor를 사용할 수 있는 모든 AWS 리전에서 사용할 수 있습니다. 자세한 내용은 AWS Elemental MediaTailor 사용자 가이드의 수익 창출 기능 및 MediaTailor 가격 페이지를 참조하십시오. 시작하려면 AWS Elemental MediaTailor 콘솔에 로그인하십시오.
Amazon Elastic Container Service (Amazon ECS)가 이제 Amazon EC2 시작 유형에서 실행되는 작업에 대해 Amazon S3 Files를 지원하여, 고객이 컨테이너화된 애플리케이션을 Amazon S3의 데이터에 공유 파일 시스템으로 직접 연결할 수 있게 되었습니다. 이번 출시를 통해 EC2 인스턴스에서 ECS 워크로드를 실행하는 고객은 표준 파일 시스템 의미론을 사용하여 S3 데이터를 작업할 수 있으므로, 파일 기반 애플리케이션, AI 에이전트 및 데이터 처리 워크로드는 코드 변경 없이, 파일을 복제하거나 스테이징할 필요 없이 S3 데이터에서 실행됩니다. S3 Files 지원은 이전에 AWS Fargate 및 ECS 관리형 인스턴스의 ECS 작업에 대해 제공되었으며, 이제 EC2 시작 유형으로 확장되어 고객은 세 가지 ECS 시작 유형 모두에서 S3 Files에 일관되게 액세스할 수 있습니다. Amazon EFS를 기반으로 구축된 Amazon S3 Files는 AWS 컴퓨팅 리소스를 Amazon S3의 데이터에 직접 연결하는 공유 파일 시스템을 제공하며, 데이터가 S3를 벗어나지 않고도 완전한 파일 시스템 의미론과 낮은 지연 시간 성능을 제공합니다. S3 Files는 S3 버킷의 새 데이터 및 기존 데이터와 함께 작동하며, 마이그레이션이 필요하지 않습니다. 고객은 Amazon ECS 작업에서 Amazon S3 Files 볼륨을 마운트하여 애플리케이션 코드 변경 없이, 데이터를 복사하거나 스테이징할 필요 없이 표준 파일 시스템 작업을 사용하여 S3 버킷의 데이터를 읽고 쓸 수 있습니다. Amazon S3 Files 지원은 모든 AWS 상용 리전 및 AWS GovCloud (US) 리전에서 사용할 수 있습니다. 자세한 내용은 문서를 참조하십시오.
오늘 AWS Billing and Cost Management (BCM)은 BCM 대시보드에서 Detected Anomalies 위젯에 대한 지원을 발표합니다. 이제 비용 및 사용량, 예산, 비용 효율성, Savings Plans 및 Reserved Instance 적용 범위 및 활용률에 대한 보고서와 함께 비용 이상 징후를 검토할 수 있습니다. 이를 통해 단일 맞춤형 대시보드에서 지출, 약정 및 비용 이상 징후에 대한 통합된 보기를 제공합니다.Detected Anomalies 위젯은 감지된 이상 징후의 수와 월별 누계 지출 대비 총 비용 영향을 표시하여 각 이상 징후의 규모에 대한 즉각적인 맥락을 제공합니다. 각 이상 징후에 대해 비용 영향, 근본 원인 및 기간을 검토할 수 있습니다. 30일, 60일 또는 90일의 조회 기간을 선택하고 심각도, 서비스, 계정 및 리전별로 필터링하여 각 대시보드가 해당 계정에 가장 관련성이 높은 이상 징후를 표시하도록 할 수 있습니다. BCM 대시보드에 하나 이상의 Detected Anomalies 위젯을 추가함으로써 재무 팀과 클라우드 관리자는 기존 비용 관리 워크플로에서 이상 징후를 모니터링할 수 있습니다.이 위젯은 AWS Cost Anomaly Detection 콘솔에 직접 연결되어 이상 징후를 쉽게 조사하고 평가를 기록할 수 있습니다. 대시보드 내보내기와 완벽하게 통합되며 예약된 이메일 보고서에 포함되거나 오프라인 분석을 위해 CSV 또는 PDF로 다운로드할 수 있습니다. 또한 계정 간 대시보드 공유에도 포함됩니다.BCM 대시보드용 Detected Anomalies 위젯은 모든 상용 AWS 리전에서 추가 비용 없이 사용할 수 있습니다. 자세한 내용은 사용자 가이드를 참조하십시오.
AWS Billing Conductor에서 이제 사용자 지정 사용량 계층을 정의하여 원하는 사용량 볼륨별로 요금을 구성하는 것을 포함하여 AWS 서비스에 대한 사용자 지정 요금 가격을 정의할 수 있습니다.자회사, 계열사 또는 최종 고객과의 상업 계약을 모델링하기 위해 AWS Billing Conductor를 사용하는 고객 및 파트너는 이제 사전 양식 청구 데이터에 협상된 가격을 더 쉽게 반영할 수 있습니다. SKU 범위 가격 책정 규칙을 사용하여 사전 정의된 AWS 사용량 계층에 연결된 공개 온디맨드 요금에서 마크업 또는 마크다운하는 대신 사용자 지정 요금을 입력하고 사용량 계층 임계값을 구성할 수 있습니다.가격 책정 규칙에 정확한 요금 및 계층 구분을 직접 구성함으로써 상업 계약을 모델링하기 위해 공개 온디맨드 가격 책정에 대한 백분율 기반 마크업 또는 마크다운을 더 이상 계산할 필요가 없습니다. 이를 통해 사전 양식 청구 구성에 대한 정밀한 제어를 할 수 있습니다.SKU 범위 가격 책정 규칙을 통한 사용자 지정 요금 및 사용자 지정 사용량 계층 구성은 Sinnet에서 운영하는 Amazon Web Services China (Beijing) Region 및 NWCD에서 운영하는 Amazon Web Services China (Ningxia) Region을 제외한 모든 상업 AWS 리전에서 사용할 수 있습니다. 자세히 알아보려면 AWS Billing Conductor 제품 페이지를 방문하거나 사용자 가이드를 검토하십시오.
AWS Step Functions가 이제 AWS Lambda MicroVMs, AWS Lambda Core 등을 시작으로, 새로운 AWS 서비스 및 기능 출시 후 몇 주 내에 자동으로 AWS SDK 통합을 추가합니다. 이제 업데이트를 기다릴 필요 없이 워크플로에서 최신 AWS 서비스를 오케스트레이션할 수 있습니다.AWS Step Functions는 220개 이상의 AWS 서비스를 오케스트레이션할 수 있는 시각적 워크플로 서비스로, 고객이 대규모 분산 애플리케이션을 구축하도록 돕습니다. AWS Lambda Core 및 AWS Lambda MicroVMs 서비스 통합을 통해 사용자 지정 조정 코드를 작성하지 않고도 에이전트 워크플로를 오케스트레이션할 수 있습니다. Step Functions를 사용하여 Lambda MicroVMs를 시작할 수 있으며, 이는 환경 시작에 실패할 경우 내장된 재시도 기능과 함께 각 에이전트 작업에 대한 격리되고 안전한 실행 환경을 제공합니다. Step Functions Parallel 또는 Map 상태를 사용하여 여러 작업을 동시에 실행하고 작업이 완료되면 환경을 자동으로 종료할 수 있습니다. Lambda Core를 사용하여 해당 MicroVM 환경이 동일한 워크플로 내에서 내부 데이터베이스 또는 API에 안전하게 액세스하는 데 필요한 프라이빗 네트워킹을 구성할 수 있습니다.이번 확장에는 AWS Partner Central Revenue Measurement, AWS Resilience Hub V2, AWS Support Authorization 및 Amazon SageMaker Job Runtime도 포함됩니다. 앞으로 새로운 AWS 서비스는 출시 후 몇 주 내에 추가 구성이나 작업 없이 Step Functions 통합으로 자동 표시됩니다. 업데이트가 지속적으로 이루어지므로 새로운 AWS SDK 서비스 통합 업데이트를 강조하는 "What's New" 게시물은 더 이상 게시하지 않습니다.이러한 개선 사항은 현재 AWS Step Functions를 사용할 수 있는 모든 AWS 리전에서 일반적으로 사용할 수 있습니다. 특정 서비스 및 API 작업은 대상 서비스가 AWS 리전에서 사용 가능한지에 따라 달라집니다. AWS Step Functions SDK 통합에 대해 자세히 알아보려면 개발자 가이드를 방문하거나, 지원되는 서비스 전체 목록은 AWS SDK 서비스 통합 및 통합 릴리스 기록을 참조하십시오.
오늘 Amazon SageMaker AI는 학습 및 처리 작업에 대한 인스턴스 우선순위 목록을 발표하여 워크로드에 대한 컴퓨팅 용량을 더 쉽고 빠르게 찾을 수 있도록 합니다. 많은 AI 학습, 미세 조정 및 데이터 처리 워크로드는 여러 인스턴스 유형 또는 크기 중 어느 것이든 비교적 잘 실행됩니다. 그러나 이전에는 작업 제출 시 하나의 인스턴스 유형만 지정하고 SageMaker가 해당 특정 인스턴스를 작업에 찾을 때까지 기다려야 했습니다. 피크 기간 동안 수요가 많은 GPU의 경우 대기 시간이 예측 불가능할 수 있으므로 고객은 복잡한 재시도 로직을 구축하거나 사용 가능한 첫 번째 옵션을 찾기 위해 다른 인스턴스 유형으로 여러 작업을 동시에 제출해야 하는 경우가 있었습니다. 이제 작업에서 허용하는 인스턴스 유형의 우선순위 목록을 제공하기만 하면 SageMaker가 우선순위에서 첫 번째로 사용 가능한 구성에서 자동으로 작업을 실행합니다. 이 솔루션을 사용하면 학습 또는 처리 작업이 더 빨리 시작될 가능성이 높습니다.이 기능을 사용하려면 학습 또는 처리 작업을 제출할 때 인스턴스 유형 및 개수 우선순위를 우선순위 순서대로 지정합니다. 예를 들어 목록에는 ml.g6.48xlarge 인스턴스 두 개 또는 ml.g5.48xlarge 인스턴스 네 개에 대한 우선순위가 포함될 수 있습니다. SageMaker는 목록을 검토하고 용량을 사용할 수 있는 첫 번째 구성에서 작업을 시작합니다. 또한 동일한 작업 제출 내에서 온디맨드 소스 또는 예약된 SageMaker Flexible Training Plans에서 용량 소싱을 구성할 수도 있습니다. 이 기능은 수요가 많은 기간 동안 작업에 대한 컴퓨팅을 확보하는 프로세스를 단순화하고, 그렇지 않으면 수행해야 할 차별화되지 않은 수동 재시도를 줄이며, 모두 이미 사용 중인 SageMaker 학습 및 처리 작업 API 내에서 이루어집니다.SageMaker 학습 및 처리 작업에 대한 인스턴스 우선순위 목록은 오늘날 SageMaker CLIs, API, SDK 및 콘솔 UI를 통해 SageMaker를 사용할 수 있는 모든 AWS 리전에서 사용할 수 있습니다. 자세한 내용은 설명서 또는 출시 블로그를 참조하십시오.
AWS CloudTrail은 보안 감사, 규정 준수 및 운영 문제 해결을 위해 AWS 계정 전반의 API 활동을 기록하는 서비스로, 이제 Amazon Q Console과 통합되어 자연어를 사용하여 AWS 계정 활동을 조사할 수 있습니다. 쿼리를 작성하거나 로그 파일을 수동으로 구문 분석하지 않고도 CloudTrail 구성에 대한 질문을 Amazon Q Console에 하고, 보안 조사를 위해 기록된 이벤트를 쿼리하며, 운영 문제를 해결할 수 있습니다.이 통합을 통해 Amazon Q Console에 CloudTrail 트레일이 올바르게 구성되었는지 확인하고, 로깅 범위의 격차를 식별하며, 추적 중인 데이터 이벤트 소스를 확인하도록 요청할 수 있습니다. 특정 IAM 역할에 누가 액세스했는지, VPC 구성에 어떤 변경 사항이 있었는지 또는 지난주에 무단 액세스 시도가 있었는지 질문하여 보안 문제를 조사할 수 있습니다. 운영 문제 해결을 위해 특정 리소스를 생성하거나 삭제한 사람을 찾고, 오류를 생성하는 API 호출을 식별하며, 특정 IP 주소의 활동을 추적하거나 청구액이 급증한 이유를 파악하도록 Amazon Q Console에 요청할 수 있습니다. Amazon Q Console은 귀하를 대신하여 CloudTrail 트레일, 관련 CloudWatch 로그 그룹 및 이벤트 데이터 저장소를 쿼리하여 일반적인 설명서가 아닌 실제 계정 활동에 기반한 답변을 제공합니다.이 통합은 Amazon Q Console이 지원되는 모든 AWS 상용 리전에서 사용할 수 있습니다. 시작하려면 AWS Management Console에서 Amazon Q를 열고 CloudTrail 구성 또는 계정 활동에 대한 질문을 하십시오. 자세한 내용은 AWS CloudTrail 설명서를 참조하십시오.
Amazon Connect Customer는 이제 상담원이 선호하는 근무 시간을 입찰할 수 있게 하여 업무 일정에 대한 통제력을 높였습니다. 스케줄러는 먼저 CSV 파일을 업로드하거나 무작위 순위를 생성하여 상담원 순위를 설정합니다. 그런 다음 Connect Customer는 예측된 수요와 근무 시간 프로필을 사용하여 가능한 근무 시간을 생성하고 상담원에게 순위를 매기도록 제시합니다. 예를 들어, 월요일-금요일 오전 6시-오후 10시 근무 시간 프로필에 9시간 근무 시간이 있는 경우, 필수 근무 시간은 오전 6시-오후 3시(상담원 500명), 오전 9시-오후 6시(상담원 800명), 오후 1시-오후 10시(상담원 600명)입니다. 입찰 기간이 마감되면 Connect Customer는 상담원 순위를 동점자 처리 기준으로 사용하면서 각 상담원을 가장 높은 순위의 가능한 근무 시간에 자동으로 할당합니다. 근무 시간 입찰은 상담원에게 자신의 일정을 조정할 수 있는 구조화된 방법을 제공하는 동시에 스케줄러가 수동 근무 시간 할당에 소비하는 시간을 줄여 상담원 만족도와 일정 효율성을 모두 향상시킵니다.이 기능은 Amazon Connect Customer 상담원 스케줄링을 사용할 수 있는 모든 AWS 리전에서 사용할 수 있습니다. Amazon Connect Customer 상담원 스케줄링에 대해 자세히 알아보려면 여기를 클릭하십시오.
Amazon SageMaker HyperPod가 이제 모델 캐싱을 지원합니다. 이는 모델 가중치와 컨테이너 이미지를 클러스터 노드에 미리 로드하여 파드가 몇 분이 아닌 몇 초 만에 시작되도록 하는 추론 최적화 기능입니다.챗봇, 에이전트 파이프라인, RAG, 문서 분석과 같은 워크로드를 위해 LLM 추론을 대규모로 실행할 때 콜드 스타트는 실제 병목 현상입니다. 배포 및 스케일 아웃 이벤트는 컨테이너 이미지와 모델 가중치를 다운로드하는 데 대부분의 시간을 소비합니다. 모델 크기가 커질수록 이 문제는 더욱 심각해지며, 대규모 모델은 트래픽을 처리하기 전에 수십 분이 걸립니다.모델 캐싱은 두 가지 독립적인 기능을 통해 이 문제를 해결합니다. 가중치 캐시는 모델 가중치를 로컬 NVMe에 저장하여 파드가 네트워크를 통해 S3 또는 FSx에서 가져오는 대신 빠른 로컬 스토리지에서 읽도록 합니다. 이미지 캐시는 컨테이너 이미지를 미리 가져와 파드가 ECR 다운로드를 완전히 건너뛰도록 합니다. 파드가 따뜻한 캐시가 없는 노드에 배치되면 자동으로 원본 소스에서 가져오는 것으로 대체되므로 파드가 멈추거나 실패할 위험이 없습니다.57GB에서 145GB에 이르는 모델에 대한 벤치마크 결과, 약 60% 더 빠른 스케일 아웃을 보여주며, 이미지 캐시는 2분 이상의 이미지 가져오기 시간을 단축합니다(97% 감소). 모델 크기가 커질수록 이점은 커지지만 원본 소스 경로의 안정성은 유지됩니다.고객은 InferenceEndpointConfig 또는 JumpStartModel 리소스에 modelCacheConfig 섹션을 추가하여 HyperPod Inference Operator를 통해 모델 캐싱을 활성화할 수 있습니다. 이 연산자는 수동 설정이나 정리 없이 전체 수명 주기를 처리합니다.모델 캐싱은 이제 SageMaker HyperPod를 사용할 수 있는 모든 리전에서 일반적으로 사용할 수 있습니다. 시작하려면 SageMaker HyperPod 설명서를 참조하십시오.