AWS Big Data Blog 中文 关注 这个网站来自 AWS,是 Amazon 的云计算平台。它在“博客”中收录了文章和见解,这些基本上是当前计算、人工智能、机器学习、数据分析等领域趋势的文章集合。该特定博客还包含了 AWS 上的大数据信息。访问者可以从 AWS 客户、初创企业、科学研究人员、教育机构和其他专家的社区中找到见解。 AWS Big Data Blog aws.amazon.com RSS aws.amazon.com AWS Big Data Blog 中文 RSS thenote.app
推出 AWS Glue 6.0,实现更快速且更具成本效益的数据集成 现已推出 AWS Glue 6.0,将 AWS Glue 定价降低 30%,新增 AWS 优化的 Apache Spark 4.1 构建版本,并引入适用于企业级采用的 Apache Iceberg V3 功能。本文介绍关键功能与性能优势,并提供代码示例以助您快速上手。 Introducing AWS Glue 6.0 for faster and more cost-effective data integration aws.amazon.com +1
将 AWS Glue 作业升级至 Glue 6.0,并采用 AI 驱动的 Spark 升级 通过生成式 AI 升级 Apache Spark 的 AWS Glue 5.1 至 6.0 版 PySpark ETL 作业。升级分析可自动检测不兼容项、应用修复措施,并通过数据质量检查验证结果。 Upgrade AWS Glue jobs to Glue 6.0 with AI-powered Spark upgrades aws.amazon.com +1
使用 Amazon S3 Tables 在 Amazon Redshift 中实现长期系统表保留 Amazon Redshift 系统表与 Amazon S3 Tables 的集成可自动将系统表日志以 Apache Iceberg 格式交付至 Amazon S3 Tables。您无需自定义 ETL 流程或消耗集群资源,即可将数据保留超过 7 天的限制,以满足合规性、审计及跨仓库可观测性需求。 Long-term system tables retention in Amazon Redshift with Amazon S3 Tables aws.amazon.com +1
使用自定义标签和 AWS CUR 跟踪 SageMaker Unified Studio 项目的成本 学习如何通过自定义标签跟踪 Amazon SageMaker Unified Studio 项目的成本。此无服务器解决方案通过自定义项目标签丰富 AWS 成本和使用报告(CUR)数据,并在 Amazon QuickSight 仪表板中按成本中心、团队或环境可视化成本。 Track SageMaker Unified Studio project costs with custom tags and AWS CUR aws.amazon.com +1
使用 SAML 和条件策略安全地访问 SageMaker Unified Studio 了解如何通过将其与外部 SAML 身份提供商(如 Okta)集成来安全配置 Amazon SageMaker Unified Studio。本文展示了如何应用条件访问策略,以强制实施设备合规性、基于 IP 的限制以及针对您的数据和 AI 工作负载的多因素认证。 Secure SageMaker Unified Studio access with SAML and conditional policies aws.amazon.com +1
使用优化引擎在 Amazon OpenSearch Service 中通过 SQL 和 PPL 查询原始日志数据 学习如何使用 PPL 和 SQL 直接在 Amazon OpenSearch Service 中的原始日志和跟踪数据上运行快速分析查询。跟随一次单一的事件调查,逐条执行查询,观察新优化的引擎如何直接从原始 span 中回答每个问题。 Querying raw log data using SQL and PPL with the optimized engine in Amazon OpenSearch Service aws.amazon.com +1
更前沿的洞察,更快的决策:talabat 在 AWS 和 Google Cloud 上的近实时分析 中东和北非领先的日常应用 talabat 构建了一个混合多云数据湖仓,在 Amazon S3 Tables 上保留一份 Apache Iceberg 格式的流式数据副本,同时让 Google BigQuery 就地查询,从而消除了跨云数据重复和模式同步开销。 Fresher insights, faster decisions: talabat’s near-real-time analytics across AWS and Google Cloud aws.amazon.com +1
在 AWS 上利用实时流数据驱动智能体 AI 代理型 AI 应用现已能够在生产环境中对流式数据进行观察、推理并执行操作。本文介绍了三种架构模式,它们共同构成了代理型 AI 时代的统一流式骨干:基于实时推理的流式特征工程、事件驱动的代理调用,以及实时上下文同步。 Powering agentic AI with real-time streaming data on AWS aws.amazon.com +1
亚马逊MSK简化了自定义域名的配置 使用 Amazon MSK,您现在可以通过单个配置属性为托管集群配置自定义域名,该属性在 ZooKeeper 和 KRaft 上表现完全一致。只需定义一次域名,Amazon MSK 便会将其应用于所有代理节点,从而确保在集群扩展时自定义域名持续可用。 Amazon MSK simplifies configuring custom domain names aws.amazon.com +1
Zepto 如何利用 OpenSearch Service OR2 实例实现亚秒级搜索 了解印度快速增长的即时配送平台 Zepto 如何将 Amazon OpenSearch Service 迁移至 OpenSearch Optimized(OR2)实例,从而在数百个配送中心实现亚秒级商品搜索,在承载相同工作负载的同时,将索引吞吐量提升超过 100%,并节省 30% 的成本,同时将所需数据节点数量减少至原来的三分之二。 How Zepto powers sub-second search using OpenSearch Service OR2 instances aws.amazon.com +1
使用 OAuth 2.0 对 Amazon MQ for RabbitMQ 进行 IAM 身份验证 使用 OAuth 2.0 的 IAM 身份验证允许客户端使用其现有的 IAM 身份连接到 Amazon MQ for RabbitMQ,而无需使用静态的代理本地凭据。本文介绍了使用 AWS IAM 作为 OAuth 2.0 提供程序所需的关键 rabbitmq.conf 配置,并展示了一个多租户示例,其中通过 IAM 角色和代理作用域别名强制实施 vhost 隔离。 IAM authentication with OAuth 2.0 for Amazon MQ for RabbitMQ aws.amazon.com +1
用于 Amazon MQ for RabbitMQ 的 OAuth 2.0、LDAP 和 HTTP 身份验证 Amazon MQ for RabbitMQ 支持 OAuth 2.0、LDAP 和基于 HTTP 的身份验证后端,使您能够将代理连接到已使用的身份基础设施。本文介绍每种方法的工作原理,并帮助您确定哪种方案最适合您的使用场景。 OAuth 2.0, LDAP, and HTTP auth for Amazon MQ for RabbitMQ aws.amazon.com +1
Amazon MQ for RabbitMQ 的相互 TLS 和 SSL 证书认证 了解如何在 Amazon MQ for RabbitMQ 中添加基于证书的标识验证。本文解释了通过 EXTERNAL SASL 机制实现无密码登录的 SSL 证书认证,以及用于双向证书验证的相互 TLS(mTLS),突出了关键的 rabbitmq.conf 配置项,并帮助您根据合规要求选择合适的方法。 Mutual TLS and SSL certificate authentication for Amazon MQ for RabbitMQ aws.amazon.com +1
Amazon MQ for RabbitMQ 的认证和授权选项 Amazon MQ for RabbitMQ 支持多种身份验证和授权方法,因此您可以将代理连接到已使用的身份基础设施。本文介绍了可用的选项,并帮助您为特定用例选择最合适的方法。 Authentication and authorization options for Amazon MQ for RabbitMQ aws.amazon.com +1
NaranjaX 通过 AWS RAM 和 Route 53,从其身份提供商(IDP)管理分布在多个账户中的多个 Amazon MSK Serverless 集群。 了解 NaranjaX 如何利用 AWS Resource Access Manager 和 Amazon Route 53 Resolver,构建跨账户、多对多连接模型以支持 Amazon MSK Serverless,从而使超过 40 个 AWS 账户中的团队能够从集中式的内部开发者平台采用事件驱动架构。 NaranjaX manages multiple Amazon MSK Serverless clusters in different accounts from their IDP using AWS RAM and Route 53 aws.amazon.com +1
Autodesk 如何利用迁移助手和智能路由将 23 亿份文档迁移至 Amazon OpenSearch Service 本文介绍了 Autodesk 如何将单个索引的 Elasticsearch 7.1.1 域重构为四个多索引的 Amazon OpenSearch Service 域,使用 Amazon OpenSearch Service 迁移助手以及一个路由层,该路由层将每个查询定向到持有该查询所需数据的分片。 How Autodesk migrated 2.3 billion documents to Amazon OpenSearch Service using Migration Assistant and intelligent routing aws.amazon.com +1
在 Amazon OpenSearch Service 中使用归因图追踪级联决策失败 当多个 AI 代理协作做出错误决策时,标准日志无法指出是哪个代理导致了该错误。本文展示如何在 Amazon OpenSearch Service 和 Amazon Bedrock 上构建归因图,以衡量代理之间的影响力,并从失败的决策出发逆向追溯,从而定位根本原因。 Trace cascading decision failures with a blame graph on Amazon OpenSearch Service aws.amazon.com +1
AppFolio 如何利用 Amazon MSK Express 代理重构其数据流架构 了解 AppFolio 如何通过采用 Amazon MSK Express 代理来改造其数据流架构,将原本需要数小时的重新平衡和手动存储规划,转变为能够在工作负载隔离集群中自动扩展的平台。 How AppFolio transformed its data streaming architecture with Amazon MSK Express brokers aws.amazon.com +1
GPU 加速如何在 Amazon OpenSearch Service 上构建十亿级向量索引” 在 Amazon OpenSearch Service 和 OpenSearch Serverless 上实现 GPU 加速的向量(k-NN)索引,让您能够在数小时内构建十亿级规模的向量索引,而无需数天时间。本文深入探讨解耦的 GPU 架构、CAGRA 到 HNSW 的转换、十亿向量基准测试,以及生产环境中的运营最佳实践。 How GPU acceleration builds billion-scale vector indexes on Amazon OpenSearch Service aws.amazon.com +1
跨 100 多个 AWS 账户的集中式 CloudTrail 监控 学习如何在 Amazon OpenSearch Service 上构建集中式 AWS CloudTrail 监控解决方案,并使用 Terraform 管理整个技术栈。该方案可处理跨 100 多个账户的每日 200 GB 日志数据,提供自动化威胁检测,支持按需生成 SOC 2、PCI DSS 和 HIPAA 合规报告,并为四个团队提供隔离的访问权限。 Centralized CloudTrail monitoring across 100+ AWS accounts aws.amazon.com +1
Epic Games 团队如何为《堡垒之夜》分析调优 Amazon OpenSearch 服务 了解 Epic Games 团队如何优化其 Amazon OpenSearch Service 集群以支持《堡垒之夜》分析。本文详细介绍了 Epic Games 与 AWS 合作,通过调整实例规格、重新平衡分片、优化索引映射以及升级引擎和 Graviton 版本,从而降低查询延迟、提升吞吐量并减少成本。 How a team at Epic Games tuned Amazon OpenSearch Service for Fortnite analytics aws.amazon.com +1
用于 Amazon Kinesis Data Streams 的 AI 驱动成本优化代理 学习如何部署一个基于 Amazon Bedrock 的开源 AI 驱动代理,该代理可自动分析您账户中的每个 Amazon Kinesis Data Streams 流,对比三种容量模式的成本,并推荐最优模式,帮助您按自定义计划节省超过 60% 的流式处理成本。 AI-powered cost optimization agent for Amazon Kinesis Data Streams aws.amazon.com +1
Amazon OpenSearch Service 扩展了版本生命周期支持时间线 2024 年 11 月,我们宣布了 Amazon OpenSearch Service 上旧版 Elasticsearch 和 OpenSearch 的 Standard 支持和 Extended 支持截止日期。我们将这些版本的安全补丁和操作系统补丁覆盖范围延长 12 个月,至 2027 年 11 月 7 日,并公布了更多 Elasticsearch 和 OpenSearch 版本的支持日期。 Amazon OpenSearch Service extends version lifecycle support timelines aws.amazon.com +1
使用 SageMaker Unified Studio 和 AWS Lake Formation 实现企业湖仓的细粒度访问控制扩展 随着企业数据湖仓库在业务领域和区域间扩展至数千张表,细粒度访问控制已成为治理瓶颈。本文介绍如何结合 AWS IAM Identity Center、AWS Lake Formation 基于标签的访问控制以及 Amazon SageMaker Unified Studio 中的可信身份传播,实现自动化、可审计且遵循最小权限原则的访问控制。 Scaling fine-grained access control for enterprise lakehouse using SageMaker Unified Studio and AWS Lake Formation aws.amazon.com +1
使用 Amazon MWAA 和 Airflow 3.0 实现事件驱动的管道编排 在多个 AWS 账户中运行 Apache Airflow 的数据工程团队,此前无法在独立的 Amazon MWAA 环境之间协调工作流。借助 Amazon MWAA 上的 Airflow 3.0,您可以利用基于资产的调度(asset-based scheduling)和资产监听器(Asset Watchers)结合 Amazon SQS,构建事件驱动的跨账户编排,以近乎实时的触发机制替代传统的轮询方式。 Event-driven pipeline orchestration with Amazon MWAA and Airflow 3.0 aws.amazon.com +1
Delivery Hero 的搜索转型:向集成径向搜索的 OpenSearch Service 迁移之旅 在本文中,我们将介绍 Delivery Hero 如何将语义搜索基础设施迁移至 Amazon OpenSearch Service,探讨其为何选择径向搜索(radial search)而非传统的 k 近邻(k-NN)搜索,并阐述使该系统实现快速、成本效益高且具备灵活实验能力的各项优化措施。 Transforming search at Delivery Hero: A migration journey to OpenSearch Service with radial search aws.amazon.com +1
亚马逊红移多区域灾难恢复 在本文中,我们将梳理跨区域灾难恢复的核心概念,介绍评估需求的框架,随后深入探讨 Amazon Redshift 的三种主要灾难恢复策略:主动 - 被动、主动 - 主动以及混合模式。针对每种策略,我们将涵盖架构、权衡因素、实施指南和成本考量,以便您为工作负载做出明智的决策。 Amazon Redshift multi-Region disaster recovery aws.amazon.com +1
利用 Amazon MSK 的 Agent Skills 简化 Apache Kafka 集群的操作与迁移 Amazon MSK 代理技能为运营和迁移 Apache Kafka 集群提供了具备代理类型意识的专业知识。在本篇博客中,我们将介绍如何安装管理 Amazon MSK 和迁移至 MSK 的技能,并演示它们如何诊断性能问题、基于成本明细对集群进行容量规划,以及规划从自托管 Kafka 迁移至 Amazon MSK。 Streamline Apache Kafka cluster operations and migrations with Agent Skills for Amazon MSK aws.amazon.com +1
介绍用于 Amazon EMR on EKS 的 Apache Spark 故障排查代理 在本文中,我们将展示如何在 EKS 上配置 Amazon EMR 代理,并逐步排查失败的作业运行问题。我们将从 Amazon EMR 控制台和一款支持模型上下文协议(MCP)的 AI 助手两个角度演示该工作流程。MCP 是一项开放标准,用于将 AI 助手与外部工具和数据进行连接。 Introducing Apache Spark troubleshooting agent for Amazon EMR on EKS aws.amazon.com +1
将 Amazon Redshift DC2 集群升级到新的 Amazon Redshift RG 将您的 Amazon Redshift DC2 集群升级至基于 AWS Graviton 的 RG 实例,可解锁托管存储、数据共享、零 ETL 以及集成数据湖引擎。本文介绍新功能、节点映射指南(用于 sizing)、可用升级方法,以及如何借助 Amazon Redshift Test Drive 验证目标配置。 Upgrade Amazon Redshift DC2 clusters to the new Amazon Redshift RG aws.amazon.com +1
使用 Amazon MSK Express 代理将 Apache Kafka 数据交付至 Apache Iceberg 流式表 宣布为 Amazon MSK Express 代理提供向 Apache Iceberg 流式表的交付功能,这是一种完全托管的能力,可连续将您的 Kafka 流式数据物化为可在 Amazon S3 Tables 上查询的 Iceberg 表。无需管理任何连接器、Flink 作业或自定义消费者,也无需编写任何代码。 Deliver Apache Kafka data to streaming tables for Apache Iceberg with Amazon MSK Express brokers aws.amazon.com +1
降低 EMR Spark 作业中 AWS KMS 解密 API 的成本 在 Amazon S3 中使用 Amazon EMR 和 Apache Spark 处理加密数据时,随着对象数量的增加,AWS KMS 解密 API 成本可能显著上升。本文介绍了三种在不降低加密安全性的前提下降低此类成本的技术:优化文件格式(包括 Apache Iceberg)、数据聚合,以及使用 AWS Glue 数据目录的分区索引。 Lowering AWS KMS decrypt API costs in EMR Spark jobs aws.amazon.com +1
通过更大的工作节点和针对 Shuffle 优化的磁盘,加速 EMR Serverless 上的 Spark 处理 Amazon EMR Serverless 现已支持 32 vCPU/244 GB 的 Worker 配置,以满足最苛刻的 Spark 作业需求。在 126 个 TPC-DS 和 TPC-H 查询中,更大的 Worker 实现了平均 29% 的查询执行速度提升和 29% 的成本降低,其中在 Shuffle 密集型、多表连接查询上的收益最为显著。 Accelerate Spark on EMR Serverless with larger workers and shuffle-optimized disks aws.amazon.com +1
使用 AWS Spark 升级代理自动化 Spark Scala 迁移至 4.x 版本 学习如何使用 AWS Spark 升级代理在 Amazon EMR 上自动化 Apache Spark 3.x 至 4.0 的 Scala 迁移。本文涵盖 API 弃用、行为变更、构建配置更新以及作业验证,将原本需要数月的手动工作缩短至数小时。 Automate Spark Scala migration to 4.x with AWS Spark Upgrade Agent aws.amazon.com +1
使用 Amazon OpenSearch 构建合同合规性搜索系统 在本篇博客中,您将构建一个合同合规性搜索系统,该系统结合了语义搜索与语义高亮功能,并部署于 Amazon OpenSearch Service。您将通过两个 AWS CloudFormation 堆栈部署该解决方案,使用合成合同文档进行测试,并观察单个查询如何同时定位正确的合同及其内部相关条款。 Build a contract compliance search system with Amazon OpenSearch aws.amazon.com +1
在 AWS 上构建可扩展的个性化推荐系统:从批处理到实时 了解 Everyday Essentials 团队如何在 AWS 上构建可扩展的个性化推荐平台:该平台采用以批处理为主的架构,利用 Amazon MWAA 进行编排、Amazon SageMaker 进行训练和向量搜索,以及 AWS Lake Formation 实现受管的数据访问,随后通过 Amazon MemoryDB 将其扩展至实时场景。 Building a scalable personalized recommendation system on AWS: From batch to real-time aws.amazon.com +1
使用 AWS SDK 自动化创建 AWS Glue 数据目录视图,以支持数据网格用例 本文介绍如何使用 Catalog 对象 API 的 CreateTable() 方法,通过跨账户 IAM 定义者角色以编程方式创建 Athena 和 Spark 方言,并展示如何为仅使用 Spark 方言创建的视图以编程方式添加 Athena 方言。 Automate creating AWS Glue Data Catalog views with AWS SDK for data mesh use case aws.amazon.com +1
使用 Amazon OpenSearch Service 数据流实现高效的日志管理 在本文中,我们将展示如何在 Amazon OpenSearch Service 中实现带有索引状态管理(ISM)的数据流。这种方法可自动管理您的时序数据生命周期,并优化性能与成本。数据流将传入数据分发到多个底层索引,有助于减少单索引瓶颈,而 ISM 策略可自动执行滚动、保留和存储分层,以协助管理成本。 Efficient log management with Amazon OpenSearch Service data streams aws.amazon.com +1
Alight Solutions 如何利用 Amazon OpenSearch Service 实现 55% 的成本节约 在本文中,我们分享了 Alight Solutions 如何从自托管 Elasticsearch 迁移至 Amazon OpenSearch Service。此次迁移实现了 55% 的成本降低,每年减少了约 2,000 小时的操作负担,并使 Alight 能够使用此前无法优先部署的高级可观测性功能。 How Alight Solutions achieved 55% cost savings with Amazon OpenSearch Service aws.amazon.com +1
使用 Amazon SageMaker Unified Studio 跨账户管理 Amazon Redshift 数据仓库数据 在本文中,我们展示如何使用 Amazon SageMaker Unified Studio 基于数据网格原则在 Amazon Redshift 中实现跨账户数据共享。我们演示了如何构建可扩展的数据网格架构,以支持在 AWS 账户之间进行安全、可审计的数据共享,同时降低运维负担。 Govern Amazon Redshift Data Warehouses Data Across Accounts using Amazon SageMaker Unified Studio aws.amazon.com +1
从 Apache Solr 迁移到 Amazon OpenSearch Serverless 在本文中,您将了解为何现在是利用 OpenSearch Serverless 的运营简便性和原生 AI 能力的最佳时机,并从 Solr 迁移过来。 Migrate from Apache Solr to Amazon OpenSearch Serverless aws.amazon.com +1
基于 Apache Celeborn 的 Amazon EMR 高性能远程 Shuffle 服务 在本文中,我们展示了 Apache Celeborn 如何解决 Amazon EMR on EKS 和 Amazon EMR on EC2 之间的权衡问题,在提升作业可靠性的同时,进一步释放额外的成本节约潜力。 High-performance Remote Shuffle Service on Amazon EMR with Apache Celeborn aws.amazon.com +1
使用 AWS Glue 数据目录中的 Iceberg REST 端点,从 Salesforce Data 360 实现零拷贝访问 Amazon S3 上的 Apache Iceberg 表 在本文中,我们展示了 AWS 和 Salesforce 客户如何通过零拷贝文件联邦(zero-copy file federation)从 Salesforce Data 360 访问其在 AWS 上的企业数据湖。 Zero Copy access to Apache Iceberg tables in Amazon S3 from Salesforce Data 360 using the Iceberg REST endpoint from AWS Glue Data Catalog aws.amazon.com +1
补丁完美:自动化 Amazon Redshift 补丁测试 在本文中,我们展示了一套自动化测试套件,可在任何补丁更新、重启或修改后自动验证您的 Amazon Redshift 集群。该套件使用标准驱动程序针对真实工作负载模式进行测试,从而在补丁落地与补丁投入生产之间提供经过验证的关口。 Patch perfect: Automating Amazon Redshift patch testing aws.amazon.com +1
AWS 上用于智能体 AI 的多云数据湖屋架构,第一部分:架构与最佳实践 本文重点阐述如何在 AWS 上构建开放湖仓架构的方法,统一各提供商的元数据目录,以便 AI 代理能够访问。此外,本文还突出了架构权衡与最佳实践。 Multi-cloud lakehouse architecture on AWS for Agentic AI, Part 1: Architecture and best practices aws.amazon.com +1
Razorpay 如何利用 Amazon MSK 构建实时异常检测系统 在本文中,我们将探讨 Razorpay 的异常检测与告警平台(ADA)架构,该架构采用 Amazon Managed Streaming for Apache Kafka(Amazon MSK)及其他 AWS 服务。根据 Razorpay 的数据,该系统可在 30 秒内检测交易异常,支持数千个商户级别的告警,并将监控成本降低了约 80%。该平台每月处理超过 5 亿笔交易,可用性高达 99.99%。 How Razorpay Built Real-Time Anomaly Detection with Amazon MSK aws.amazon.com +1
使用 Amazon OpenSearch Service 的可写热存储降低运营成本并简化操作 在本文中,我展示可写温存储如何消除昂贵的迁移周期。您可将基础设施成本降低高达 48%,并将历史数据的更新时间从小时级缩短至秒级。我将通过实际的成本对比和性能基准测试,帮助您决定何时使用可写温存储而非 UltraWarm。 Cut costs and simplify operations with writable warm storage in Amazon OpenSearch Service aws.amazon.com +1
在 AWS Glue 交互式会话中引入 Apache Spark Connect 支持 Apache Spark Connect 弥合了这两个世界之间的差距:您可以在本地使用 Python 进行开发,但在 AWS Glue 上针对实际数据执行任务。如今,AWS Glue 交互式会话已原生支持 Spark Connect。您可以从任何支持 PySpark remote() API 的环境进行连接,包括 VS Code、PyCharm、Amazon SageMaker Unified Studio 笔记本以及独立的 Python 应用程序。您无需安装专用内核或管理集群基础设施。 Introducing Apache Spark Connect support in AWS Glue interactive sessions aws.amazon.com +1
How BigBasket 利用基于 Iceberg 的湖仓架构在 AWS 上驱动印度闪电般的杂货配送服务 在本文中,我们展示了 BigBasket 如何在 AWS 上实施湖仓一体架构,包括其架构决策、实施方法,以及类似现代化改造可带来的可量化业务成果。无论您正面临可扩展性挑战,还是计划自行实施湖仓一体架构,本蓝图均提供了可供贵组织适配的可行见解。 How BigBasket uses the Iceberg based lakehouse architecture on AWS to power lightning-fast grocery delivery across India aws.amazon.com +1
使用 AWS Glue 和 Apache Iceberg 物化视图实现大规模日志分析加速 在本文中,您将学习如何使用 Amazon CloudWatch Logs、AWS Lambda、Amazon Data Firehose、AWS Glue 以及 Apache Iceberg 物化表构建适用于生产环境的应用程序日志管道。随后,您将利用物化视图来加速查询性能。该解决方案可帮助您在大规模日志数据上实现更快的查询响应时间,而无需管理持续的数据湖刷新。 Accelerating log analytics at scale with AWS Glue and Apache Iceberg materialized views aws.amazon.com +1