Google Cloud Blog 中文 笔记

Google Cloud Blog 中文

cloud.google.com/blog 是 Google Cloud 的官方博客。它提供了 Google Cloud 产品和服务的新闻、更新和见解,以及云计算行业中的趋势和创新。 博客上有 Google Cloud 的专家、工程师和思想领袖撰写的文章,涵盖了人工智能、机器学习、数据分析、安全等广泛的主题。文章经常包括技术教程、案例研究和最佳实践,使博客成为开发者、IT 专业人士和对 Google Cloud 感兴趣的商业领袖的宝贵资源。 博客组织良好,文章按主题、产品和行业分类。访问者可以浏览最新的文章、搜索特定的主题或订阅博客的 RSS 订阅以跟踪最新的新闻和更新。 博客的一些关键特点包括: - 关于 Google Cloud 产品和服务的深入文章,如 Google Cloud Platform、Google Cloud Storage 和 Google Cloud AI Platform - 如何使用 Google Cloud 服务的技术教程和指南 - 来自 Google Cloud 客户的案例研究和成功故事 - 对行业趋势和创新见解和分析 - Google Cloud 的合作伙伴关系和协作的新闻和更新 - 与 Google Cloud 专家和思想领袖的采访 总之,Google Cloud 博客是任何对云计算、人工智能和相关技术感兴趣的人的宝贵资源。

笔记线程

CdXz5zHNQW_9A043hK4t9.jpeg
由于人工智能发展对计算能力的日益增长需求,数据处理和 Apache Spark 管道正面临压力,导致可用性受限。Google 的 Apache Spark 托管服务通过提供灵活的虚拟机(Flexible VMs)来解决这一问题,允许集群使用可接受的机器类型排名列表。这种方法确保即使在特定机器类型的容量缺货(即需求超过可用容量)期间,管道仍能保持运行。灵活虚拟机支持多类型混合(multi-family blending),可在不同机器代际和类型之间混合节点;同时支持混合存储,能够动态适应主机类型的磁盘类型,并为所有节点类型提供全面的集群覆盖。成功实施需要仔细对首选机器类型进行排序,以在无需人工干预的情况下降低缺货风险。一个示例分层策略展示了如何为生产管道优先排序机器类型和存储建议。对于遗留工作负载,分层策略有助于过渡到更新、可用性更高的架构。采用现代存储(如 Hyperdisk Balanced)可结合新型实例类型实现最大可用性。关键考量包括确保所有指定机器类型拥有足够的配额,并利用计算灵活承诺使用折扣(Compute flexible Committed Use Discounts)以节省成本。不同机器代际和存储类型之间的性能可能存在差异,因此需要进行工作负载测试。此外,为改善资源可用性,还可采取以下建议:实施 AutoZone、使用更小的机器规格、部署自动伸缩、配置部分集群创建以及建立区域回退机制。通过利用灵活虚拟机和这些策略,用户可以保护 Spark 工作负载免受硬件短缺影响,并确保关键管道持续运行。
Pine59 管理着用于位置情报的大型数据管道,每小时至每季度产出各类指标。其“每日人流”(Daily Foot Traffic)指标处理每个作业高达 1400 万个位置,运行于 Google Cloud,由 Airflow 3 编排的 BigQuery 与 Managed Service for Apache Airflow 协同工作。为应对不断增长的数据量与机器学习工作负载,Pine59 对其包含数百个有向无环图(DAG)的单体仓库进行了现代化改造。此次转型显著提升了其 MLOps 能力、开发者工作流及管道执行速度。他们对生产工作负载进行了针对新 Managed Airflow(Gen 3)架构的压力测试,并立即观察到处理速度、任务调度与稳定性的提升。迁移通过集成专用的 Google Kubernetes Engine 集群用于模型推理,实现了编排与重型 ML 执行的分离,从而优化了 MLOps。Airflow 3 改进的开发者工作流与用户界面通过自定义插件(如"BigQuery Auto-linkify"和"DAG Run Configuration Search")得以充分利用,加快了调试与故障排查。兼容性垫片层(compatibility shim layer)简化了 Airflow 版本间的算子迁移。可量化的成果包括 DAG 运行的队列延迟大幅降低,任务几乎可立即启动。“每日人流”管道的完成时间减少了近 32%,从 38 分钟缩短至不到 26 分钟。Pine59 现已将所有生产工作负载运行于其 Gen 3 实例之上,为未来的数据与 AI 管道奠定了更快、更 resilient 的基础。此举使其工程团队能更专注于价值交付,而非基础设施管理。
CdXz5zHNQW_DVdc0yCXPw.jpeg
SeaVerse 是一家游戏初创公司,致力于构建一个由用户通过简单提示创建可玩 AI 体验的平台。用户可以在平台上玩游戏、与 AI 角色对话,或创建自己的交互式应用和视觉模式。该平台优先考虑快速且易于使用的创作循环,使创意能够无需传统编码即可迅速完善并发布。为实现这一目标,SeaVerse 需要能够运行动态、多租户 AI 工作负载的稳健基础设施,同时具备强大的隔离性和低延迟。为此,他们采用了 Google Kubernetes Engine(GKE)和 GKE Agent Sandbox 来满足这些需求。GKE 为 Kubernetes 操作提供了托管基础,使工程师无需维护集群。GKE Agent Sandbox 利用 Kata Containers 和 gVisor 等技术,为动态沙箱工作负载提供深度的内核级隔离。该解决方案使 SeaVerse 在保障用户体验速度的同时,实现了强大的安全边界。如今,该平台在沙箱性能方面具备更佳的可观测性,从而加快了问题排查与解决速度。这种增强的可见性将以往不透明的沙箱故障转化为透明可控的过程。此外,GKE Agent Sandbox 提供了成本灵活性,使 SeaVerse 能够更精准地将资源匹配至工作负载,并将基础设施成本降低高达 60%。该平台现已支持持久化存储,以保存不断演进的创作成果,进一步提升了创作者体验。SeaVerse 致力于让 AI 体验即时的、富有表现力且互联互通,而 GKE 与 GKE Agent Sandbox 则为未来的增长与创新奠定了坚实基础。
企业级应用常面临存储 I/O 和内存访问瓶颈,导致计算核心过度配置及软件许可成本上升。Google Cloud Compute Engine 推出的全新 M4N 机器系列旨在解决这些挑战。这些实例专为 I/O 密集型和高内存工作负载量身打造,相比竞争对手具有显著优势。M4N 为高内存实例提供了最高的每核心 IOPS 和吞吐量。此外,针对 Oracle 数据库,其总体拥有成本(TCO)可降低 20% 以上。M4N 实例具备更高的内存配比,最高可达 26:1,内存容量可扩展至 6TB。依托 Intel 第五代可扩展处理器(Xeon Scalable)以及 Google Cloud 定制的 Titanium 卸载架构,它们实现了卓越的宿主机存储性能。当与 Hyperdisk Extreme 搭配使用时,M4N 实例可实现高达 25 GiB/s 的聚合存储性能和 100 万 IOPS。这一新 offerings 补充了现有的内存优化系列,专门针对存储和网络瓶颈。M4N 适用于关键任务数据库、生成式 AI 数据层、企业级医疗保健以及实时分析。其高内存与核心比支持快速数据摄入和无阻塞备份周期。该实例还支持针对大规模向量索引的亚毫秒级相似度搜索,并提供 400 Gbps 网络带宽。此能力对于生成式 AI 中的分布式模型检索至关重要。对于企业级医疗保健和 ERP 系统,M4N 确保持续的 I/O 余量,防止在高峰使用时出现延迟尖峰。这对于 Epic Systems 和 SAP S/4HANA 等应用至关重要。实时分析和电子设计自动化(EDA)受益于高内存容量和最大存储带宽,从而能够高效加载大规模数据集。这使得高效的检查点(checkpointing)和内存内处理成为可能。M4N 实例通过实现基础设施的合理配置(right-sizing),显著优化了 Oracle 许可成本。企业可以在满足性能密度要求的同时,减少计算核心的过度配置,从而相比其他超大规模云服务商大幅降低 TCO。由于每核心拥有更多内存,数据库的更大部分可驻留在系统全局区(SGA),从而减少昂贵的 I/O 操作。早期客户体验凸显了 M4N 通过在各实例尺寸上提供高吞吐量,在转变工作负载方面发挥的作用。这一新的计算平台展现了在可扩展、高可用且高性能的企业级 Oracle 部署方面的潜力。M4N 弥合了大内存占用与极致 I/O 性能之间的差距,在不增加基础设施的前提下最小化瓶颈。这使其成为高要求数据环境的强大解决方案。M4N 实例现已在全球部分区域上线。
CdXz5zHNQW_LQt4VF9jfM.png
Orange,这家法国电信巨头,通过"FinOps 清洁日”成功应对了云支出挑战。这些活动要求工程团队暂停常规任务,协作优化云成本,通常辅以竞争性排行榜和奖励机制。经验丰富的从业者指导新人,通过实践应用促进学习,并向赞助方展示可量化的成果。这种游戏化的方法显著提升了 Orange FinOps 社区的参与度与满意度,取得了高净推荐值(Net Promoter Score)。该公司的成功植根于两项核心 FinOps 原则:云成本的共同责任,以及推动变革所需的沟通。Orange 强调,FinOps 如同云安全一样,涉及项目中的每一位利益相关者。为此,他们建立了 FinOps 实践社区,利用标准化的沟通渠道并提供可执行的更新,以确保持续创造价值。“清洁日”的概念源于对敏捷团队运营现实的深刻理解,即优化工作常因交付优先级而被搁置。通过为这些活动创造专属的、协作的且令人愉悦的时间,Orange 克服了这一常见障碍。该策略与麦肯锡的变革管理框架相一致,涵盖信念建立、正式机制、榜样示范和人才发展。游戏化与可见的成功成果有助于建立信念和树立榜样,而同行指导则促进技能提升。要将这种参与度从核心 100 人小组扩展至更广泛范围,需借助 AI 代理。这些代理可处理耗时任务,降低工程师的摩擦成本,并解决诸如意识差距、带宽限制或报告复杂性等持续存在的挑战。AI 代理的战略采用应从告知与建议能力开始,逐步过渡到在建立信任并管控运营风险后执行变更的代理。构建这些 AI 解决方案可采用不同级别的编码方式,例如无需代码的 Gemini 企业应用,或面向开发者的更高级的 Gemini 企业代理平台。归根结底,有效的云 FinOps 正从集中式报告转向由强大文化基础驱动、并由 AI 代理增强的去中心化行动。Orange 的成就凸显了培养这种以社区驱动的方法作为关键第一步的重要性。
CdXz5zHNQW_EBXVCy1fDZ.jpeg
CdXz5zHNQW_9YlgJZyPnD.jpeg
CdXz5zHNQW_R7gtUgOwNe.jpeg
CdXz5zHNQW_pnRBQ8wDjQ.png
CdXz5zHNQW_Nayr6fevb7.png
CdXz5zHNQW_qm35bZR1HG.png
CdXz5zHNQW_LAHmbJITvY.jpeg
Mandiant 正在追踪一个名为 BREEZE COMET 的以经济利益为动机的威胁行为体,该行为体此前被称为 UNC5669,自 2024 年以来一直在积极入侵巴西金融机构。该组织专门操纵支付系统和银行软件以实施欺诈性转账。BREEZE COMET 使用定制恶意软件套件,并利用被入侵的可信网站进行初始访问和命令与控制。其行动范围已扩展至利用生成式人工智能进行恶意软件开发,这可能进一步提升其操作 sophistication。该组织针对能够访问国家金融系统网络的实体,并需要 mTLS 凭据以执行经认证的欺诈性交易。BREEZE COMET 采用多种方法进行初始入侵,包括语音钓鱼和利用被入侵的政府网站。此外,它们还通过将恶意硬件设备直接接入零售网络来获取立足点。为提升权限,它们使用侦察工具和定制恶意软件,专门针对云环境和开发环境以窃取凭据和 API 密钥。BREEZE COMET 通过被劫持的服务账户和专用路由恶意软件(如 COBALTSPIN)在内部网络中横向移动。它们通过定制后门(如 LIGHTPAINT、MILDFROST、KICKPLATE 和 BOATBEAM)维持持久化,并经常禁用端点防御措施(如 Windows Defender)。在入侵金融应用程序后,BREEZE COMET 执行大规模欺诈性交易,随后清除事件日志以掩盖行踪。其不断演变的战术代表了拉丁美洲网络犯罪的一个重大转变,即从零售欺诈转向对核心金融基础设施的直接入侵。BREEZE COMET 对人工智能的使用展示了其对提升威胁行为体能力、速度和规模的影响。
CdXz5zHNQW_I0VMW99N2X.png
CdXz5zHNQW_8zKoTuzMKr.jpeg
CdXz5zHNQW_9ZsfZee1Vw.jpeg