Google Cloud Blog на русском
Подписаться
Как Yahoo оптимизирует ресурсы с помощью гибких виртуальных машин в управляемом сервисе для Apache Spark
Yahoo, глобальная медиа- и технологическая компания, столкнулась с проблемами хрупких конвейеров данных из-за фиксированных конфигураций виртуальных машин (ВМ) в своих высокоскоростных аналитических нагрузках. Когда возникали ограничения региональной мощности, подготовка кластеров в Managed Service for Apache Spark могла застопориться, задерживая критически важные конвейеры данных. Чтобы решить эту проблему, Yahoo внедрила гибкие ВМ в своих кластерах Managed Service for Apache Spark. Это позволяет системе автоматически поглощать колебания ресурсов, определяя ранжированный список приемлемых форм ВМ. Включение автоматического размещения по зонам помогает системе искать мощности во всем регионе, поддерживая выполнение конвейера без ручного вмешательства. Эта оптимизация является частью более широкого пути модернизации данных Yahoo, миграции локальных больших данных в Google Cloud. Гибкие конфигурации повышают успешность создания кластеров, выбирая из ранжированного списка, когда предпочтительный тип ВМ недоступен. Они также улучшают использование региональных ресурсов, ища мощности во всем регионе. Настройка гибких кластеров требует включения автоматического размещения по зонам и поддержания симметрии ядра и памяти между формами ВМ. Также крайне важно согласовать свойства компонентов, такие как выделение ресурсов YARN и Spark. Yahoo успешно сократила сбои при подготовке кластеров, вызванные региональными дефицитами, на 85% за счет внедрения этого подхода с гибкими ВМ. Это обеспечивает непрерывное выполнение рабочих нагрузок и предотвращает задержки последующей обработки в их массивных конвейерах данных.