주에서 분으로: 데이터 파이프라인의 새로운 에이전트 시대
Google Cloud는 Google Cloud NEXT ’26에서 소개된 새로운 Orchestration Pipelines 프레임워크를 통해 데이터 파이프라인 오케스트레이션을 민주화하고 있습니다. 이 프레임워크는 무료 오픈 소스 데이터 엔지니어링 도구 모음인 Data Agent Kit을 통해 접근 가능합니다. 이 키트는 인기 있는 IDE 및 CLI에 통합되어 Data Engineering 탭과 Airflow DAG를 위한 agentic skill을 제공합니다. 이를 통해 데이터 전문가들은 자연어를 사용하여 프로덕션 등급의 Airflow DAG를 작성, 배포 및 문제 해결할 수 있습니다. 이 프레임워크는 선언적 YAML DSL을 사용하여 오케스트레이션 로직과 컴퓨팅 실행을 분리함으로써 MLOps를 간소화합니다. 이를 통해 모든 데이터 페르소나는 복잡한 Python Airflow 보일러플레이트를 우회할 수 있습니다. 실용적인 예시는 선제적 공급망 관리를 위한 MLOps 아키텍처 구축을 보여줍니다. 이 아키텍처는 BigQuery, Managed Service for Apache Spark, Gemini Enterprise Agent Platform 및 dbt를 사용하여 운송 시간을 예측합니다. Data Agent Kit은 자연어 프롬프트에서 PySpark 스크립트와 선언적 YAML 파이프라인을 생성합니다. 세 가지 개별 파이프라인이 시연됩니다. 즉, 훈련 엔진, 일일 추론 파이프라인, 자동 평가 및 분기 파이프라인입니다. 배포는 CI/CD를 통해 자동화되며, Data Agent Kit은 필요한 워크플로를 생성합니다. Day-two 운영을 위해 이 키트는 IDE 내에서 실시간 모니터링 및 agentic 문제 해결을 제공합니다. 실패를 진단하고 근본 원인을 식별하며 문제에 대한 인라인 수정을 제안합니다. Orchestration Pipelines와 Data Agent Kit은 MLOps 아키텍처를 구축하고 유지 관리하는 시간과 복잡성을 크게 줄여줍니다.