Apache Spark、Delta Lake、MLflow... ノート

Apache Spark、Delta Lake、MLflow を使用したスケーラブルな MLOps およびフィーチャーエンジニアリングのための Azure Databricks

生のデータはモデルコンペティションで勝つものではありません。特徴量です。そして、生のデータが複数のソースにまたがる数十億行にも及ぶ場合、ノートブックでpandasを実行してそれで終わりにする余裕はありません。このチュートリアルでは、Azure Databricksで本番グレードの特徴量エンジニアリングパイプラインを構築する方法を説明します。