DZone.com Feed на русском
Подписаться
Azure Databricks для масштабируемых MLOps и разработки признаков с Apache Spark, Delta Lake и MLflow
Сырые данные не выигрывают соревнования моделей. Признаки — да. И когда ваши сырые данные насчитывают десятки миллиардов строк, расположенных в нескольких источниках, вы не можете позволить себе запускать pandas в блокноте и считать, что дело сделано.В этом руководстве я расскажу, как построить конвейер инженерии признаков производственного уровня на Azure Databricks, используя: