用于 Azure Databricks 报表的现代化 Power BI 架构选择:Power BI 存储模式的性能基准测试
Power BI 语义模型常使用 Azure Databricks,从而面临存储模式的关键选择。该决策会影响成本、安全性、开发便捷性,最重要的是报表性能。开发人员在此选择上往往依赖直觉而非实证依据。一份题为《Azure Databricks 上报表的现代 Power BI 架构选择》的新白皮书对四种存储模式进行了基准测试。这些模式包括:OneLake 上的 Direct Lake、镜像 Unity Catalog 表上的 Direct Lake、Databricks SQL 仓库上的 DirectQuery,以及结合 DirectQuery 与导入模式聚合的复合模型。研究未发现单一最佳方案,但出现了明确趋势。OneLake 上的 Direct Lake 在多种场景下表现良好,尤其适用于中小规模数据量及典型的重复性 Power BI 工作负载。对于包含数十亿行记录的极大数据集,带有聚合的复合模型证明最快且最稳定。然而,复合模型的优势仅限于由聚合表解析的查询,需与用户行为谨慎对齐。这些发现尚属初步;详细结果因数据量、缓存状态、筛选场景和查询类型而异。该白皮书于 2026 年 6 月/7 月发布,聚焦 Power BI 内的最终用户查询体验,应指导个别测试。