查询引擎

Apache Spark

师成师成· 更新于 2026-09-28· 阅读 2 分钟· 0 次阅读

登录后可跨设备保存划线和私人笔记登录

要本地或在 Amazon EMR、Google Cloud Dataproc、Azure HDInsight、Databricks 等服务上读取 Apache XTable™ (Incubating) 同步生成的目标表(无论采用何种表格式),除了相应表格式本身所需的依赖外,你无需额外的 jar 包或配置。

请参阅各项目的具体文档,了解在创建 Spark 会话或提交 Spark 作业时需要传入的必需配置。

  • targetFormat: HUDI
  • targetFormat: DELTA
  • targetFormat: ICEBERG

Hudi 目标格式的限制:

要验证 Hudi targetFormat 表的结果,你需要确保使用的是 Hudi 0.14.0 版本,详见此处。

python


hudi_options = {
    "hoodie.metadata.enable": "true",
    "hoodie.datasource.write.hive_style_partitioning": "true",
}

df = spark.read.format("hudi").options(**hudi_options).load("/path/to/source/data")

评论

登录后参与评论

正在加载评论…