查询引擎
Apache Spark
登录后可跨设备保存划线和私人笔记登录
要本地或在 Amazon EMR、Google Cloud Dataproc、Azure HDInsight、Databricks 等服务上读取 Apache XTable™ (Incubating) 同步生成的目标表(无论采用何种表格式),除了相应表格式本身所需的依赖外,你无需额外的 jar 包或配置。
请参阅各项目的具体文档,了解在创建 Spark 会话或提交 Spark 作业时需要传入的必需配置。
- targetFormat: HUDI
- targetFormat: DELTA
- targetFormat: ICEBERG
- 对于 Hudi,请参阅 Spark 指南页面
Hudi 目标格式的限制:
要验证 Hudi targetFormat 表的结果,你需要确保使用的是 Hudi 0.14.0 版本,详见此处。
python
hudi_options = {
"hoodie.metadata.enable": "true",
"hoodie.datasource.write.hive_style_partitioning": "true",
}
df = spark.read.format("hudi").options(**hudi_options).load("/path/to/source/data")评论
登录后参与评论
正在加载评论…
KnowForge