Spark SQL 查询引擎连接器

Apache Paimon(孵化中)

qianmoQqianmoQ· 更新于 2026-09-29· 阅读 4 分钟· 0 次阅读

登录后可跨设备保存划线和私人笔记登录

Apache Paimon(Incubating)是一个流式数据湖平台,支持高速数据摄取、变更数据跟踪以及高效的实时分析。

提示

本文假定你已经掌握了 Apache Paimon (Incubating) 的基础知识和操作方法。对于本文中未提及的 Apache Paimon (Incubating) 相关知识,你可以查阅其官方文档。

通过使用 Kyuubi,我们可以对 Apache Paimon (Incubating) 执行 SQL 查询,这种方式比直接使用 Spark 操作 Apache Paimon (Incubating) 更加便捷、易于理解且易于扩展。

Apache Paimon (Incubating) 集成

要启用 Kyuubi Spark SQL 引擎与 Apache Paimon (Incubating) 的集成,你需要进行以下配置:

  • 引用 Apache Paimon (Incubating) 的依赖项
  • 设置 Spark 扩展和 Catalog 的配置项

依赖项

支持 Apache Paimon (Incubating) 的 Kyuubi Spark SQL 引擎的 classpath 由以下部分组成:

  1. kyuubi-spark-sql-engine-1.9.1_2.12.jar,随 Kyuubi 发行版部署的引擎 jar 包
  2. Spark 发行版的一份副本
  3. paimon-spark-<version>.jar(例如:paimon-spark-3.3-0.4-20230323.002035-5.jar),可在 Apache Paimon (Incubating) 支持的引擎 Spark3 页面找到

为了让 Apache Paimon (Incubating) 的包对引擎的运行时 classpath 可见,我们可以使用以下任一方法:

  1. 将 Apache Paimon (Incubating) 的包直接放入 $SPARK_HOME/jars
  2. 设置 spark.jars=/path/to/paimon-spark-<version>.jar

警告

请注意不同 Apache Paimon (Incubating) 版本与 Spark 版本之间的兼容性,具体可在 Apache Paimon (Incubating) 多引擎支持页面确认。

配置项

要启用 Apache Paimon (Incubating) 的功能,我们可以进行以下配置:

spark.sql.catalog.paimon=org.apache.paimon.spark.SparkCatalog
spark.sql.catalog.paimon.warehouse=file:/tmp/paimon

Apache Paimon(孵化中)操作

以 CREATE NAMESPACE 为例,

CREATE DATABASE paimon.default;
USE paimon.default;

以 CREATE TABLE 为例,

create table my_table (
    k int,
    v string
) tblproperties (
    'primary-key' = 'k'
);

以 SELECT 为例,

SELECT * FROM my_table;

以 INSERT 为例,

INSERT INTO my_table VALUES (1, 'Hi Again'), (3, 'Test');

评论

登录后参与评论

正在加载评论…