Trino SQL 引擎连接器
Hudi
登录后可跨设备保存划线和私人笔记登录
Apache Hudi(读作 "hoodie")是下一代流式数据湖平台。Apache Hudi 将核心的数据仓库和数据库功能直接带入数据湖。
提示
本文假设你已经掌握了 Hudi 的基础知识与操作。关于本文中未涉及的 Hudi 相关知识,可参阅其官方文档。
通过 Kyuubi,我们可以对 Hudi 执行 SQL 查询,这比直接使用 Trino 操作 Hudi 更加方便、易懂且易于扩展。
Hudi 集成
要启用 Kyuubi Trino SQL 引擎与 Hudi 的集成,你需要:
- 配置 Trino 扩展和 catalog 配置项
配置
Catalog 通过在 $TRINO_SERVER_HOME/etc/catalog 目录中创建 catalog 属性文件来注册。例如,我们可以创建一个 $TRINO_SERVER_HOME/etc/catalog/hudi.properties 文件,内容如下,将 Hudi 连接器挂载为一个 Hudi catalog:
connector.name=hudi
hive.metastore.uri=thrift://example.net:9083注意:需要将上面的 $TRINO\_SERVER\_HOME 替换为你的 Trino 服务器主目录路径,例如 /opt/trino-server-406。
更多配置属性请参阅 Trino 文档中的 Hudi 连接器。
::: tip 提示
Trino 398 及以上版本推荐使用 Hudi 连接器。在 398 及以上版本中,你无需安装任何依赖。
:::
Hudi 操作
Trino 支持全局可用的查询语句和读操作语句。这些语句可以在 Trino SQL 支持中找到。目前,Trino 无法向 Hudi 表写入数据。常见的场景是使用 Spark/Flink 写入数据,再使用 Trino 读取数据。你可以使用 Kyuubi Trino SQL 引擎,通过如下 SELECT 语句查询该表。
以 Query Data 为例,
USE example.example_schema;
SELECT symbol, max(ts)
FROM stock_ticks_cow
GROUP BY symbol
HAVING symbol = 'GOOG';评论
登录后参与评论
正在加载评论…
KnowForge