概述
你好!本概览将对 Apache Hudi 作高层次的总结,并引导你了解更多内容以便上手。
什么是 Apache Hudi
Apache Hudi(读作 "hoodie")开创了「事务性数据湖」的概念,如今更为人熟知的说法是数据湖仓(data lakehouse)架构。如今,Hudi 已发展成为一个开放的数据湖仓平台,拥有专为增量数据管道的高性能写入以及借助全面的表优化实现快速查询性能而打造的开放表格式。
Hudi 将核心数据库功能直接带入数据湖——包括表、事务、高效的更新/删除、高级索引、数据接入服务、数据分层/压实优化以及并发控制,同时让你的数据保持为开放的文件格式。Apache Hudi 不仅非常适合流式工作负载,还允许你构建高效的增量批处理管道。Apache Hudi 可以轻松用于任何云存储平台。Hudi 先进的性能优化让分析查询/管道在包括 Apache Spark、Flink、Presto、Trino、Hive 等在内的各类主流查询引擎上运行得更快。
阅读文档以了解更多用例说明,并查看谁在使用 Hudi,了解包括 Uber、Amazon、字节跳动、Robinhood 等在内的一些全球最庞大的数据湖如何利用 Hudi 转型其生产环境数据湖。
Hudi-rs 是 Apache Hudi 的原生 Rust 实现,同时也提供了 Python 绑定。它拓展了 Apache Hudi 在非 JVM 生态系统中多种用例场景下的应用。
需要了解的核心概念
如果你是 Apache Hudi 的新手,熟悉以下几个核心概念十分重要:
- Hudi 时间线 – Hudi 如何管理事务及其他表服务
- Hudi 文件布局 - 文件在存储上的组织方式
- Hudi 表类型 –
COPY_ON_WRITE和MERGE_ON_READ - Hudi 查询类型 – 快照查询、增量查询、读优化查询
更多内容请参阅文档中的「设计与概念」章节。
浏览近期的博客文章,其中深入探讨了特定主题或用例。
快速上手
有时最快的学习方式就是动手实践。试试以下快速入门资源,几分钟即可开始运行:
- Spark 快速入门指南 – 如果你主要使用 Apache Spark
- Flink 快速入门指南 – 如果你主要使用 Apache Flink
- Python/Rust 快速入门指南(Hudi-rs) - 如果你主要使用 Python 或 Rust
- 非结构化数据快速入门指南 – 存储向量(
VECTOR)和原始字节(BLOB),并使用hudi_vector_search执行相似性搜索
如果你想体验 Apache Hudi 与 Kafka、Spark、Hive、Presto 等组件集成的端到端演示,请试试 Docker 演示
与社区互动
Apache Hudi 以社区为中心、由社区主导,并张开双臂欢迎新成员。利用以下资源来深入了解、参与互动并获取帮助。
参与讨论
在此查看参与社区互动的所有方式。最受欢迎的两种方式包括:
- Hudi Slack 频道
- Hudi 邮件列表 - (发送任意邮件即可订阅)
参加答疑时间获取帮助
每周的答疑时间在此公布
社区例会
参加每月社区例会,学习最佳实践并了解其他人正在构建的内容。
参与贡献
Apache Hudi 欢迎你加入其中,在乐趣中为整个行业带来深远影响。请参阅我们的贡献者指南了解更多信息,也欢迎直接联系任何现任提交者进行交流。
有想法、有需求,或想反馈某个痛点,但没有时间贡献?加入 Hudi Slack 频道分享你的想法吧!
评论
登录后参与评论
KnowForge