存储配置
Oracle Cloud Infrastructure
登录后可跨设备保存划线和私人笔记登录
Oracle Object Storage 系统在所有区域的所有存储桶上提供强一致性操作。OCI Object Storage 提供了 HDFS Connector,你的应用程序需要使用它来访问数据。
OCI 配置
要在 OCI Object Storage 上使用 HUDI,你必须:
- 使用 API 密钥配置 HDFS Connector
- 在你的应用程序中引入 HDFS Connector 及其依赖项
- 构造 OCI HDFS URI
配置 HDFS Connector
OCI HDFS Connector 需要来自 API 密钥的配置信息,以便进行身份验证并选择正确的区域。首先生成 API 密钥。
如果你使用的是 Hadoop,请将以下内容添加到你的 core-site.xml 中:
<property>
<name>fs.oci.client.auth.tenantId</name>
<value>ocid1.tenancy.oc1..[tenant]</value>
<description>The OCID of your OCI tenancy</description>
</property>
<property>
<name>fs.oci.client.auth.userId</name>
<value>ocid1.user.oc1..[user]</value>
<description>The OCID of your OCI user</description>
</property>
<property>
<name>fs.oci.client.auth.fingerprint</name>
<value>XX::XX</value>
<description>Your 32-digit hexidecimal public key fingerprint</description>
</property>
<property>
<name>fs.oci.client.auth.pemfilepath</name>
<value>/path/to/file</value>
<description>Local path to your private key file</description>
</property>
<property>
<name>fs.oci.client.auth.hostname</name>
<value>https://objectstorage.[region].oraclecloud.com</value>
<description>HTTPS endpoint of your regional object store</description>
</property>如果你在 Hadoop 之外使用 Spark,请在 Spark Session 中设置以下配置:
| 键 | 说明 |
|---|---|
| spark.hadoop.fs.oci.client.auth.tenantId | 你的 OCI 租户的 OCID |
| spark.hadoop.fs.oci.client.auth.userId | 你的 OCI 用户的 OCID |
| spark.hadoop.fs.oci.client.auth.fingerprint | 你的 32 位十六进制公钥指纹 |
| spark.hadoop.fs.oci.client.pemfilepath | 私钥文件的本地路径 |
| spark.hadoop.fs.oci.client.hostname | 你所在区域对象存储的 HTTPS 端点 |
如果你在 OCI Data Flow 中运行 Spark,则无需配置这些设置,对象存储访问已为你配置好。
依赖库
你需要将以下依赖库添加到应用中。下面列出的版本仅供参考,这些依赖库会持续更新,你应当在 Maven Central 上查看是否有更新的版本。
- com.oracle.oci.sdk2.18.0
- com.oracle.oci.sdk3.3.0.5
构造 OCI HDFS URI
OCI HDFS URI 的形式如下:
oci://<bucket>@<namespace>/<path>
HDFS 连接器允许你像使用 Hadoop 上的 HDFS 位置一样处理这些位置。你的租户拥有唯一的对象存储命名空间(namespace)。如果不确定自己的命名空间,可以通过安装 OCI CLI 并运行 oci os ns get 来查找。
评论
登录后参与评论
正在加载评论…
KnowForge