从 Qlik Replicate 载入数据 | Qlik Cloud帮助
跳到主要内容 跳到补充内容

从 Qlik Replicate 载入数据

您可以利用 Qlik Open Lakehouse的全部功能,而无需放弃您现有的 Replicate 基础设施。使用数据导入向导创建管道,该管道处理来自 Qlik Replicate Amazon S3 输出的数据,并使用Qlik Open Lakehouse将其存储为 Iceberg 表。

Govnote-not-inQlik Cloud 政府 中不支持

先决条件

在启动引入数据向导之前,请确保您已满足以下先决条件。

Qlik Replicate 先决条件

设置一个 Qlik Replicate 任务,将数据移动到 Amazon S3 存储段(通过 Amazon S3 目标端点)。

Qlik Replicate 任务先决条件

  • 仅启用 满负载 和/或 存储更改(保持数据最新所需)复制选项。

  • 在任务设置的存储更改设置选项卡中:

    • 按如下方式配置更改表设置

      • 后缀: __ct

      • 标题列前缀: header__

      • DDL 选项: 应用于更改表

      • 更新内容: 仅存储之后图像

    • 保持更改数据分区禁用(默认)。

  • 在任务设置的元数据 > 控制表选项卡中,确保应用异常DDL 历史记录控制表已选中。

有关这些设置的更多信息,请参阅Qlik Replicate 任务设置帮助 (仅提供英文版本)

Qlik Replicate Amazon S3 目标端点先决条件

常规选项卡中:

  • 元数据文件部分中,启用在目标文件夹中创建元数据文件(Replicate 2025 年 11 月或更早版本)或为每个数据文件创建元数据文件选项(Replicate 2026 年 5 月或更高版本)。这将在 S3 存储段中创建带有 .dfm 扩展名的文件。
  • 文件属性 部分中,请确保:
    • CSV 是选定的 Format (默认)
    • 文件压缩方式 设置为 (默认值)
    • 两个添加元数据标题选项都已启用(带列名带数据类型
  • 配置 Amazon S3 存储设置时,如果您的存储段包含非 Replicate 文件,建议指定一个 目标文件夹。这样做将使在通过 Qlik Open Lakehouse 整合数据时更容易找到所需的输出。

有关这些设置的更多信息,请参阅 Amazon S3 目标端点帮助 (仅提供英文版本)

Qlik Open Lakehouse 先决条件

一个 AWS S3 数据流 连接器,配置为访问 Replicate Amazon S3 输出。

有关说明,请参阅:AWS S3 数据流

Replicate 如何在 S3 中组织数据

熟悉 Qlik Replicate 在 S3 中组织数据的结构,将使在 目录浏览器 中定位这些文件变得更容易,如下文 创建入职任务 中所述。

  • s3://bucket-name/target-path/schema.table/

    包含完整的加载文件和 DFM 元数据文件,按顺序格式排列,示例如下:

    • LOAD00000001.csv

    • LOAD00000001.dfm

    • LOAD00000002.csv

    • LOAD00000002.dfm

  • s3://bucket-name/target-path/schema.table__ct/

    包含变更数据捕获文件和DFM元数据文件,采用时间戳格式,如下例所示:

    • 20250121-083015000.csv

    • 20250121-083015000.dfm

    • 20250121-091522000.csv

    • 20250121-091522000.dfm

创建入职任务

按照以下步骤配置 Replicate 数据的入职任务:

  1. 启动引入向导,如下:

    • 新项目: 在项目窗口中间,单击录入数据

    • 现有项目: 在您的Qlik Open Lakehouse项目中,单击创建新项 > 引入数据以启动数据引入向导。

  2. 输入任务名称和描述。
  3. 数据源 选项中选择 Qlik Replicate。然后,单击下一步
  4. 选择您之前配置的 AWS S3 Data Stream 连接器。然后,单击下一步
  5. 在左侧的目录浏览器窗格中,选择包含 Replicate 输出的根目录。

    提示注释如果您未在 Replicate Amazon S3 目标端点设置中指定目标文件夹(如上述先决条件中所述),您的存储段可能包含许多不相关的文件。在这种情况下,如果您知道确切的路径,可以直接将其粘贴到Replicate 根目录路径字段中。
  6. 点击加载以检测可用表。任何可用的表格都将显示在 要注册的选定表格 列表中。
  7. 在右侧的选择数据源以发现表区域中,提供以下设置:
    • 包含所有当前表:开启此选项以登陆所有现有表。当此选项切换为关闭时,您需要选择单独的表格。
    • 摄取后删除源文件: 开启此选项以在文件成功处理后,从 Replicate S3 存储段永久删除文件。

      一旦 S3 文件被删除,所有使用相同 S3 文件作为源的连接管道将变为非活动状态,且无法运行。因此,您应该仅在确定这些文件不被任何其他管道进程需要时才启用此选项。

  8. 单击下一步
  9. 内容类型步骤中,文件格式 (CSV) 会从您的 Replicate 数据中自动检测。还可提供以下选项:
    • 历史数据存储(类型 2):如果需要维护记录的历史版本并保留更改的存档,请将其打开。
    • 验证事件是否已正确加载:您可以选择一个数据集来验证它是否包含正确的数据。
  10. 单击下一步
  11. 查看任务配置并点击 创建 以创建引入任务。
  12. 单击准备对数据任务进行编目并准备好执行。

    您可以在任务磁贴中跟踪准备进度。完成后,准备:成功 应显示。

  13. 当您准备好开始导入数据时,单击运行

接下来会发生什么

一旦激活,引入任务:

  1. 开始监控您的 Replicate S3 存储段以检测数据更改
  2. 从 Replicate 检测满负载和更改数据捕获 (CDC) 文件
  3. 处理文件并在 Qlik Open Lakehouse 中创建 Iceberg 表
  4. 继续监测新数据
  5. 如果启用,摄取成功后自动删除源文件

任务设置

要更改任务设置,打开Onboarding_Qlik_Replicate(默认名称)任务,然后单击设置工具栏按钮。

设置:<task name> 对话框打开。

一般选项卡

这些选项在上方创建登陆任务的第 7 步中进行了描述。

  • 自动包含所有当前和未来的表

  • 删除摄取后的源文件

运行时选项卡

更改 Lakehouse 集群

考虑事项和限制

一般考虑事项和限制

  • 全量加载和重新加载操作可能会遇到处理延迟,然后数据才会出现在 Iceberg 表中。系统在满负载完成后最多等待 15 分钟,以确保文件完整。因此,Replicate 中运行间隔时间少于 15 分钟的满负载(无论是计划的还是手动的)均不受支持。
  • 空的 Replicate 表(没有数据文件的表)未被系统检测或注册。
  • 如果启用摄取后删除源文件,则登陆任务无法重新加载。要重新加载数据,您必须在 Replicate 中重新生成它。
  • Qlik Replicate 的 表已加载。 (仅提供英文版本)不支持 从...开始处理更改 (仅提供英文版本) 高级运行选项。当类型 2(历史数据)启用时,使用此选项将损坏历史表。
  • 不支持模式演变

CDC 对比 Replicate 管道

在从 CDC 源摄取的常规管道中,数据更新至 指标始终指示数据的当前新鲜度(例如,1 分钟前)。这是因为管道可以直接访问数据库交易日志,从而实时了解每个 INSERT/UPDATE/DELETE 事件。然而,在从Replicate摄取数据的管道中,数据更新至指标不表示数据的当前新鲜度,并且可能确实会给人一种数据已过时(例如,8小时前)的错误印象。这是因为 Replicate 管道无法直接访问事务日志。相反,Replicate 将文件写入 S3 存储段,管道会检查文件的创建时间戳以确定数据新鲜度。因此,如果源数据库在一段时间内没有新的更改,Replicate 将不会创建新文件,并且 数据更新至 时间戳将会变旧 (这会给人一种数据已过期的错误印象)。

本页面有帮助吗?

如果您发现此页面或其内容有任何问题 – 打字错误、遗漏步骤或技术错误 – 请告诉我们!