Integração de dados do Qlik Replicate | Qlik Cloud Ajuda
Ir para conteúdo principal Pular para conteúdo complementar

Integração de dados do Qlik Replicate

Você pode aproveitar a funcionalidade completa de Qlik Open Lakehouse sem abandonar sua infraestrutura Replicate existente. Use o assistente de integração de dados para criar um pipeline que processa dados da saída do Amazon S3 do Qlik Replicate e os armazena como tabelas Iceberg usando Qlik Open Lakehouse.

Govnote-not-inSem suporte no Qlik Cloud Government.

Pré-requisitos

Antes de iniciar o assistente de dados de integração, certifique-se de ter cumprido os seguintes pré-requisitos.

Pré-requisitos do Qlik Replicate

Configurar uma tarefa do Qlik Replicate para mover dados para um compartimento do Amazon S3 (via o endpoint de destino do Amazon S3).

Qlik Replicate pré-requisitos da tarefa

  • Habilite apenas as opções de replicação de Carregamento total e/ou Armazenar alterações (necessário para manter os dados atualizados).

  • Na guia Store Changes Settings das configurações da tarefa:

    • Configure as Configurações da Tabela da seguinte forma:

      • Sufixo: __ct

      • Prefixo da coluna de cabeçalho: header__

      • Opções de DDL: Aplicar à tabela de alterações

      • Na ATUALIZAÇÃO: Armazenar após imagem apenas

    • Deixe Alterar Particionamento de Dados desativado (o padrão).

  • Na guia Metadados > Tabelas de Controle das configurações da tarefa, certifique-se de que as tabelas de controle Aplicar Exceções e Histórico de DDL estejam selecionadas.

Para obter mais informações sobre essas configurações, consulte a ajuda sobre as configurações de tarefas do Qlik Replicate (somente em inglês).

Qlik Replicate Amazon S3 pré-requisitos do endpoint de destino

Na guia Geral :

  • Na seção Arquivos de Metadados, habilite a opção Criar arquivos de metadados na pasta de destino (Replicate novembro de 2025 ou anterior) ou Criar um arquivo de metadados para cada arquivo de dados (Replicate maio de 2026 ou posterior). Isso criará arquivos com uma .dfm extensão no bucket S3.
  • Na seção Atributos do Arquivo, certifique-se de que:
    • CSV é o Formato selecionado (o padrão)
    • Compactar arquivos usando está definido como Nenhum (o padrão)
    • Ambas as opções de Adicionar cabeçalho de metadados estão habilitadas (Com nomes de colunas e Com tipos de dados)
  • Ao configurar as definições de armazenamento do Amazon S3, se o seu compartimento contiver ficheiros não-Replicate, é recomendado especificar uma Pasta de Destino. Fazer isso tornará mais fácil localizar a saída necessária ao integrar os dados com Qlik Open Lakehouse.

Para obter mais informações sobre essas configurações, consulte a ajuda do endpoint de destino do Amazon S3 (somente em inglês).

Qlik Open LakehousePré-requisitos

Um conector de AWS S3 Data Stream configurado para acessar a saída do Replicate Amazon S3.

Para obter instruções, consulte Fluxo de dados do AWS S3.

Como a Replicate organiza dados no S3

A familiaridade com a estrutura que o Qlik Replicate usa para organizar dados no S3 facilitará a localização desses arquivos no Navegador de diretórios, descrito em Criar uma tarefa de integração abaixo.

  • s3://bucket-name/target-path/schema.table/

    Contém arquivos de carga completos e arquivos de metadados DFM em formato sequencial, como no exemplo a seguir:

    • LOAD00000001.csv

    • LOAD00000001.dfm

    • LOAD00000002.csv

    • LOAD00000002.dfm

  • s3://bucket-name/target-path/schema.table__ct/

    Contém arquivos de Captura de Dados de Alteração e arquivos de metadados DFM no formato de carimbo de data/hora, como no exemplo a seguir:

    • 20250121-083015000.csv

    • 20250121-083015000.dfm

    • 20250121-091522000.csv

    • 20250121-091522000.dfm

Criar uma tarefa de integração

Siga estas etapas para configurar uma tarefa de integração para dados Replicate:

  1. Inicie o assistente de integração da seguinte forma:

    • Novo projeto: Clique em Integrar dados no centro da janela do projeto.

    • Projeto existente: No canto superior direito do seu Qlik Open Lakehouse projeto, clique em Criar novo > Integrar dados para iniciar o assistente de integração.

  2. Insira um nome de tarefa e uma descrição.
  3. Selecione Qlik Replicate nas opções de Origem de dados. Em seguida, clique em Próximo.
  4. Selecione o conector Fluxo de Dados AWS S3 que você configurou anteriormente. Em seguida, clique em Próximo.
  5. No painel Navegador de diretórios à esquerda, selecione o diretório raiz que contém a saída do Replicate.

    Nota de dicaSe você não especificou uma pasta de destino nas configurações do endpoint de destino do Replicate Amazon S3 (conforme recomendado nos pré-requisitos acima), seu compartimento pode conter muitos arquivos não relacionados. Neste caso, se você souber o caminho exato, poderá colá-lo diretamente no Replicate caminho do diretório raiz campo.
  6. Clique em Carregar para detectar as tabelas disponíveis. Todas as tabelas disponíveis serão exibidas na lista Tabelas selecionadas para registrar.
  7. Na região Selecionar fonte de dados para descobrir tabelas à direita, as seguintes configurações estão disponíveis:
    • Incluir todas as tabelas atuais: Ative para aterrissar todas as tabelas existentes. Quando esta opção está desativada, você precisa selecionar tabelas individuais.
    • Excluir os arquivos de origem após a ingestão: Ativar para remover permanentemente os arquivos do compartimento S3 do Replicate depois que forem processados com sucesso.

      Depois que os arquivos S3 forem excluídos, todos os pipelines conectados que usam os mesmos arquivos S3 como fonte ficarão inativos e incapazes de funcionar. Você deve, portanto, habilitar esta opção somente se tiver certeza de que os arquivos não são necessários para nenhum outro processo de pipeline.

  8. Clique em Próximo.
  9. Na etapa Tipo de Conteúdo, o formato do arquivo (CSV) é detectado automaticamente a partir dos seus dados do Replicate. As seguintes opções também estão disponíveis:
    • Armazenamento de Dados Históricos (Tipo 2): Ative se precisar manter versões históricas dos registros e um arquivo das alterações.
    • Verificar se os eventos foram carregados corretamente: Você pode selecionar um conjunto de dados para verificar se ele contém os dados corretos.
  10. Clique em Próximo.
  11. Revise a configuração da tarefa e clique em Criar para criar a tarefa de integração.
  12. Clique em Preparar para catalogar a tarefa de dados e prepará-la para execução.

    Você pode acompanhar o progresso da preparação no bloco da tarefa. Após a conclusão, Preparar: Sucesso deve ser exibido.

  13. Quando estiver pronto para iniciar a integração de dados, clique em Executar.

O que acontece a seguir

Uma vez ativado, a tarefa de integração:

  1. Começa a monitorar seu compartimento S3 Replicate para alterações de dados
  2. Detecta arquivos de Carregamento total e CDC (Change Data Capture) do Replicate
  3. Processa os arquivos e cria tabelas do Iceberg em Qlik Open Lakehouse
  4. Continua a monitorar novos dados
  5. Se ativado, exclui automaticamente os arquivos de origem após a ingestão bem-sucedida

Configurações de tarefas

Para alterar as configurações da tarefa, abra a tarefa Onboarding_Qlik_Replicate (nome padrão) e clique no botão Settings da barra de ferramentas.

O diálogo Configurações: <task name> é aberto.

Guia Geral

Estas opções são descritas na Etapa 7 de Criar uma tarefa de aterrisagem acima.

  • Incluir automaticamente todas as tabelas atuais e futuras

  • Excluir os arquivos de origem após a ingestão

Guia Tempo de execução

Alterar o Cluster do Lakehouse

Considerações e limitações

Considerações e limitações gerais

  • Operações de Carregamento Total e Recarregamento podem apresentar um atraso no processamento antes que os dados apareçam nas tabelas Iceberg. O sistema aguarda até 15 minutos após a conclusão do Carregamento Total para garantir que os arquivos estejam completos. Como resultado, a execução de carregamentos totais no Replicate (programados ou manuais) com menos de 15 minutos de intervalo não é suportada.
  • Tabelas Replicate vazias (tabelas sem arquivos de dados) não são detectadas ou registradas pelo sistema.
  • Se você habilitar Excluir os arquivos de origem após a ingestão, a tarefa de aterrisagem não poderá ser recarregada. Para carregar dados, você deve regenerá-los no Replicate.
  • Do Qlik Replicate, as tabelas já estão carregadas. (somente em inglês)A opção de execução avançada Iniciar processamento de alterações a partir de (somente em inglês) não tem suporte. Quando o tipo 2 (dados históricos) estiver ativado, usar esta opção irá corromper a tabela de histórico.
  • Evolução do esquema não é compatível

CDC vs Pipeline de Replicate

Em um pipeline regular que ingere de fontes CDC, a Dados atualizados até métrica sempre indica a Atualização atual dos dados (por exemplo, 1 minuto atrás). Isso ocorre porque o pipeline tem acesso direto ao log de transações do banco de dados, o que fornece conhecimento em tempo real de cada evento de INSERT/UPDATE/DELETE. No entanto, em um pipeline que ingere dados do Replicate, a métrica Dados atualizados em não indica a atualização atual dos dados, e pode, de fato, dar a falsa impressão de que os dados estão desatualizados (por exemplo, 8 horas atrás). Isso ocorre porque o Replicate pipeline não tem acesso direto ao log de transações. Em vez disso, Replicate grava arquivos em um compartimento S3, e a pipeline verifica o carimbo de data/hora de criação do arquivo para determinar a Atualização dos dados. Então, se não houve novas alterações no banco de dados de origem por um tempo, Replicate não criará um novo arquivo e o Dados atualizados para carimbo de data/hora ficará antigo (dando a impressão equivocada de que os dados estão obsoletos).

Esta página ajudou?

Se você encontrar algum problema com esta página ou seu conteúdo – um erro de digitação, uma etapa ausente ou um erro técnico – avise-nos!