Configurações para destinos de armazenamento em nuvem
Você pode alterar as configurações padrão de destino do data lake de acordo com suas necessidades.
Geral
Método de atualização
Você pode aterrissar dados em dois modos diferentes. Não é possível alterar o modo depois que a tarefa de aterrisagem do data lake estiver preparada.
-
Captura de dados de alteração (CDC) usando Tabelas de Alteração: As tarefas de aterrissagem do data lake começam com um carregamento total (durante o qual todas as tabelas selecionadas são carregadas no destino). Os dados de destino são então mantidos atualizados usando a tecnologia CDC (Captura de dados alterados).
Nota informativaNão há suporte para a CDC (Captura de dados de alterações) de operações DDL.Ao trabalhar com Gateway Data Movement, exceto ao usar uma fonte de aplicativo SaaS, as alterações são capturadas da fonte quase em tempo real. Ao trabalhar sem Gateway Data Movement ou com fontes de aplicativos SaaS, as alterações são capturadas de acordo com as configurações do agendador. Para obter mais informações, consulte Scheduling tasks.
-
Recarregar: Faz um carregamento total dos dados das tabelas de origem selecionadas na plataforma de destino e cria as tabelas de destino, se necessário. O carregamento total ocorre automaticamente quando a tarefa é iniciada, mas também pode ser realizado manualmente ou agendado para ocorrer periodicamente, se necessário.
Nota informativaEsta configuração não está disponível ao usar um conector de aplicativo SaaS.
Pasta para uso
Selecione uma das seguintes opções, de acordo com a pasta do bucket na qual você deseja que os arquivos sejam gravados:
-
Pasta padrão
O formato de pasta padrão é <nome-do-seu-projeto>/<nome-da-sua-tarefa>
-
Pasta raiz
Os arquivos serão gravados na pasta raiz do compartimento.
-
Pasta
Especifique um nome de pasta. A pasta será criada durante a tarefa de dados, caso ainda não exista.
Nota informativa O nome da pasta não pode incluir caracteres especiais (por exemplo, @, #,! e assim por diante).
Upload de dados
Atributos do arquivo
Formato
Você pode optar por criar os arquivos de destino no formato CSV, JSON ou Parquet.
Em um arquivo JSON, cada registro é representado por uma única linha, como no exemplo a seguir:
{ "book_id": 123, "title": "Alice in Wonderland", "price": 6.99, "is_hardcover": false }
{ "book_id": 456, "title": "Winnie the Pooh", "price": 6.49, "is_hardcover": true }
{ "book_id": 789, "title": "The Cat in the Hat", "price": 7.23, "is_hardcover": true }
Consulte também: Propriedades de content-type e content-encoding
- Se você escolher o formato JSON ou Parquet , os seguintes campos ficarão ocultos, pois são relevantes apenas para o formato CSV: Delimitador de campo, Delimitador de registro, Valor nulo, Caractere de citação, Caractere de escape de citação e Adicionar cabeçalho de metadados.
- Os campos a seguir são relevantes apenas para o formato Parquet: Versão Parquet, Unidade de carimbo de data/hora Parquet e Tamanho máximo de LOB (KB) Parquet.
Para obter informações sobre mapeamentos de tipos de dados ao usar o formato Parquet e limitações, consulte Mapping from Qlik Cloud data types to Parquet
Delimitador de campo
O delimitador que será usado para separar campos (colunas) nos arquivos de destino. O padrão é uma vírgula.
Exemplo de uso de vírgula como delimitador:
"mike","male"
Delimitadores podem ser caracteres padrão ou um valor hexadecimal (hex). Observe que o prefixo "0x" deve ser usado para denotar um delimitador hexadecimal (por exemplo, 0x01 = SOH0x01 = SOH). Nos campos Delimitador de campo, Delimitador de registro e Valor nulo, o delimitador pode consistir em valores hexadecimais concatenados (por exemplo, 0x0102 = SOHSTX), enquanto nos campos Caractere de citação e Caractere de escape de citação, ele só pode ser um único valor hexadecimal.
O número hexadecimal 0x00 não é compatível (ou seja, apenas 0x01-0xFF são aceitos).
Valor nulo
A string que será usada para indicar um valor nulo nos arquivos de destino.
Exemplo (em que \n é o delimitador de registro e @ é o valor nulo):
Delimitador de registro
O delimitador que será usado para separar registros (linhas) nos arquivos de destino. O padrão é uma nova linha (\n).
Exemplo:
Caractere de citação
O caractere que será usado no início e no final de uma coluna de texto. O padrão é o caractere de aspas duplas ("). Quando uma coluna que contém delimitadores de coluna é colocada entre aspas duplas, os caracteres delimitadores de coluna são interpretados como dados reais, e não como delimitadores de coluna.
Exemplo (em que @ é o caractere de aspa):
Caractere de escape de citação
O caractere usado para escapar de um caractere de aspas nos dados reais. O padrão é o caractere de aspas duplas (").
Exemplo (onde " é o caractere de aspas e \ é o caractere de escape):
Versão Parquet
Selecione qual versão usar de acordo com qual versão a plataforma de destino suporta. Observe que o Parquet versão 1.0 oferece suporte apenas à unidade de carimbo de data/hora MICRO, enquanto o Parquet versão 2.6 oferece suporte a unidades de carimbo de data/hora MICRO e NANO .
Unidade de carimbo de data/hora Parquet
Quando a versão do Parquet for definida como 2.6, escolha MICRO ou NANO. Quando a versão Parquet está definida como 1.0, apenas MICRO tem suporte.
Tamanho máximo de LOB em parquet (KB)
O tamanho máximo padrão do LOB é 64 KB e o valor máximo que você pode inserir neste campo é 10.000 KB. O tratamento de colunas LOB requer mais recursos, o que, por sua vez, afeta o desempenho. Aumente esse valor somente se você estiver replicando dados LOB maiores que 64 KB e precisar que todos os dados LOB sejam replicados para o destino.
Tamanho máximo do arquivo
O tamanho máximo que um arquivo pode atingir antes de ser fechado (e opcionalmente compactado).
O tamanho máximo que um arquivo pode atingir antes de ser fechado. Arquivos menores podem ser carregados mais rapidamente (dependendo da rede) e melhorar o desempenho quando usados em conjunto com a opção de execução paralela. No entanto, geralmente é considerado uma má prática sobrecarregar o banco de dados com arquivos pequenos.
Compactar arquivos usando
Escolha uma das opções de compactação para compactar os arquivos de destino ou NONE (o padrão) para deixá-los descompactados. Observe que as opções de compactação disponíveis são determinadas pelo formato de arquivo selecionado.
Adicionar cabeçalho de metadados
Opcionalmente, você pode adicionar uma linha de cabeçalho aos arquivos de dados. A linha do cabeçalho pode conter os nomes das colunas de origem e/ou os tipos de dados intermediários (como Qlik Talend Data Integration).
Exemplo de um arquivo de destino com uma linha de cabeçalho quando ambas as opções Com nomes de colunas e Com tipos de dados estão selecionadas:
Position:DECIMAL(38,0),Color:VARCHAR(10)
1,"BLUE"
2,"BROWN"
3,"RED"
...
Alterar processamento
Esta seção descreve configurações condicionais no Processamento de alterações.
Aplicar/armazenar alterações quando
- O tamanho do arquivo atinge: especifique o tamanho máximo dos dados de alterações a serem acumulados antes de carregar o arquivo no alvo.
- O tempo decorrido atinge: o tempo decorrido atinge x.
Arquivos de metadados
Quando a opção Criar arquivos de metadados na pasta de destino estiver selecionada, para cada arquivo de dados, um arquivo de metadados correspondente com extensão .dfm será criado na pasta de destino especificada. Os arquivos de metadados fornecem informações adicionais sobre a tarefa/dados, como o tipo de conector de origem, o nome da tabela de origem, o número de registros no arquivo de dados e assim por diante.
Para uma descrição completa do arquivo de metadados, bem como possíveis usos, consulte Descrição do arquivo de metadados
Metadados do
Colunas LOB
Incluir colunas LOB e limitar o tamanho da coluna a (KB)
Você pode optar por incluir colunas LOB na tarefa e definir o tamanho máximo do LOB. LOBs maiores que o tamanho máximo serão truncados.
Mapeamento de colunas JSON
Mapear colunas JSON de origem compatíveis para colunas JSON no destino
-
Se você estiver usando o Gateway Data Movement para acessar sua fonte de dados, é necessária a versão 2024.11.70 ou posterior.
Quando essa opção for selecionada, as colunas JSON na origem serão automaticamente mapeadas para colunas JSON no destino.
O estado e a visibilidade dessa opção são determinados pelos seguintes fatores:
-
Novas tarefas: Essa opção será ativada por padrão se tanto a fonte de dados quanto o destino aceitarem o tipo de dados JSON.
-
Tarefas existentes: Esta opção estará desabilitada por padrão, mesmo que tanto a origem quanto o destino aceitem o tipo de dados JSON. Isso acontece para preservar a compatibilidade com processos posteriores, como transformações, que esperam que os dados de destino estejam no formato STRING (que é o comportamento legado). Você pode deixar a opção desabilitada ou editar os processos downstream para que sejam compatíveis com o formato JSON e então habilitar esta opção.
-
Tarefas novas e existentes: Se apenas a fonte de dados for compatível com o tipo de dados JSON, essa opção não estará visível. Se o suporte a JSON for adicionado ao destino em um estágio posterior, a opção se tornará visível, mas permanecerá desativada. Isso acontece para preservar a compatibilidade com processos posteriores, como transformações, que esperam que os dados de destino estejam no formato STRING (que é o comportamento legado).
Tabelas de controle
Selecione qual das seguintes tabelas de controle você deseja criar na plataforma de destino:
- Status da Replicação: Fornece detalhes sobre a tarefa de aterrisagem atual, incluindo status da tarefa, quantidade de memória consumida pela tarefa, número de alterações ainda não aplicadas à plataforma de dados e a posição na fonte de dados da qual os dados estão sendo lidos no momento.
- Tabelas Suspensas: Fornece uma lista de tabelas suspensas e o motivo pelo qual foram suspensas.
- Histórico de aterrisagem: Fornece informações sobre o histórico de tarefas, incluindo o número e o volume de registros processados durante uma tarefa de aterrisagem, a latência no final de uma tarefa de CDC e muito mais.
- Alterar partições de dados: Fornece registros de partições criadas no banco de dados de destino devido a Particionamento de dados de alteração. Você pode usar essas informações para identificar dados particionados que precisam ser processados posteriormente.
Para uma descrição detalhada de cada uma das Tabelas de Controle, consulte Tabelas de controle
Carregamento total
Ajuste de desempenho
- Número máximo de tabelas para carregar em paralelo: insira o número máximo de tabelas para carregar no destino de uma só vez. O valor padrão é 5.
-
Tempo limite de consistência da transação (segundos): insira o número de segundos para aguardar o fechamento das transações abertas, antes de iniciar a operação Carregamento total. O valor padrão é 600 (10 minutos). O carregamento total começará após o valor do tempo limite ser atingido, mesmo se houver transações ainda abertas.
Nota informativaPara replicar transações que estavam abertas quando o carregamento total foi iniciado, mas que só foram confirmadas depois que o valor do tempo limite foi atingido, é necessário recarregar as tabelas de destino. - Taxa de confirmação durante carregamento total: o número máximo de eventos que podem ser transferidos juntos. O valor padrão é 10.000.
Após a conclusão do carregamento total
Criar chave primária ou exclusiva: selecione esta opção se desejar atrasar a criação da chave primária ou do índice exclusivo na plataforma de dados até que o carregamento total seja concluído.
Para carga inicial
| Usar dados em cache |
Esta opção permite usar dados em cache que foram lidos ao gerar metadados com a opção Verificação de dados completa selecionada. Isso cria menos sobrecarga em relação ao uso e cotas da API, pois os dados já são lidos da origem. Quaisquer alterações desde a verificação de dados inicial podem ser selecionadas pelo Change data capture (CDC). |
| Carregar dados da fonte |
Esta opção executa um novo carregamento da fonte de dados. Esta opção é útil se:
|
Salvar alterações
Quando você seleciona o método de atualização Change Data Capture (CDC), as atualizações nos dados de origem serão armazenadas em Tabelas de Alterações na plataforma de destino. Tabelas de Alteração capturam todas as operações de inserção, atualização e exclusão da origem, permitindo que aplicativos a jusante processem as alterações incrementalmente.
Esta seção descreve como configurar as opções da Tabela de Alterações: tratamento de DDL, armazenamento de imagem de atualização e comportamento de criação de tabela.
O processamento de alterações de armazenamento só está disponível quando o método de atualização é Captura de Dados Alterados (CDC).
Quaisquer alterações nessas configurações só terão efeito na próxima vez que um carregamento total for executado. Se você modificar essas configurações enquanto a tarefa estiver parada, você deve recarregar as tabelas de destino para aplicar as alterações.
Para obter informações detalhadas sobre tabelas de alterações, consulte Usando tabelas de alterações.
Configurações básicas
Opções de DDL
Opções DDL (Data Definition Language) determinam como as alterações de esquema da origem são tratadas nas Tabelas de Alterações.
-
Aplicar à tabela de alterações: Quando você seleciona esta opção, o sistema aplica automaticamente as alterações DDL das tabelas de origem (como adicionar ou remover colunas) às tabelas de alterações correspondentes. Use esta opção quando seus aplicativos a jusante precisarem que as Tabelas de Alterações reflitam todas as alterações de esquema da origem.
-
Ignorar: O sistema ignora todas as alterações de DDL na origem. A estrutura da Tabela de Alterações permanece inalterada. Use esta opção quando alterações DDL na origem não devem afetar as alterações armazenadas, ou quando seu sistema de destino exige esquemas de tabela fixos.
Configurações avançadas
Na atualização
As configurações de ON UPDATE controlam quais dados são capturados quando um registro de origem é atualizado.
Armazenar imagem anterior e posterior: O sistema captura tanto os dados originais (antes da atualização) quanto os dados modificados (após a atualização). Esta opção requer mais armazenamento, mas fornece informações completas de auditoria, permitindo que sistemas a jusante comparem valores antigos e novos ou realizem análises complexas de alterações. Utilize isso quando suas aplicações precisam de contexto completo de alteração.
Quando esta opção está desativada, o sistema captura apenas os dados modificados (após a atualização), não os valores originais. Esta opção reduz os requisitos de armazenamento no destino. Use isso quando você precisar apenas do estado atual dos registros alterados e não precisar de valores históricos anteriores.
Criação de tabela de alterações
Sobrescrevendo o sufixo padrão da tabela de alterações e o prefixo da coluna de cabeçalho
- Sufixo: Especifique uma string para usar como sufixo para todas as tabelas de alterações. O valor padrão é __ct. Os nomes da tabela de alterações são o nome da tabela de destino com o sufixo anexado. Assim, por exemplo, usando o valor padrão, o nome da Tabela de Alteração será HR__ct.
- Prefixo da coluna de cabeçalho: Especifique uma sequência para usar como prefixo para todas as colunas do cabeçalho da tabela de alterações. O valor padrão é header__. Por exemplo, ao usar o valor padrão, a coluna do cabeçalho stream_position será chamada header__stream_position.
Determinando como as tabelas de alterações existentes são tratadas quando o carregamento total é iniciado
Quando um carregamento total é iniciado, estas configurações determinam como as tabelas de alterações existentes no destino são tratadas. Selecione a opção que melhor se adapta às suas necessidades de recuperação e armazenamento de dados:
-
ELIMINAR e CRIAR: O sistema remove completamente a tabela de alterações existente e cria uma nova tabela vazia. Todas as alterações armazenadas anteriormente são excluídas. Use isso quando você quiser um novo começo a cada ciclo de carregamento total.
-
Excluir alterações antigas e armazenar novas alterações na Tabela de Alterações existente: O sistema remove todos os dados da Tabela de Alterações existente sem afetar sua estrutura ou metadados. Novas alterações são armazenadas na mesma tabela. Use isso quando quiser manter a estrutura da tabela, mas limpar alterações anteriores.
-
Manter alterações antigas e armazenar novas alterações na tabela de alterações existente: O sistema preserva todos os dados e metadados existentes na Tabela de Alterações. Novas alterações são adicionadas aos dados existentes. Use isso quando você precisar acumular todas as alterações ao longo de múltiplos ciclos de carregamento total.
Particionamento de dados de alteração
Em uma tarefa de aterrisagem padrão (sem Particionamento de Dados de Alteração), as alterações são aterrisadas ao destino sem nenhuma ordem específica. O particionamento de dados de alterações permite o processamento de dados de alterações de muitas tabelas de maneira consistente. Você pode definir a duração das partições, bem como o tempo base de particionamento, garantindo assim a consistência geral dos dados particionados (ou seja, nenhuma transação parcial, nenhum cabeçalho de pedido sem linhas de pedidos, e assim por diante).
As informações sobre as partições são registradas na tabela de controle attrep_cdc_partitions no banco de dados de destino. Essas informações podem ser usadas para identificar dados particionados que precisam ser processados posteriormente.
Entendendo como o particionamento funciona de acordo com o tipo de origem
-
De fontes de banco de dados:
Em uma tarefa de aterrisagem padrão (sem Particionamento de Dados de Alteração), as alterações são aterrisadas ao destino sem nenhuma ordem específica. O particionamento de dados de alterações permite o processamento de dados de alterações de muitas tabelas de maneira consistente. Você pode definir a duração das partições, bem como o tempo base de particionamento, garantindo assim a consistência geral dos dados particionados (ou seja, nenhuma transação parcial, nenhum cabeçalho de pedido sem linhas de pedidos, e assim por diante).
-
CDC Agendado: As partições são criadas quando a instância da tarefa agendada é executada. Então, por exemplo, se uma tarefa está agendada para rodar à meia-noite todos os dias, e Particionar a cada estiver definido para 4 horas, então o número de partições criadas representará o tempo em que os commits ocorreram durante as últimas 24 horas. Se commits ocorreram entre 01:00-03:00 e 16:15-18:00 e o Tempo base de particionamento estiver definido para 0:00, então duas partições serão criadas: 0:00-04:00 e 16:00-20:00.
-
CDC Contínuo: Se Particionar a cada for definido como 4 horas, Replicate cria uma partição a cada 4 horas contendo todas as confirmações que ocorreram durante esse período. Se não houver commits durante 4 horas, então nenhuma partição será criada para esse período.
-
-
De fontes de aplicativos SaaS:
Tarefas que extraem dados de origens de aplicativos SaaS são sempre agendadas. As partições são baseadas no tempo de extração de dados, pois a noção de commits não existe em fontes de aplicativos SaaS. A extração de dados começa quando a instância da tarefa agendada é executada. Então, por exemplo, se uma tarefa está agendada para rodar à meia-noite todos os dias, e Particionar a cada está definido para 4 horas, então o número de partições criadas representará a duração da extração de dados. Se a extração de dados levar menos de duas horas, uma única partição será criada. Mas se a extração levar seis horas (por exemplo), duas partições serão criadas.
Opções de particionamento
-
Particionar a cada - especifique a duração (em horas e minutos) de cada partição.
Nota informativaRecomenda-se especificar uma duração de partição superior a uma hora. Embora especificar um comprimento de partição inferior a uma hora possa melhorar a latência, a criação de muitas partições no destino também pode impactar o desempenho (de destino) (especialmente em sistemas com grandes volumes de alterações).
Se você retomar uma tarefa ANTES do momento em que a última partição foi criada, a tarefa de aterrisagem do data lake será gravada em uma partição que já foi fechada.
- Tempo base de particionamento - as partições são criadas durante um período de 24 horas, que é calculado de acordo com o "Tempo base de particionamento" especificado no banco de dados de origem no horário UTC. Por exemplo, um intervalo de partição de 8 horas com um tempo de "Tempo base de particionamento" de 02:00 criará as seguintes partições: 02:00-10:00, 10:00-18:00, 18:00-02:00, mas não necessariamente nesta ordem. Por exemplo, se uma tarefa começou às 01:00, então o período da primeira partição será 18:00-02:00. Além disso, se uma tarefa foi iniciada no meio de uma partição (por exemplo, às 04:00), seus dados de alterações serão inseridos na partição 02:00-10:00, mesmo que nenhuma alteração tenha sido capturada antes das 04:00.
Colunas de cabeçalho da tabela
Você não pode adicionar ou remover colunas enquanto uma tarefa estiver em execução. Para modificar sua seleção de colunas, interrompa a tarefa, atualize suas preferências e depois recarregue as tabelas de destino.
A Tabela de Alterações inclui colunas de metadados do sistema com um prefixo configurável. Por padrão, estas colunas são prefixadas com header__ (por exemplo, header__stream_position, header__operation). Estas colunas fornecem informações sobre cada registro de alteração, como o tipo de operação (INSERT, UPDATE, DELETE) e a ordem em que as alterações ocorreram.
Você pode excluir colunas de cabeçalho específicas da Tabela de Alterações se não precisar desses metadados. Isso reduz os requisitos de armazenamento na plataforma de destino.
Quando Particionamento de dados de alteração é ativado, o sistema adiciona automaticamente uma coluna de sistema extra chamada partition_name às Tabelas de Alteração e a seleciona automaticamente na UI. Como esta coluna é obrigatória para o rastreamento de partição, ela não pode ser excluída.
Tratamento de erros
Erros de dados
O tratamento de erros de dados é compatível apenas com o método de atualização Captura de dados alterados (CDC).
Erros de truncamento de dados
Para erros de truncamento de dados: Selecione o que você deseja que aconteça quando ocorrer um truncamento em um ou mais registros específicos. Você pode selecionar uma das seguintes situações na lista:
- Ignorar: A tarefa continua e o erro é ignorado.
- Suspender tabela: A tarefa continua, mas os dados da tabela com o registro de erro são movidos para um estado de erro e seus dados não são replicados
- Parar tarefa: A tarefa é interrompida e é necessária intervenção manual.
Outros erros de dados
Para outros erros de dados: Selecione o que você deseja que aconteça quando ocorrer um erro em um ou mais registros específicos. Você pode selecionar uma das seguintes situações na lista:
- Ignorar: A tarefa continua e o erro é ignorado.
- Suspender tabela: A tarefa continua, mas os dados da tabela com o registro de erro são movidos para um estado de erro e seus dados não são replicados
- Parar tarefa: A tarefa é interrompida e é necessária intervenção manual.
Escalar tratamento de erros de dados
Escalar o tratamento de erros quando outros erros de dados atingirem (por tabela): Marque esta caixa de seleção para escalar o tratamento de erros quando o número de erros de dados não truncados (por tabela) atingir o valor especificado. Os valores válidos são de 1 a 10.000.
Ação de escalonamento: Escolha o que deve acontecer quando o tratamento de erros for escalado. Observe que as ações disponíveis dependem da ação selecionada na lista suspensa Para outros erros de dados descrita acima.
-
Suspender tabela (padrão): A tarefa continua, mas os dados da tabela com o registro de erro são movidos para um estado de erro e seus dados não são landed.
- Parar tarefa: A tarefa é interrompida e é necessária intervenção manual.
Erros de tabela
Ao encontrar um erro de tabela: selecione uma das seguintes opções na lista suspensa:
- Suspender tabela (padrão): a tarefa continua, mas os dados da tabela com o registro de erro são movidos para um estado de erro e seus dados não são replicados
- Parar tarefa: a tarefa é interrompida e é necessária intervenção manual.
Escalar o tratamento de erros quando os erros de tabela forem atingidos (por tabela): marque esta caixa de seleção para escalar o tratamento de erros quando o número de conflitos de aplicação (por tabela) atingir o valor especificado. Os valores válidos são de 1 a 10.000.
Ação de escalonamento: a política de escalonamento para erros de tabela é definida como Parar tarefa e não pode ser alterada.
Ambiental
-
Contagem máxima de repetições: Selecione esta opção e especifique o número máximo de tentativas para repetir uma tarefa quando ocorrer um erro ambiental recuperável. Depois que a tarefa for repetida o número especificado de vezes, a tarefa será interrompida e a intervenção manual será necessária.
Para nunca repetir uma tarefa, desmarque a caixa de seleção ou especifique "0".
Para repetir uma tarefa um número infinito de vezes, especifique "-1"
-
Intervalo entre novas tentativas (segundos): Use o contador para selecionar ou digitar o número de segundos que o sistema aguarda entre as tentativas de repetir uma tarefa.
Os valores válidos são de 0 a 2.000.
-
- Aumentar o intervalo de repetição para interrupções longas: Marque esta caixa de seleção para aumentar o intervalo de novas tentativas para interrupções longas. Quando esta opção está habilitada, o intervalo entre cada nova tentativa é duplicado, até que o Intervalo máximo de repetição seja atingido (e continue tentando de acordo com o intervalo máximo especificado).
- Intervalo máximo de repetição (segundos): Use o contador para selecionar ou digitar o número de segundos de espera entre as tentativas de repetir uma tarefa quando a opção Aumentar intervalo de repetição para interrupções longas estiver ativada. Os valores válidos são de 0 a 2.000.
Ajuste do processamento de alterações
Ajuste de descarga transacional
-
Descarregar as transações em andamento para o disco se:
Os dados da transação geralmente são mantidos na memória até que sejam totalmente confirmados na origem ou no destino. No entanto, as transações maiores que a memória alocada ou que não forem confirmadas dentro do limite de tempo especificado serão descarregadas no disco.
- O tamanho total da memória para todas as transações excede (MB): o tamanho máximo que todas as transações podem ocupar na memória antes de serem descarregadas no disco. O valor padrão é 1024.
- A duração da transação excede (segundos): o tempo máximo que cada transação pode permanecer na memória antes de ser descarregada no disco. A duração é calculada a partir do momento em que Qlik Talend Data Integration começou a capturar a transação. O valor padrão é 60.
Ajuste em lote
-
Número mínimo de alterações por transação: O número mínimo de alterações a serem incluídas em cada transação. O valor padrão é 1000.
Nota informativaAs alterações serão aplicadas ao alvo quando o número de alterações for igual ou superior ao valor Número mínimo de alterações por transação OU quando o valor de Tempo máximo para transações em lote antes da aplicação (segundos) descrito abaixo for atingido - o que ocorrer primeiro. Como a frequência das alterações aplicadas ao destino é controlada por esses dois parâmetros, as alterações nos registros de origem podem não ser refletidas imediatamente nos registros de destino.
- Tempo máximo para transações em lote antes da aplicação (segundos): o tempo máximo para coletar transações em lotes antes de declarar um tempo limite. O valor padrão é 1.
Intervalo
-
Ler alterações a cada (minutos)
Defina o intervalo entre a leitura de alterações na origem, em minutos. O intervalo válido é de 1 a 1440.
Nota informativaEssa opção é apenas para tarefas que usam:
- Gateway Data Movement
- O método de atualização Captura de dados alterados (CDC).
Verificar alterações
-
De acordo com o intervalo de extração delta: Quando esta opção é selecionada, a tarefa de dados verifica se há alterações de acordo com o intervalo de extração Delta.
Nota informativaO intervalo começará após cada "rodada". Uma rodada pode ser definida como o tempo que a tarefa de dados leva para ler as alterações das tabelas de origem e enviá-las para o destino (como uma única transação). A duração de uma rodada varia de acordo com o número de tabelas e alterações. Assim, se você especificar um intervalo de 10 minutos e uma rodada levar 4 minutos, então o tempo real entre as verificações de alterações será de 14 minutos.-
Intervalo de extração de delta: A frequência com que os deltas serão extraídos do seu sistema. O padrão é a cada 60 segundos.
-
-
Conforme programado: quando esta opção é selecionada, a tarefa de dados extrairá o delta uma vez e depois parará. Em seguida, continuará sendo executado conforme programado.
Nota informativaEsta opção é relevante apenas se o intervalo entre os ciclos CDC for de 24 horas ou mais.Para obter informações sobre agendamento:
-
Tarefas de "Aterrar dados em data lake" em um projeto de replicação, consulte Agendando uma CDC para tarefas de aterrisagem no lake
-
Ajuste diverso
- Tamanho do cache de instruções (número de instruções): O número máximo de instruções preparadas a serem armazenadas no servidor para execução posterior (ao aplicar alterações no destino). O padrão é 50. O máximo é 200.
-
EXCLUIR e INSERIR ao atualizar uma coluna de chave primária: Esta opção requer que o log suplementar completo esteja ativado no banco de dados de origem.
Nota informativaEssa configuração não está disponível para tarefas que usam um conector de aplicativo SaaS, a menos que seja um conector Lite.
Evolução automática do esquema
Selecione como lidar com os seguintes tipos de alterações de DDL no esquema. Depois de alterar as configurações de evolução do esquema, você deve preparar a tarefa novamente. A tabela abaixo descreve quais ações estão disponíveis para as alterações de DDL compatíveis.
| Alteração de DDL | Aplicar ao destino | Ignorar | Suspender tabela | Interromper tarefa |
|---|---|---|---|---|
| Adicionar coluna | Sim | Sim | Sim | Sim |
| Renomear coluna | Não | Não | Sim | Sim |
| Renomear tabela | Não | Não | Sim | Sim |
| Alterar tipo de dados da coluna | Não | Sim | Sim | Sim |
| Criar tabela
Se você usou uma Regra de seleção para adicionar conjuntos de dados que correspondem a um padrão, novas tabelas que atendem ao padrão serão detectadas e adicionadas. |
Sim | Sim | Não | Não |
Substituição de caracteres
Você pode substituir ou excluir caracteres de origem no banco de dados de destino e/ou substituir ou excluir caracteres de origem que não são compatíveis com um conjunto de caracteres selecionado.
-
Todos os caracteres devem ser especificados como pontos de código Unicode.
- A substituição de caracteres também será realizada nas tabelas de controle.
-
Valores inválidos serão indicados por um triângulo vermelho no canto superior direito da célula da tabela. Passar o cursor do mouse sobre o triângulo mostrará a mensagem de erro.
-
Quaisquer transformações globais ou em nível de tabela definidas para a tarefa serão executadas após a conclusão da substituição de caracteres.
-
As ações de substituição definidas na tabela Substituir ou excluir caracteres de origem são executadas antes da ação de substituição definida na tabela Substituir ou excluir caracteres de origem não compatíveis com o conjunto de caracteres selecionado.
- A substituição de caracteres não aceita tipos de dados LOB.
Substituindo ou excluindo caracteres de origem
Use a tabela Substituir ou excluir caracteres de origem para definir substituições para caracteres de origem específicos. Isso pode ser útil, por exemplo, quando a representação Unicode de um caractere é diferente nas plataformas de origem e de destino. Por exemplo, no Linux, o caractere de menos no conjunto de caracteres Shift_JIS é representado como U+2212, mas no Windows é representado como U+FF0D.
| Até | Faça isto |
|---|---|
|
Defina ações de substituição. |
|
|
Editar o caractere de origem ou destino especificado |
Clique em |
|
Excluir entradas da tabela |
Clique em |
Substituindo ou excluindo caracteres de origem não compatíveis com o conjunto de caracteres selecionado
Use a tabela Caracteres de origem não compatíveis com o conjunto de caracteres para definir um único caractere de substituição para todos os caracteres não compatíveis com o conjunto de caracteres selecionado.
| Até | Faça isto |
|---|---|
|
Defina ou edite uma ação de substituição. |
|
|
Desabilite a ação de substituição. |
Selecione a entrada em branco na lista suspensa Conjunto de caracteres. |
Carregando segmentos de conjuntos de dados em paralelo
Durante o carregamento total, você pode acelerar o carregamento de grandes conjuntos de dados dividindo o conjunto de dados em segmentos, que serão carregados em paralelo. As tabelas podem ser divididas por intervalos de dados, todas as partições, todas as subpartições ou partições específicas.
Para obter mais informações, consulte Replicando segmentos de conjuntos de dados em paralelo.
Mais opções
Essas opções não são expostas na UI, pois são relevantes apenas para versões ou ambientes específicos. Consequentemente, não as defina, a menos que seja explicitamente instruído a fazê-lo pelo Suporte da Qlik ou na documentação do produto.
Para definir uma opção, basta copiá-la no campo Adicionar nome do recurso e clicar em Adicionar. Em seguida, defina o valor ou habilite a opção de acordo com as instruções que você recebeu.
Agendando uma CDC para tarefas de aterrisagem no lake
Nos casos de uso a seguir, você deve definir um intervalo de programação para manter os dados de destino atualizados:
- Acessando uma fonte de dados sem o Gateway Data Movement
- Usando um conector de aplicativo SaaS que não é um Conector Lite.
- Ao capturar alterações de uma fonte SAP OData usando a opção Conforme agendado.
A programação determina com que frequência os conjuntos de dados de destino serão atualizados com alterações nos conjuntos de dados de origem. Enquanto a programação determina a frequência de atualização, o tipo de conjunto de dados determina o método de atualização. Se um conjunto de dados for compatível com CDC, apenas as alterações nesse conjunto de dados serão recuperadas e propagadas para a tabela de destino correspondente. Se um conjunto de dados não for compatível com CDC, (por exemplo, uma Visualização), as alterações serão propagadas recarregando o conjunto de dados inteiro. Com conectores de aplicativo SaaS, uma única tarefa será criada com a capacidade de agendar intervalos de CDC e intervalos de recarga durante o onboarding, e posteriormente nas configurações de agendamento da tarefa. Ao usar outros tipos de conectores (por exemplo, bancos de dados) com o método de atualização CDC, se alguns dos conjuntos de dados selecionados forem compatíveis com CDC e outros não, duas subtarefas separadas serão criadas: uma para recuperar as alterações nos conjuntos de dados que são compatíveis com CDC e outra para recarregar os conjuntos de dados que não são compatíveis com CDC.
Para alterar a programação:
-
Abra seu projeto de pipeline e faça um dos seguintes procedimentos:
- Na visualização de tarefas, clique
em uma tarefa de dados e selecione Programação.
- Na visualização de pipeline, clique
em uma tarefa de dados e selecione Programação.
- Abra a tarefa de replicação e clique no botão Programação da barra de ferramentas.
- Na visualização de tarefas, clique
- Altere as configurações de agendamento conforme necessário e clique em OK.
Executando uma execução perdida para uma tarefa com base no Gateway Data Movement
Às vezes, um problema de rede pode fazer com que a conexão com o Gateway Data Movement seja perdida. Se a conexão com o Gateway Data Movement não for restaurada antes da próxima execução programada, a tarefa de dados não poderá ser executada conforme programado. Nesses casos, você pode escolher se deseja ou não executar uma tarefa imediatamente após o restabelecimento da conexão.
As configurações padrão para todos os Gateway Data Movements são definidas no centro de atividades de Administração. Você pode substituir essas configurações para tarefas individuais, conforme descrito abaixo.
Para fazer isso
-
Abra seu projeto e siga um destes procedimentos:
-
Na visualização de tarefas, clique
na tarefa de dados e selecione Programação.
-
Na visualização de pipeline, clique
na tarefa de dados e selecione Programação.
-
Abra a tarefa de dados e clique no botão Agendamento na barra de ferramentas.
O diálogo Agendamento - <task> é aberto.
-
-
Ative a opção Usar configurações personalizadas para esta tarefa.
-
Na parte inferior do diálogo, escolha uma das seguintes opções de Executar tarefas agendadas perdidas.
-
Assim que possível e depois conforme agendado se for importante executar uma tarefa antes da próxima instância agendada
-
Conforme agendado para executar a tarefa na próxima instância agendada
-
-
Salve suas configurações.
Consulte também: Executando uma execução de tarefa após um agendamento perdido.