Paramètres des cibles de stockage cloud | Aide Qlik Cloud
Accéder au contenu principal Passer au contenu complémentaire

Paramètres des cibles de stockage cloud

Vous pouvez modifier les paramètres de dépôt temporaire de lac de données par défaut en fonction de vos besoins.

Général

Méthode de mise à jour

Il existe deux modes de dépôt temporaire des données différents. Il est impossible de modifier le mode une fois la tâche de dépôt temporaire de lac de données préparée.

  • Change Data Capture (CDC) via des tables de modifications : Les tâches de dépôt temporaire dans un lac de données démarrent avec un chargement complet (au cours duquel toutes les tables sélectionnées sont chargées dans la cible). Les données cibles sont ensuite maintenues à jour via la technologie CDC (Change Data Capture).

    Note InformationsL'opération CDC (Change Data Capture) des opérations DDL n'est pas supportée.

    Lors de l'utilisation de Passerelle de déplacement des données, sauf avec une source d'applications SaaS, les modifications sont capturées auprès de la source quasiment en temps réel. Si vous travaillez sans Passerelle de déplacement des données ou avec des sources d'applications SaaS, les modifications sont capturées en fonction des paramètres du planificateur. Pour plus d'informations, consultez Scheduling tasks.

  • Charger : effectue un chargement complet des données des tables sources sélectionnées dans la plateforme cible et crée les tables cibles, si nécessaire. Le chargement complet s'effectue automatiquement lorsque la tâche démarre, mais il peut également être effectué manuellement ou planifié de sorte à se produire périodiquement, si nécessaire.

    Note InformationsCe paramètre n'est pas disponible lors de l'utilisation d'un connecteur d'applications SaaS.

     

Dossier à utiliser

Sélectionnez une des options suivantes, suivant le dossier de compartiment dans lequel vous souhaitez écrire les fichiers :

  • Dossier par défaut

    Le format de dossier par défaut est <votre-nom-de-projet>/<votre-nom-de-tâche>.

  • Dossier racine

    Les fichiers seront écrits dans le dossier de compartiment racine.

  • Dossier

    Spécifiez un nom de dossier. Le dossier sera créé lors de la tâche de données, s'il n'existe pas encore.

    Note Informations Le nom de dossier ne peut pas contenir de caractères spéciaux (par exemple, @, #, !, etc.).

Chargement de données

Attributs de fichier

Format

Vous pouvez décider de créer les fichiers cibles au format CSV, JSON ou Parquet.

Note InformationsLors de l'utilisation du format de fichier Parquet, les colonnes de LOB supérieures à 1 Mo ne sont pas supportées.

Dans un fichier JSON, chaque enregistrement est représenté par une seule ligne, comme dans l'exemple suivant :

{ "book_id": 123, "title": "Alice in Wonderland", "price": 6.99, "is_hardcover": false }

{ "book_id": 456, "title": "Winnie the Pooh", "price": 6.49, "is_hardcover": true }

{ "book_id": 789, "title": "The Cat in the Hat", "price": 7.23, "is_hardcover": true }

Consultez aussi : Propriétés content-type et content-encoding

Note InformationsLa modification du format (par exemple, le passage du format CSV au format JSON ou du format JSON au format CSV) alors que la tâche est à l'arrêt, puis la reprise de la tâche, ne sont pas supportées.
Note Informations
  • Si vous sélectionnez le format JSON ou Parquet, les champs suivants seront masqués, car ils ne s'appliquent qu'au format CSV : Délimiteur de champs, Délimiteur d'enregistrements, Valeur nulle, Caractère de guillemet, Caractère d'échappement de guillemet et Ajouter un en-tête de métadonnées.
  • Les champs suivants s'appliquent uniquement au format Parquet : Version de Parquet, Unité d'horodatage Parquet et Taille de LOB Parquet maximale (Ko).

Pour des informations sur les mappings de types de données lors de l'utilisation du format Parquet et les limitations, consultez Mapping from Qlik Cloud data types to Parquet .

Délimiteur de champs

Délimiteur qui sera utilisé pour séparer les champs (colonnes) dans les fichiers cibles. Par défaut, il s'agit d'une virgule.

Exemple utilisant une virgule comme délimiteur :

"mike","male"

Les délimiteurs peuvent être des caractères standards ou une valeur hexadécimale (hex). Notez que le préfixe "0x" doit être utilisé pour indiquer un délimiteur hexadécimal (par ex., 0x01 = SOH). Dans les champs Délimiteur de champs, Délimiteur d'enregistrements et Valeur nulle, le délimiteur peut se composer de valeurs hex concaténées (par ex., 0x0102 = SOHSTX), tandis que dans les champs Guillemet et Caractère d'échappement de guillemet il doit s'agir d'une seule valeur hex.

Le nombre hexadécimal 0x00 n'est pas supporté (c'est-à-dire que seuls 0x01-0xFF sont supportés).

Valeur nulle

Chaîne qui sera utilisée pour indiquer une valeur nulle dans les fichiers cibles.

Exemple (où \n est le délimiteur d'enregistrements et @ la valeur nulle) :

"mike","male",295678\n
"sara","female",@\n

Délimiteur d'enregistrements

Délimiteur qui sera utilisé pour séparer les enregistrements (lignes) dans les fichiers cibles. Le comportement par défaut est une nouvelle ligne (\n).

Exemple :

"mike","male"\n
"sara","female"\n

Caractère de guillemet

Caractère qui sera utilisé au début et à la fin d'une colonne de texte. La valeur par défaut est le caractère de guillemet double ("). Lorsqu'une colonne contenant des délimiteurs de colonnes est encadrée de guillemets doubles, les caractères de délimiteur de colonnes sont interprétés comme des données réelles et non comme des délimiteurs de colonnes.

Exemple (où @ est le caractère de guillemet) :

@mike@,@male@

Caractère d'échappement de guillemet

Caractère utilisé pour échapper un caractère de guillemet dans les données réelles. La valeur par défaut est le caractère de guillemet double (").

Exemple (où " est le caractère de guillemet et \ le caractère d'échappement) :

1955,"old, \"rare\", Chevrolet","$1000"

Version de Parquet

Sélectionnez la version à utiliser en fonction de la version supportée par la plateforme cible. Note que Parquet version 1.0 supporte uniquement l'unité d'horodatage MICRO , tandis que Parquet version 2.6 supporte les unités d'horodatage MICRO et NANO.

Unité d'horodatage Parquet

Lorsque la version de Parquet est définie sur 2.6, sélectionnez MICRO ou NANO. Lorsque la version de Parquet est définie sur 1.0, seule l'unité MICRO est supportée.

Taille de LOB Parquet maximale (Ko)

La taille de LOB maximale par défaut est de 64 Ko et la valeur maximale que vous puissiez saisir dans ce champ est 10 000 Ko. Le traitement des colonnes de LOB nécessite davantage de ressources, ce qui, à son tour, a un impact sur les performances. Augmentez cette valeur uniquement si vous répliquez des données de LOB supérieures à 64 Ko et si vous devez répliquer l'ensemble des données de LOB dans la cible.

Taille de fichier maximale

Taille maximale d'un fichier avant sa fermeture (et, éventuellement, sa compression).

Taille maximale d'un fichier avant sa fermeture. Il se peut que des fichiers plus petits soient chargés plus rapidement (suivant le réseau) et améliorent les performances lors de l'utilisation en combinaison avec l'option d'exécution parallèle. Cependant, il est généralement déconseillé d'encombrer la base de données de petits fichiers.

Compresser les fichiers via

Sélectionnez une des options de compression pour compresser les fichiers cibles, ou NONE (Aucune) (la valeur par défaut) pour les laisser décompressés. Notez que les options de compression disponibles sont déterminées par le format de fichier sélectionné.

Ajouter un en-tête de métadonnées

Vous avez l'option d'ajouter une ligne d'en-tête aux fichiers de données. La ligne d'en-tête peut contenir les noms des colonnes sources et/ou les types de données intermédiaires (à savoir Qlik Talend Data Integration).

Exemple de fichier cible avec une ligne d'en-tête lorsque les deux options Avec des noms de colonne et Avec des types de données sont sélectionnées :

Position:DECIMAL(38,0),Color:VARCHAR(10)

1,"BLUE"

2,"BROWN"

3,"RED"

...

Modifier le traitement

Cette section décrit les paramètres conditionnels dans Traitement des modifications.

Appliquer/stocker les modifications lorsque

  • La taille de fichier atteint : spécifiez la taille maximale de données de modification à accumuler avant le chargement du fichier dans la cible.
  • Le temps écoulé atteint : le temps écoulé atteint x.

Fichiers de métadonnées

Lorsque l'option Créer des fichiers de métadonnées dans le dossier cible est sélectionnée, pour chaque fichier de données, un fichier de métadonnées correspondant avec une extension .dfm est créé sous le dossier cible spécifié. Les fichiers de métadonnées fournissent des informations supplémentaires sur la tâche/les données telles que le type de connecteur source, le nom de table source, le nombre d'enregistrements dans le fichier de données, etc.

Pour une description complète du fichier de métadonnées ainsi que des utilisations possibles, voir Description du fichier de métadonnées .

Métadonnées

Colonnes LOB

Note InformationsCes paramètres ne sont pas disponibles pour les tâches qui utilisent un connecteur d'applications SaaS.

Inclure les colonnes LOB et limiter la taille des colonnes à (Ko)

Vous pouvez choisir d'inclure des colonnes LOB dans la tâche et de définir la taille LOB maximale. Les LOB dépassant la taille maximale seront tronqués.

Mapping de colonnes JSON

Note Informations
  • Si vous utilisez Passerelle de déplacement des données pour accéder à votre source de données, la version 2024.11.70 ou une version ultérieure est nécessaire.

Lorsque cette option est sélectionnée, les colonnes JSON de la source sont automatiquement mappées vers les colonnes JSON de la cible.

L'état et la visibilité de cette option sont déterminés par les facteurs suivants :

  • Nouvelles tâches : cette option sera activée par défaut si la source et la cible supportent toutes les deux le type de données JSON.

  • Tâches existantes : cette option sera activée par défaut, même si la source et la cible supportent toutes les deux le type de données JSON. Ceci afin de préserver la rétrocompatibilité avec les processus en aval (tels que les transformations) qui s'attendent à ce que les données cibles se présentent au format STRING (le comportement hérité). Vous pouvez soit laisser l'option désactivée, soit modifier les processus en aval de sorte qu'ils soient compatibles avec le format JSON, puis activer cette option.

  • Tâches nouvelles et existantes : si seule la source supporte le type de données JSON, cette option ne sera pas visible. Si le support JSON est ajouté à la cible à un stade ultérieur, l'option deviendra visible, mais restera désactivée. Ceci afin de préserver la rétrocompatibilité avec les processus en aval (tels que les transformations) qui s'attendent à ce que les données cibles se présentent au format STRING (le comportement hérité).

Tables de contrôle

Sélectionnez parmi les tables de contrôle suivantes celles que vous souhaitez créer sur la plateforme cible :

  • État de réplication : Fournit des détails sur la tâche de dépôt temporaire active, notamment le statut de la tâche, la quantité de mémoire consommée par la tâche, le nombre de modifications non encore appliquées à la plateforme de données et la position dans la source de données à partir de laquelle les données sont actuellement lues.
  • Tables suspendues : Fournit une liste de tables suspendues et la raison pour laquelle elles ont été suspendues.
  • Historique du dépôt temporaire : Fournit des informations sur l'historique de la tâche, notamment le nombre et le volume d'enregistrements traités lors d'une tâche de dépôt temporaire, la latence à la fin d'une tâche CDC, etc.
  • Modifier les partitions de données : Fournit des enregistrements de partitions créées sur la base de données cible en raison du Modifier la partition de données. Vous pouvez utiliser ces informations pour identifier les données partitionnées à traiter davantage.

Pour une description détaillée de chacune des tables de contrôle, voir Tables de contrôle.

Chargement complet

Note InformationsCes paramètres ne sont pas disponibles pour les tâches qui utilisent un connecteur d'applications SaaS.

Réglage des performances

  • Nombre maximal de tables à charger en parallèle : saisissez le nombre maximal de tables à charger simultanément dans la cible. La valeur par défaut est 5.
  • Délai d'expiration de la cohérence des transactions (secondes) : saisissez le nombre de secondes pendant lequel attend la clôture des transactions ouvertes avant de démarrer l'opération Chargement complet. La valeur par défaut est 600 (10 minutes). Le chargement complet démarrera après que la valeur de délai d'expiration est atteinte, même en cas de transactions encore ouvertes.

    Note InformationsPour répliquer des transactions ouvertes lors du démarrage de l'opération Chargement complet, mais validées uniquement après que la valeur du délai d'expiration a été atteinte, vous devez actualiser les tables cibles.
  • Taux de commit lors du chargement complet : nombre maximal d'événements pouvant être transférés ensemble. La valeur par défaut est 10 000.

À la fin du chargement complet

Créer une clé primaire ou un index unique : sélectionnez cette option pour reporter la création de la clé primaire ou de l'index unique sur la plateforme de données à la fin du chargement complet.

Pour le chargement initial

Note Informations Si vous utilisez Passerelle de déplacement des données pour accéder à votre source de données, ces paramètres nécessitent la version 2022.11.74 ou une version ultérieure.
Utiliser les données en cache

Cette option vous permet d'utiliser les données en cache qui ont été lues lors de la génération des métadonnées avec Scan de données complet sélectionné.

Cela génère moins de frais généraux en ce qui concerne les quotas et l'utilisation des API, car les données sont déjà lues de la source. Toute modification depuis le scan de données initial peut être capturée via Change Data Capture (CDC).

Charger les données de la source

Cette option effectue un nouveau chargement depuis la source de données. Cette option est utile dans les cas suivants :

  • Le scan des métadonnées n'a pas été effectué dernièrement.

  • Le jeu de données source est de petite taille et change souvent, et vous ne souhaitez pas conserver un historique complet des modifications.

Stocker les modifications

Lorsque vous sélectionnez la méthode de mise à jour Change Data Capture (CDC), les mises à jour des données sources seront stockées dans des tables de modifications sur la plateforme cible. Les tables de modifications capturent toutes les opérations d'insertion, de mise à jour et de suppression de la source, ce qui permet aux applications en aval de traiter les modifications de manière incrémentielle.

Cette section explique comment configurer les options des tables de modifications : gestion des options DDL, stockage des images mises à jour et comportement de création des tables.

Note Informations

Le traitement de la fonction Stocker les modifications est disponible uniquement lorsque la méthode de mise à jour est définie sur Change Data Capture (CDC).

Toute modification apportée à ces paramètres ne prendra effet que lors de l'exécution suivante d'un Chargement complet. Si vous modifiez ces paramètres alors que la tâche est à l'arrêt, vous devez actualiser les tables cibles pour appliquer les modifications.

Pour des informations complètes sur les tables de modifications, consultez Utilisation de tables de modifications.

Basic settings

Options DDL

Note InformationsCes paramètres ne sont pas disponibles lors d'une réplication depuis des sources d’applications SaaS.

Les options DDL (Data Definition Language - Langage de définition de données) déterminent la manière dont les modifications de schéma de la source sont traitées dans les tables de modifications.

  • Appliquer à la table de modifications : lorsque vous sélectionnez cette option, le système applique automatiquement les modifications de DDL des tables sources (telles que l'ajout ou la suppression de colonnes) aux tables de modifications correspondantes. Utilisez cette option lorsque vos applications en aval ont besoin que les tables de modifications reflètent toutes les modifications de schéma de la source.

  • Ignorer : le système ignore toutes les modifications de DDL de la source. La structure de la table de modifications reste inchangée. Utilisez cette option lorsque les modifications de DDL de la source ne doivent pas affecter les modifications stockées ou lorsque votre système cible nécessite des schémas de table fixes.

Paramètres avancés

Lors de la mise à jour

Note InformationsCe paramètre n'est pas pertinent pour les sources d'applications SaaS, car les modifications sont appliquées sous forme d'opérations INSÉRER.

Les paramètres Lors de la mise à jour déterminent les données qui sont capturées lorsqu'un enregistrement source est mis à jour.

Stocker l'image précédente et l'image suivante : le système capture à la fois les données d'origine (avant la mise à jour) et les données modifiées (après la mise à jour). Cette option nécessite plus de stockage, mais fournit des informations d'audit complètes, permettant aux systèmes en aval de comparer les anciennes et les nouvelles valeurs ou d'effectuer des analyses des modifications complexes. Utilisez cette option lorsque vos applications ont besoin du contexte complet des modifications.

Lorsque cette option est désactivée, le système capture uniquement les données modifiées (après la mise à jour) et non les valeurs d'origine. Cette option réduit les besoins de stockage de la cible. Utilisez cette option lorsque vous avez uniquement besoin de l'état actuel des enregistrements modifiés et non de l'historique des valeurs antérieures.

Création de table de modifications

  • Suffixe : spécifie une chaîne à utiliser comme suffixe pour l'ensemble des tables de modifications. La valeur par défaut est __ct. Les noms des tables de modifications correspondent au nom de la table cible avec le suffixe ajouté. Par exemple, si on utilise la valeur par défaut, le nom de la table de modifications sera HR__ct.
  • Préfixe de colonne d'en-tête : spécifie une chaîne à utiliser comme préfixe pour l'ensemble des colonnes d'en-tête des tables de modifications. La valeur par défaut est header__. Par exemple, si on utilise la valeur par défaut, la colonne d'en-tête stream_position sera intitulée header__stream_position.

Lors du démarrage d'un Chargement complet, ces paramètres déterminent le mode de traitement des tables de modifications existantes sur la cible. Sélectionnez l'option correspondant le mieux à vos besoins en récupération et en stockage de données :

  • ABANDONNER et CRÉER : le système supprime entièrement la table de modifications existante et en crée une nouvelle vide. Toutes les modifications précédemment stockées sont supprimées. Utilisez cette option lorsque vous souhaitez repartir de zéro à chaque cycle de Chargement complet.

  • Supprimer les anciennes modifications et stocker les nouvelles modifications dans la table de modifications existante : le système supprime toutes les données de la table de modifications existante sans affecter sa structure ni ses métadonnées. Les nouvelles modifications sont stockées dans la même table. Utilisez cette option lorsque vous souhaitez conserver la structure de la table, mais effacer les modifications précédentes.

  • Conserver les anciennes modifications et stocker les nouvelles modifications dans la table de modifications existante : le système préserve l'ensemble des données et métadonnées existantes dans la table de modifications. Les nouvelles modifications sont ajoutées aux données existantes. Utilisez cette option lorsque vous devez accumuler toutes les modifications sur plusieurs cycles de Chargement complet.

Modifier la partition de données

Note InformationsCet onglet est disponible uniquement lorsque la méthode de mise à jour est Change Data Capture (CDC).

Dans une tâche de dépôt temporaire standard (sans Modifier la partition de données), les modifications sont temporairement déposées dans la cible sans ordre particulier. L'option Modifier la partition de données permet de traiter les données de modification de nombreuses tables de manière cohérente. Vous pouvez définir la durée des partitions ainsi que l'heure de partition de base, garantissant ainsi la cohérence générale des données partitionnées (à savoir, pas de transactions partielles, pas d'en-têtes de tri sans lignes de tri, etc.).

Les informations sur les partitions sont enregistrées dans la table de contrôle attrep_cdc_partitions de la base de données cible. Vous pouvez utiliser ces informations pour identifier les données partitionnées à traiter davantage.

  • Dans une tâche de dépôt temporaire standard (sans Modifier la partition de données), les modifications sont temporairement déposées dans la cible sans ordre particulier. L'option Modifier la partition de données permet de traiter les données de modification de nombreuses tables de manière cohérente. Vous pouvez définir la durée des partitions ainsi que l'heure de partition de base, garantissant ainsi la cohérence générale des données partitionnées (à savoir, pas de transactions partielles, pas d'en-têtes de tri sans lignes de tri, etc.).

    • Opération CDC planifiée : les partitions sont créées lorsque l'instance de tâche planifiée s'exécute. Ainsi, par exemple, si une tâche est planifiée pour s'exécuter tous les jours à minuit et que Partitionner tou(te)s les est défini sur 4 heures, le nombre de partitions créées représentera le moment où des validations (commits) ont eu lieu au cours des dernières 24 heures. Si des validations ont eu lieu à 01:00-03:00 et à 16:15-18:00, et que l'Heure de partition de base est définie sur 0:00, deux partitions seront créées : 0:00-04:00 et 16:00-20:00.

    • CDC continu : Si l'option Partitionner tou(te)s les est définie sur 4 heures, Replicate crée une partition toutes les 4 heures contenant toutes les validations ayant eu lieu pendant cette période. S'il n'y a eu aucune validation pendant 4 heures, aucune partition ne sera créée pour cette période.

  • Les tâches qui extraient des données à partir de sources d'applications SaaS sont toujours planifiées. Les partitions sont basées sur l'heure d'extraction des données, car la notion de commit (validation) n'existe pas dans les sources d'applications SaaS. L'extraction des données commence lorsque l'instance de tâche planifiée s'exécute. Ainsi, par exemple, si une tâche est planifiée pour s'exécuter tous les jours à minuit et que Partitionner tou(te)s les est défini sur 4 heures, le nombre de partitions créées représentera la durée d'extraction des données. Si l'extraction des données prend moins de deux heures, une seule partition sera créée. Mais si l'extraction prend six heures (par exemple), deux partitions seront créées.

  • Partition tou(te)s les - Spécifiez la longueur (en heures et en minutes) de chaque partition.

    Note Informations

    Il est recommandé de spécifier une longueur de partition de plus d'une heure. Même si la spécification d'une longueur de partition inférieure à une heure peut améliorer la latence, la création de nombreuses partitions dans la cible peut également impacter les performances (de la cible) (en particulier dans les systèmes avec de gros volumes de modifications).

    Si vous reprenez une tâche à un point PRÉCÉDANT le moment auquel la dernière partition a été créée, la tâche de dépôt temporaire de lac de données effectue l'écriture dans une partition qui a déjà été fermée.

  • Heure de partition de base - Les partitions sont créées au cours d'une période de 24 heures, calculée en fonction de l'Heure de partition de base' spécifiée dans la base de données source (au format UTC). Par exemple, un intervalle de partition de 8 heures avec une valeur “Heure de partition de base” de 02h00 créera les partitions suivantes : 02h00-10h00, 10h00-18h00, 18h00-02h00, mais pas forcément dans cet ordre. Par exemple, si une tâche a démarré à 01h00, le cadre temporel de la première partition sera 18h00-02h00. De plus, si une tâche a démarré au milieu d'une partition (par ex., à 04h00), ses données de modification seront insérées dans la partition 02h00-10h00 (même si aucune modification n'a été capturée avant 04h00).

Colonnes d'en-tête de table

Note Avertissement

Vous ne pouvez pas ajouter ni supprimer de colonnes pendant l'exécution d'une tâche. Pour modifier votre sélection de colonnes, arrêtez la tâche, mettez vos préférences à jour, puis actualisez les tables cibles.

La table de modifications comprend des colonnes de métadonnées système avec un préfixe configurable. Par défaut, ces colonnes sont préfixées de header__ (par exemple, header__stream_position, header__operation). Ces colonnes fournissent des informations sur chaque enregistrement de modification, comme le type d'opération (INSERT, UPDATE, DELETE) et l'ordre dans lequel les modifications ont eu lieu.

Vous pouvez exclure des colonnes d'en-tête spécifiques de la table de modifications si vous n'avez pas besoin de ces métadonnées. Cela réduit les besoins en stockage de la plateforme cible.

Note Informations

Lorsque l'option Modifier la partition de données est activée, le système ajoute automatiquement une colonne système supplémentaire nommée partition_name aux tables de modifications et la sélectionne automatiquement dans l'IU. Étant donné que cette colonne est obligatoire pour le suivi des partitions, elle ne peut pas être exclue.

Gérer les erreurs

Erreurs de données

Note Informations

Le traitement des erreurs de données est supporté avec la méthode de mise à jour Change Data Capture (CDC) uniquement.

Erreurs de troncation de données

Pour les erreurs de troncation de données : Sélectionnez ce que vous souhaitez qu'il se passe en cas de troncation dans un ou plusieurs enregistrements spécifiques. Vous pouvez sélectionner un des comportements suivants dans la liste :

  • Ignorer : La tâche se poursuit et l'erreur est ignorée.
  • Suspendre la table : La tâche se poursuit, mais les données de la table comportant l'enregistrement d'erreur passent à l'état d'erreur et ne sont pas répliquées.
  • Arrêter la tâche : La tâche est arrêtée et une intervention manuelle est requise.

Autres erreurs de données

Pour d'autres erreurs de données : Sélectionnez ce que vous souhaitez qu'il se passe en cas d'erreur dans un ou plusieurs enregistrements spécifiques. Vous pouvez sélectionner un des comportements suivants dans la liste :

  • Ignorer : La tâche se poursuit et l'erreur est ignorée.
  • Suspendre la table : La tâche se poursuit, mais les données de la table comportant l'enregistrement d'erreur passent à l'état d'erreur et ne sont pas répliquées.
  • Arrêter la tâche : La tâche est arrêtée et une intervention manuelle est requise.

Remontée du traitement des erreurs de données

Remonter le traitement des erreurs lorsque d'autres erreurs de données atteignent (par table) : Cochez cette case pour faire remonter le traitement des erreurs lorsque le nombre d'erreurs de données hors troncation (par table) atteint la quantité spécifiée. Les valeurs valides vont de 1 à 10 000.

Action de remontée : Sélectionnez ce qui doit se produire en cas de remontée du traitement des erreurs. Notez que les actions disponibles dépendent de l'action sélectionnée dans la liste déroulante Pour d'autres erreurs de données décrite ci-dessus.

  • Suspendre la table (par défaut) : La tâche se poursuit, mais les données de la table comportant l'enregistrement d'erreur passent à l'état d'erreur et ne font pas l'objet d'une tâche landed.

  • Arrêter la tâche : La tâche est arrêtée et une intervention manuelle est requise.

Erreurs de table

Lorsque vous rencontrez une erreur de table : sélectionnez l'un des éléments suivants dans la liste déroulante :

  • Suspendre la table (par défaut) : la tâche se poursuit, mais les données de la table comportant l'enregistrement d'erreur passent à l'état d'erreur et ne sont pas répliquées.
  • Arrêter la tâche : la tâche est arrêtée et une intervention manuelle est requise.

Remonter le traitement des erreurs lorsque les erreurs de table atteignent (par table) : cochez cette case pour faire remonter le traitement des erreurs lorsque le nombre d'erreurs de table (par table) atteint la quantité spécifiée. Les valeurs valides vont de 1 à 10 000.

Action de remontée : la stratégie de remontée des erreurs de table est définie sur Arrêter la tâche et ne peut pas être modifiée.

Environnemental

  • Nombre maximal de nouvelles tentatives : Sélectionnez cette option, puis spécifiez le nombre maximal de nouvelles tentatives d'exécution d'une tâche en cas d'erreur d'environnement récupérable. Une fois que l'exécution de la tâche a été tentée le nombre de fois spécifié, la tâche est arrêtée et une intervention manuelle est requise.

    Pour ne jamais retenter l'exécution d'une tâche, décochez la case ou spécifiez la valeur "0".

    Pour retenter l'exécution d'une tâche un nombre infini de fois, spécifiez la valeur "-1".

    • Intervalle entre les nouvelles tentatives (secondes) : Utilisez le compteur pour sélectionner une valeur ou saisissez le nombre de secondes pendant lequel le système attend entre les tentatives de réexécution d'une tâche.

      Les valeurs valides vont de 0 à 2 000.

  • Augmenter l'intervalle de nouvelle tentative pour les longues interruptions : Cochez cette case pour augmenter l'intervalle de nouvelle tentative pour les longues interruptions. Lorsque cette option est activée, l'intervalle entre chaque nouvelle tentative et la suivante est multiplié par deux, jusqu'à atteindre l'Intervalle de nouvelle tentative maximal (et les tentatives se poursuivent conformément à l'intervalle maximal spécifié).
    • Intervalle de nouvelle tentative maximal (secondes) : Utilisez le compteur pour sélectionner une valeur ou saisissez le nombre de secondes d'attente entre les tentatives de réexécution d'une tâche lorsque l'option Augmenter l'intervalle de nouvelle tentative pour les longues interruptions est activée. Les valeurs valides vont de 0 à 2 000.

Modifier le réglage du traitement

Note InformationsCet onglet est disponible uniquement lorsque la méthode de mise à jour est Change Data Capture (CDC).

Réglage du déchargement transactionnel

  • Décharger les transactions en cours sur le disque si :

    Les données de transaction sont généralement conservées en mémoire jusqu'à ce qu'elles soient entièrement validées dans la source ou la cible. En revanche, les transactions dont la taille est supérieure à la mémoire allouée ou qui ne sont pas validées dans le délai spécifié seront déchargées sur le disque.

    • La taille de mémoire de transactions totale dépasse (Mo) : taille maximale que l'ensemble des transactions peuvent occuper en mémoire avant d'être déchargées du disque. La valeur par défaut est 1 024.
    • La durée des transactions dépasse (secondes) : durée maximale pendant laquelle chaque transaction peut rester en mémoire avant son déchargement sur le disque. La durée est calculée à partir du moment où la Qlik Talend Data Integration démarre la capture de la transaction. La valeur par défaut est 60.

Réglage des lots

  • Nombre minimal de modifications par transaction : nombre minimal de modifications à inclure dans chaque transaction. La valeur par défaut est 1 000.

    Note Informations

    Les modifications seront appliquées à la cible SOIT lorsque le nombre de modifications est supérieur ou égal à la valeur Nombre minimal de modifications par transaction, SOIT lorsque la valeur Durée maximale de mise en lots des transactions avant application (secondes) décrite ci-dessous est atteinte - suivant la première occurrence. Étant donné que la fréquence des modifications appliquées à la cible est contrôlée par ces deux paramètres, il se peut que les modifications appliquées aux enregistrements sources ne soient pas immédiatement reflétées dans les enregistrements cibles.

  • Durée maximale de mise en lots des transactions avant application (secondes) : durée de collecte maximale des transactions par lots avant la déclaration de l'expiration du délai. La valeur par défaut est 1.

Interval

Note InformationsCes paramètres sont uniquement disponibles pour le connecteur SAP ODP.
  • Lire les modifications toutes les (minutes)

    Intervalle de relevé des modifications de la source en minutes. La plage valide est comprise entre 1 et 1 440.

    Note Informations

    Cette option est uniquement pour les tâches utilisant :

    • Passerelle de déplacement des données
    • Méthode de mise à jour Change Data Capture (CDC)
  • En fonction de l'intervalle d'extraction du delta : Lorsque cette option est sélectionnée, la tâche de données vérifie les modifications selon l'Intervalle d'extraction du delta.

    Note InformationsL'intervalle commencera après chaque « cycle ». Un cycle peut être défini comme le temps nécessaire à la tâche de données pour lire les modifications des tables sources et les envoyer à la cible (sous la forme d'une seule transaction). La durée d'un cycle varie en fonction du nombre de tables et de modifications. Ainsi, si vous spécifiez un intervalle de 10 minutes et si un cycle prend 4 minutes, le temps réel entre les vérifications des modifications sera de 14 minutes.
    • Intervalle d'extraction du delta : fréquence à laquelle les deltas seront extraits de votre système. La valeur par défaut est toutes les 60 secondes.

  • Comme planifié : lorsque cette option est sélectionnée, la tâche de données extraira le delta une seule fois, puis s'arrêtera. Elle continuera ensuite à s'exécuter comme planifié.

    Note InformationsCette option n'est pertinente que si l'intervalle entre les cycles CDC est de 24 heures ou plus.

    Pour plus d'informations sur la planification :

Réglage divers

  • Taille de cache des instructions (nombre d'instructions) : Nombre maximal d'instructions préparées à stocker sur le serveur pour une exécution ultérieure (lors de l'application des modifications à la cible). La valeur par défaut est 50. La valeur maximale est 200.
  • DELETE et INSERT lors de la mise à jour d'une colonne de clé primaire : Cette option nécessite l'activation de la journalisation supplémentaire complète dans la base de données source.

    Note InformationsCe paramètre n'est pas disponible pour les tâches qui utilisent un connecteur d'applications SaaS , sauf s'il s'agit d'un connecteur Lite.

Évolution automatique du schéma

Choisissez comment gérer les types suivants de modifications des DDL dans le schéma. Si vous avez modifié les paramètres d'évolution du schéma, vous devez préparer de nouveau la tâche. Le tableau ci-dessous décrit les actions disponibles pour les modifications des DDL supportées.

Note InformationsLors de l'utilisation d'un connecteur d'applications SaaS, seul Modifier le type de données de la colonne est supporté.
Modification de DDL Appliquer à la cible Ignoré Suspendre la table Arrêter la tâche
Ajouter une colonne Oui Oui Oui Oui
Renommer la colonne Non Non Oui Oui
Renommer la table Non Non Oui Oui
Modifier le type de données de la colonne Non Oui Oui Oui
Créer une table

Si vous avez utilisé une Règle de sélection pour ajouter des jeux de données correspondant à un pattern, les nouvelles tables répondant au pattern seront détectées et ajoutées.

Oui Oui Non Non

Substitution de caractère

Vous pouvez substituer ou supprimer des caractères sources dans la base de données cible et/ou vous pouvez substituer ou supprimer des caractères sources non pris en charge par un jeu de caractères sélectionné.

Note Informations
  • Tous les caractères doivent être spécifiés sous forme de points de code Unicode.

  • La substitution de caractères sera également appliquée aux tables de contrôle.
  • Les valeurs non valides seront indiquées par un triangle rouge dans le coin supérieur droit de la cellule de table. Le survol du triangle à l'aide du curseur de la souris affichera le message d'erreur.

  • Toute transformation globale ou au niveau de la table définie pour la tâche sera effectuée à la fin de la substitution de caractères.

  • Les actions de substitution définies dans la table Substituer ou supprimer des caractères sources sont effectuées avant l'action de substitution définie dans la table Substituer ou supprimer des caractères sources non pris en charge par le jeu de caractères sélectionné.

  • La substitution de caractères ne prend pas en charge les types de données LOB.

Substitution ou suppression de caractères sources

Utilisez la table Substituer ou supprimer des caractères sources pour définir les remplacements de caractères sources spécifiques. Cela peut s'avérer utile, par exemple, lorsque la représentation Unicode d'un caractère est différente sur les plates-formes source et cible. Par exemple, sous Linux, le caractère moins du jeu de caractères Shift_JIS est représenté par U+2212, alors que, sous Windows, il est représenté par U+FF0D.

Actions de substitution
Pour Procédez comme suit

Définissez des actions de substitution.

  1. Cliquez sur le bouton Ajouter un caractère au-dessus de la table.

  2. Spécifiez un caractère source et un caractère cible dans les champs Caractère source et Caractère de substitution, respectivement.

    Par exemple, pour remplacer la lettre "a" par la lettre "e", spécifiez 0061 et 0065 , respectivement.

    Note Informations

    Pour supprimer le caractère source spécifié, saisissez 0 dans la colonne Caractère de substitution.

  3. Répétez les étapes 1 et 2 pour remplacer ou supprimer d'autres caractères.

Édition du caractère source ou cible spécifié

Cliquez sur à la fin de la ligne et sélectionnez Éditer.

Suppression d'entrées de la table

Cliquez sur à la fin de la ligne et sélectionnez Supprimer.

Substitution ou suppression de caractères sources non pris en charge par le jeu de caractères sélectionné

Utilisez la table Caractères sources non pris en charge par jeu de caractères pour définir un seul caractère de remplacement pour tous les caractères non pris en charge par le jeu de caractères sélectionné.

Actions de substitution de caractères non pris en charge
Pour Procédez comme suit

Définir ou modifier une action de substitution.

  1. Sélectionnez un jeu de caractères dans la liste déroulante Jeu de caractères de la table.

    Tout caractère non pris en charge par le jeu de caractères sélectionné sera remplacé dans la cible par le caractère spécifié à l'étape 2 ci-dessous.

  2. Dans la colonne Caractère de substitution, cliquez où que ce soit dans la colonne et spécifiez le caractère de remplacement. Par exemple, pour remplacer tous les caractères non pris en charge par la lettre "a", saisissez 0061.

    Note Informations

    Pour supprimer tous les caractères non pris en charge, saisissez 0.

Désactiver l'action de substitution.

Sélectionnez l'entrée vide dans la liste déroulante Jeu de caractères.

Chargement de segments de jeu de données en parallèle

Note InformationsCe paramètre n'est pas disponible pour les sources d'applications SaaS et ne l'est que pour un sous-ensemble spécifique de bases de données sources et cibles.

Lors du chargement complet, vous pouvez accélérer le chargement de grands jeux de données en divisant le jeu de données en segments, qui seront chargés en parallèle. Les tables peuvent être divisées par plages de données, toutes les partitions, toutes les sous-partitions ou des partitions spécifiques.

Pour plus d'informations, consultez Réplication de segments de jeu de données en parallèle.

Autres options

Ces options ne sont pas exposées dans l'IU, car elles s'appliquent uniquement à des versions ou des environnements spécifiques. Par conséquent, n'activez pas ces options, sauf si Qlik Support ou la documentation produits vous le demande explicitement.

Pour activer une option, il suffit de la copier dans le champ Ajouter un nom de fonction et de cliquer sur Ajouter. Définissez ensuite la valeur ou activez l'option en fonction des instructions que vous avez reçues.

Planification de CDC pour les tâches de dépôt temporaire dans un lac

Note InformationsL'utilisation du Planificateur nécessite le rôle Peut utiliser ou le rôle Accès en écriture.

Dans les cas d'utilisation suivants, vous devez définir un intervalle de planification pour maintenir les données cibles à jour :

  • Accès à une source de données sans Passerelle de déplacement des données
  • Utilisation d'un connecteur d'applications SaaS qui n'est pas un connecteur Lite.
  • Lors de la capture des modifications d'une source SAP OData à l'aide de l'option Selon la planification.

La planification détermine la fréquence à laquelle les jeux de données cibles seront mis à jour en fonction des modifications apportées aux jeux de données sources. Alors que la planification détermine la fréquence de mise à jour, le type du jeu de données détermine la méthode de mise à jour. Si un jeu de données supporte CDC, seules les modifications apportées à ce jeu de données seront récupérées et propagées à la table cible correspondante. Si un jeu de données ne supporte pas CDC (par exemple, une vue), les modifications seront propagées via le chargement de l'intégralité du jeu de données. Avec les connecteurs d'applications SaaS, une seule tâche sera créée avec la possibilité de planifier des intervalles CDC et des intervalles de chargement lors de l'intégration, et ultérieurement dans les paramètres de planification de la tâche. Lors de l'utilisation d'autres types de connecteurs (par exemple, des bases de données), avec la méthode de mise à jour CDC, si certains des jeux de données sélectionnés supportent CDC et d'autres non, deux sous-tâches distinctes seront créées : l'une pour récupérer les modifications apportées aux jeux de données qui supportent CDC et l'autre pour charger les jeux de données qui ne supportent pas CDC.

Pour modifier la planification :

  1. Ouvrez votre projet de pipeline, puis effectuez l'une des opérations suivantes :

    • Dans la vue Tâches, cliquez sur Bouton de menu constitué de trois points horizontaux. sur une tâche de données et sélectionnez Planification.
    • Dans la vue Pipeline, cliquez sur Bouton de menu constitué de trois points verticaux. sur une tâche de données et sélectionnez Planification.
    • Ouvrez la tâche de réplication et cliquez sur le bouton de barre d'outils Planification.
  2. Modifiez les paramètres de planification selon les besoins et cliquez sur OK.
Note InformationsSi une tâche de données est encore en cours d'exécution lorsque l'exécution planifiée suivante doit commencer, la ou les exécutions planifiées suivantes seront ignorées jusqu'à ce que la tâche se termine.

Exécution d'un cycle manqué d'une tâche en fonction de Passerelle de déplacement des données

Il peut arriver qu'un problème réseau entraîne la perte de la connexion à Passerelle de déplacement des données. Si la connexion à Passerelle de déplacement des données n'est pas rétablie avant l'exécution planifiée suivante, la tâche de données ne pourra pas s'exécuter conformément à la planification. Dans ce cas, vous pouvez choisir d'exécuter ou non un cycle immédiatement après le rétablissement de la connexion.

Les paramètres par défaut pour tous les Passerelle de déplacement des données sont définis dans le centre d'activités Administration. Vous pouvez remplacer ces paramètres pour des tâches individuelles comme décrit ci-dessous.

Pour ce faire

  1. Ouvrez votre projet, puis effectuez l'une des opérations suivantes :

    • Dans la vue Tâches, cliquez sur Bouton de menu constitué de trois points horizontaux. sur la tâche de données et sélectionnez Planification.

    • Dans la vue Pipeline, cliquez sur Bouton de menu constitué de trois points verticaux. sur la tâche de données et sélectionnez Planification.

    • Ouvrez la tâche de données et cliquez sur le bouton de barre d'outils Planification.

    La boîte de dialogue Planification - <tâche> s'ouvre.

  2. Activez Utiliser les paramètres personnalisés pour cette tâche.

  3. En bas de la boîte de dialogue, choisissez l'une des options suivantes Exécuter les tâches planifiées manquées.

    • Dès que possible, puis selon la planification s'il est important d'exécuter une tâche avant la prochaine instance planifiée

    • Selon la planification pour exécuter la tâche à la prochaine instance planifiée

  4. Enregistrez vos paramètres.

Consultez aussi : Exécution d'une tâche après une planification manquée.

Cette page vous a-t-elle aidé ?

Si vous rencontrez des problèmes sur cette page ou dans son contenu – une faute de frappe, une étape manquante ou une erreur technique – faites-le-nous savoir.