Configurar los destinos de almacenamiento en la nube
Puede cambiar la configuración predeterminada de aterrizaje en el lago de datos conforme a sus necesidades.
General
Método de actualización
Puede entregar datos de dos maneras. No es posible cambiar el modo una vez que se prepara la tarea de aterrizaje en el lago de datos.
-
Captura de datos de cambios (CDC) mediante tablas de cambios: Las tareas de aterrizaje en un lago de datos comienzan con una Carga completa (durante la cual todas las tablas seleccionadas se cargan en el destino). A continuación, los datos de destino se mantienen actualizados usando la tecnología CDC (Captura de Datos de Cambios).
Nota informativaNo se admite CDC (Captura de Datos de Cambios) en operaciones DDL.Cuando se trabaja con Data Movement gateway, excepto cuando se utiliza una fuente de aplicación SaaS, los cambios se capturan desde la fuente casi en tiempo real. Cuando se trabaja sin Data Movement gateway o con fuentes de aplicaciones SaaS, los cambios se capturan según la configuración del programador. Para más información, vea Scheduling tasks.
-
Recargar: Realiza una carga completa de los datos de las tablas de origen seleccionadas en la plataforma de destino y crea las tablas de destino, si es necesario. La carga completa se produce automáticamente cuando se inicia la tarea, pero también se puede realizar manualmente o programarse para que se realice de forma periódica según sea necesario.
Nota informativaEste ajuste no está disponible cuando se utiliza un conector de aplicaciones SaaS.
Carpeta que usar
Seleccione una de las siguientes opciones, según la carpeta de depósitos en la que desee que se escriban los archivos:
-
Carpeta predeterminada
El formato de carpeta por defecto es <nombre-de-su-proyecto>/<nombre-de-su-tarea>.
-
Carpeta raíz
Los archivos se escribirán en la carpeta raíz del depósito.
-
Carpeta
Especifique un nombre de carpeta. La carpeta se creará durante la tarea de datos si aún no existe.
Nota informativa El nombre de la carpeta no puede incluir caracteres especiales (por ejemplo, @, #, !, etc.).
Carga de datos
Atributos de archivo
Formato
Puede crear los archivos de destino en formato CSV, JSON o Parquet.
En un archivo JSON, cada registro va representado por una sola línea, como en el siguiente ejemplo:
{ "book_id": 123, "title": "Alice in Wonderland", "price": 6.99, "is_hardcover": false }
{ "book_id": 456, "title": "Winnie the Pooh", "price": 6.49, "is_hardcover": true }
{ "book_id": 789, "title": "The Cat in the Hat", "price": 7.23, "is_hardcover": true }
Vea también: Las propiedades Content-type y Content-encoding
- Si elige el formato JSON o Parquet , los siguientes campos estarán ocultos, ya que solo son relevantes para el formato CSV: Delimitador de campo, Delimitador de registro, Valor nulo, Carácter de entrecomillado, Carácter de escape y Añadir cabecera de metadatos.
- Los siguientes campos solo son relevantes para el formato Parquet: Versión de Parquet, Unidad de marca de tiempo de parquet y Tamaño máximo de LOB de parquet (KB).
Para obtener información sobre las asignaciones de tipos de datos cuando se utiliza el formato Parquet y sus limitaciones, vea Mapping from Qlik Cloud data types to Parquet
Delimitador de campos
El delimitador que se utilizará para separar campos (columnas) en los archivos de destino. El valor predeterminado es una coma.
Ejemplo de uso de una coma como delimitador:
"miguel","hombre"
Los delimitadores pueden ser caracteres estándar o un valor hexadecimal (hex). Tenga en cuenta que el prefijo "0x" debe utilizarse para denotar un delimitador hexadecimal (por ej. 0x01 = SOH). En los campos Delimitador de campos, Delimitador de registros y Valor nulo, el delimitador puede consistir en valores hexadecimales concatenados (por ejemplo, 0x0102 = SOHSTX), mientras que en los campos Carácter de cita y Carácter de escape de cita, solo puede ser un único valor hexadecimal.
No se admite el número hexadecimal 0x00 (es decir, solo se admiten 0x01-0xFF).
Valor nulo
La cadena de caracteres que se utilizará para indicar un valor nulo en los archivos de destino.
Ejemplo: (donde \n es el delimitador de registros y @ es el valor nulo)
Delimitador de registros
El delimitador que se utilizará para separar los registros (filas) en los archivos de destino. El valor por defecto es un retorno o nueva línea (\n).
Ejemplo:
Carácter de entrecomillado
El carácter que se utilizará al principio y al final de una columna de texto. Por defecto se utiliza el carácter de comillas dobles ("). Cuando una columna que contiene delimitadores de columna va incluida entre comillas dobles, los caracteres delimitadores de columna se interpretan como datos reales y no como delimitadores de columna.
Ejemplo (donde @ es el carácter de entrecomillado):
Carácter de escape para las comillas
El carácter utilizado para salir de un entrecomillado en los datos reales. Por defecto se utiliza el carácter de comillas dobles (").
Ejemplo (donde " es el carácter de entrecomillado y \ es el carácter de salida):
Versión Parquet
Seleccione qué versión usar según la versión compatible con la plataforma de destino. Tenga en cuenta que la versión 1.0 de Parquet solo admite la unidad de marca de tiempo MICRO , mientras que la versión 2.6 de Parquet admite las unidades de marca de tiempo MICRO y NANO .
Unidad de marca de tiempo de parquet
Cuando la versión de Parquet esté configurada en 2.6, elija MICRO o NANO. Cuando la versión de Parquet está configurada en 1.0, solo se admite MICRO.
Tamaño máximo de LOB de parquet (KB)
El tamaño máximo predeterminado de LOB es 64 KB y el valor máximo que puede insertar en este campo es 10 000 KB. El manejo de columnas LOB requiere mayores recursos, lo que a su vez afecta al rendimiento. Aumente este valor solo si está replicando datos LOB de más de 64 KB y necesita que todos los datos LOB se repliquen en el destino.
Tamaño máximo de archivo
El tamaño máximo que puede alcanzar un archivo antes de cerrarse (y opcionalmente, comprimido).
El tamaño máximo que puede alcanzar un archivo antes de cerrarse. Los archivos más pequeños pueden cargarse más rápido (dependiendo de la red) y mejorar el rendimiento cuando se usan junto con la opción de ejecución paralela. Sin embargo, generalmente se considera una mala práctica saturar la base de datos con archivos pequeños.
Comprimir archivos con
Elija una de las opciones de compresión para comprimir los archivos de destino o NINGUNA (valor predeterminado) para dejarlos sin comprimir. Tenga en cuenta que las opciones de compresión disponibles vienen determinadas por el formato de archivo seleccionado.
Agregar cabecera de metadatos
Opcionalmente, puede agregar una fila de encabezado a los archivos de datos. La fila del encabezado puede contener los nombres de las columnas de origen y/o la intermedia (es decir, tipos de datos de Qlik Talend Data Integration).
Ejemplo de un archivo de destino con una fila de encabezado cuando se seleccionan Con nombres de columna y Con tipos de datos:
Position:DECIMAL(38,0),Color:VARCHAR(10)
1,"BLUE"
2,"BROWN"
3,"RED"
...
Procesamiento de cambios
Esta sección describe los ajustes condicionales en Procesamiento de cambios.
Aplicar/almacenar los cambios cuando
- El tamaño del archivo alcanza (KB): especifique el tamaño máximo de datos de cambios que se acumulará antes de cargar el archivo en el destino.
- El tiempo transcurrido llega a:: El tiempo transcurrido llega a x.
Archivos de metadatos
Cuando se selecciona la opción Crear archivos de metadatos en la carpeta de destino, para cada archivo de datos se creará un archivo de metadatos correspondiente con extensión .dfm en la carpeta de destino especificada. Los archivos de metadatos proporcionan información adicional sobre la tarea/datos, como el tipo de conector de origen, el nombre de la tabla de origen, el número de registros del archivo de datos, etc.
Para una descripción completa del archivo de metadatos, así como sus posibles usos, vea Descripción del archivo de metadatos
Metadatos
Columnas LOB
Incluir columnas LOB y limitar el tamaño de las columnas a (KB)
Puede optar por incluir columnas LOB en la tarea y establecer el tamaño máximo del objeto LOB. Los LOB que superen el tamaño máximo se truncarán.
Asignación de columnas JSON
Asociar columnas JSON de origen compatibles a columnas JSON en el destino
-
Si utiliza Data Movement gateway para acceder a su fuente de datos, necesitará la versión 2024.11.70 o posterior.
Cuando se selecciona esta opción, las columnas JSON del origen se asignarán automáticamente a las columnas JSON del destino.
El estado y la visibilidad de esta opción se determinan mediante los siguientes factores:
-
Nuevas tareas: Esta opción estará habilitada de forma predeterminada si tanto el origen como el destino admiten el tipo de datos JSON.
-
Tareas existentes: Esta opción estará deshabilitada por defecto, incluso si tanto el origen como el destino admiten el tipo de datos JSON. Esto es para preservar la compatibilidad de versiones anteriores con procesos posteriores, como las transformaciones, que esperan que los datos de destino estén en formato STRING (que es el comportamiento heredado). Puede dejar la opción desactivada o puede editar los procesos descendentes/posteriores para que sean compatibles con el formato JSON y, a continuación, activar esta opción.
-
Tareas nuevas y existentes: Si solo el origen admite el tipo de datos JSON, esta opción no estará visible. Si se añade compatibilidad con JSON al destino en una etapa posterior, la opción se hará visible pero permanecerá deshabilitada. Esto es para preservar la compatibilidad de versiones anteriores con procesos posteriores, como las transformaciones, que esperan que los datos de destino estén en formato STRING (que es el comportamiento heredado).
Tablas de control
Seleccione cuáles de las tablas de control siguientes desea que se creen en la plataforma de destino:
- Estado de replicación: Proporciona detalles sobre la tarea de aterrizaje actual, incluido el estado de la tarea, la cantidad de memoria consumida por la tarea, el número de cambios aún no aplicados a la plataforma de datos y la posición en la fuente de datos desde la que se están leyendo los datos en ese momento.
- Tablas suspendidas: Proporciona una lista de tablas suspendidas y el motivo por el que fueron suspendidas.
- Historial de aterrizaje: Proporciona información sobre el historial de tareas, incluida la cantidad y el volumen de registros procesados durante una tarea de ubicación de destino, la latencia al final de una tarea de CDC y más.
- Cambiar particiones de datos: Proporciona registros de particiones creadas en la base de datos de destino debido a Cambiar la partición de datos. Puede utilizar esta información para identificar datos particionados que deban procesarse más.
Para una descripción detallada de cada una de las Tablas de control, vea Tablas de control
Carga completa
Optimización del rendimiento
- Número máximo de tablas para cargar en paralelo: indique el número máximo de tablas que se cargarán en el destino de una sola vez. El valor predeterminado es 5.
-
Tiempo de espera de coherencia de la transacción (segundos): indique el número de segundos que deberá esperar a que se cierren las transacciones abiertas, antes de iniciar la operación de Carga completa. El valor predeterminado es 600 (10 minutos). La carga completa comenzará después de que se alcance el valor del tiempo de espera, incluso si hubiera transacciones abiertas.
Nota informativaPara replicar transacciones que estaban abiertas cuando se inició la Carga completa pero que solo se consignaron después de que se alcanzara el valor de tiempo de espera, deberá volver a cargar las tablas de destino. - Confirmar cifra durante la carga completa: el número máximo de eventos que pueden transferirse juntos. El valor predeterminado es 10000.
Tras finalizar la carga completa
Crear clave principal o única: seleccione esta opción si desea retrasar la creación de la clave primaria o el índice único en la plataforma de datos hasta que finalice la carga completa.
Para carga inicial
| Usar datos almacenados en caché |
Esta opción le permite usar datos almacenados en caché que se leyeron al generar metadatos con el Examen completo de datos seleccionado. Esto genera menos consumo en general con respecto al uso de la API y las cuotas, ya que los datos se leen desde la fuente. Cualquier cambio desde el examen de datos inicial puede ser recogido por Change data capture (CDC). |
| Cargar datos de fuente |
Esta opción realiza una nueva carga desde la fuente de datos. Esta opción es útil si:
|
Guardar cambios
Al seleccionar el método de actualización Captura de datos de cambios (CDC), las actualizaciones de los datos de origen se almacenarán en tablas de cambios en la plataforma de destino. Las tablas de cambios capturan todas las operaciones de inserción, actualización y eliminación del origen, lo que permite que las aplicaciones descendentes procesen los cambios de forma incremental.
Esta sección describe cómo configurar las opciones de las tablas de cambios: el manejo de DDL, el almacenamiento de imágenes de actualización y el comportamiento de creación de tablas.
El procesamiento del almacenamiento de cambios solo está disponible cuando el método de actualización está configurado en Captura de datos de cambios (CDC).
Cualquier cambio en estos ajustes solo tendrá efecto la próxima vez que se ejecute una Carga completa. Si modifica estos ajustes mientras la tarea está detenida, debe volver a cargar las tablas de destino para aplicar los cambios.
Para obtener información detallada sobre las tablas de cambios, consulte Usar las tablas de cambios.
Configuración básica
Opciones de DDL
Las opciones de DDL (Data Definition Language) determinan cómo se gestionan los cambios de esquema del origen en las tablas de cambios.
-
Aplicar a la tabla de cambios: al seleccionar esta opción, el sistema aplica automáticamente los cambios de DDL de las tablas de origen (como añadir o eliminar columnas) a las tablas de cambios correspondientes. Utilice esta opción cuando sus aplicaciones downstream necesiten que las tablas de cambios reflejen todos los cambios de esquema del origen.
-
Ignorar: el sistema ignora todos los cambios de DDL en el origen. La estructura de la tabla de cambios permanece inalterada. Utilice esta opción cuando los cambios de DDL en el origen no deban afectar a los cambios almacenados, o cuando el sistema de destino requiera esquemas de tabla fijos.
Opciones avanzadas
Al actualizar
La configuración de On UPDATE controla qué datos se capturan cuando se actualiza un registro de origen.
Almacenar imagen anterior y posterior: el sistema captura tanto los datos originales (antes de la actualización) como los datos modificados (después de la actualización). Esta opción requiere más almacenamiento, pero proporciona información de auditoría completa, lo que permite a los sistemas descendentes comparar los valores antiguos y nuevos o realizar análisis de cambios complejos. Utilice esto cuando sus aplicaciones necesiten el contexto de cambio completo.
Cuando esta opción está desactivada, el sistema solo captura los datos modificados (después de la actualización), no los valores originales. Esta opción reduce los requisitos de almacenamiento en el destino. Utilice esto cuando solo necesite el estado actual de los registros modificados y no requiera los valores anteriores históricos.
Creación de tablas de cambios
Sustituir el sufijo de la tabla de cambios y del prefijo de columna de cabecera predeterminados
- Sufijo: Especifique una cadena que se utilizará como sufijo para todas las Tablas de cambios. El valor predeterminado es __ct. Los nombres de las tablas de cambios son el nombre de la tabla de destino con el sufijo añadido. Así, por ejemplo, utilizando el valor predeterminado, el nombre de la Tabla de cambios será HR__ct.
- Prefijo de la columna de cabecera: Especifique una cadena que se utilizará como prefijo para todas las columnas de cabecera de las tablas de cambios. El valor predeterminado es header__. Por ejemplo, si se utiliza el valor predeterminado, la columna de cabecera stream_position se llamará header__stream_position.
Determinación de cómo se gestionan las tablas de cambios existentes cuando se inicia la carga completa
Cuando se inicia una carga completa, estos ajustes determinan cómo se gestionan las tablas de cambios existentes en el destino. Seleccione la opción que mejor se adapte a sus requisitos de recuperación de datos y almacenamiento:
-
DROP and CREATE: el sistema elimina por completo la tabla de cambios existente y crea una nueva tabla vacía. Se eliminan todos los cambios almacenados previamente. Utilice esto cuando desee empezar de cero con cada ciclo de carga completa.
-
Eliminar cambios antiguos y almacenar nuevos cambios en la tabla de cambios existente: el sistema elimina todos los datos de la tabla de cambios existente sin afectar a su estructura ni a sus metadatos. Los nuevos cambios se almacenan en la misma tabla. Utilice esto cuando desee conservar la estructura de la tabla pero borrar los cambios anteriores.
-
Mantener los cambios antiguos y almacenar los nuevos en la tabla de cambios existente: el sistema conserva todos los datos y metadatos existentes en la tabla de cambios. Los nuevos cambios se añaden a los datos existentes. Utilice esta opción cuando necesite acumular todos los cambios a lo largo de varios ciclos de carga completa.
Cambiar la partición de datos
En una tarea de aterrizaje estándar (sin particionamiento de datos de cambios), los cambios se envían al objetivo sin ningún orden en particular. La partición de datos de cambios permite el procesamiento de datos modificados de muchas tablas de forma coherente. Puede definir la duración de las particiones, así como la hora base de la partición, garantizando así la coherencia general de los datos particionados (es decir, sin operaciones parciales, sin encabezados de pedidos a los que les falten líneas de orden, etc.).
La información sobre las particiones se registra en la tabla de control attrep_cdc_partitions en la base de datos de destino. Esta información se puede utilizar para identificar datos particionados que deban procesarse más.
Entender cómo funciona el particionamiento según el tipo de origen
-
Desde fuentes de bases de datos:
En una tarea de aterrizaje estándar (sin particionamiento de datos de cambios), los cambios se envían al objetivo sin ningún orden en particular. La partición de datos de cambios permite el procesamiento de datos modificados de muchas tablas de forma coherente. Puede definir la duración de las particiones, así como la hora base de la partición, garantizando así la coherencia general de los datos particionados (es decir, sin operaciones parciales, sin encabezados de pedidos a los que les falten líneas de orden, etc.).
-
CDC programado: las particiones se crean cuando se ejecuta la instancia de la tarea programada. Así, por ejemplo, si una tarea está programada para ejecutarse a medianoche todos los días y Particionar cada se establece en 4 horas, el número de particiones creadas representará el momento en que se produjeron las confirmaciones durante las últimas 24 horas. Si las confirmaciones se produjeron entre las 01:00 y las 03:00 y entre las 16:15 y las 18:00, y la Hora base de particionamiento está establecida en 0:00, se crearán dos particiones: 0:00-04:00 y 16:00-20:00.
-
CDC continuo: Si Particionar cada se establece en 4 horas, Replicate crea una partición cada 4 horas que contiene todas las confirmaciones que se produjeron durante ese período. Si no hubo confirmaciones durante 4 horas, no se creará ninguna partición para ese período.
-
-
Desde fuentes de aplicaciones SaaS:
Las tareas que extraen datos de fuentes de aplicaciones SaaS siempre están programadas. Las particiones se basan en el tiempo de extracción de datos, ya que el concepto de confirmación (commit) no existe en las fuentes de aplicaciones SaaS. La extracción de datos comienza cuando se ejecuta la instancia de la tarea programada. Así, por ejemplo, si una tarea está programada para ejecutarse a medianoche todos los días y Particionar cada se establece en 4 horas, el número de particiones creadas representará la duración de la extracción de datos. Si la extracción de datos tarda menos de dos horas, se creará una sola partición. Pero si la extracción tarda seis horas (por ejemplo), se crearán dos particiones.
Opciones de particionamiento
-
Partición cada: especifique la duración (en horas y minutos) de cada partición.
Nota informativaSe recomienda especificar una duración de partición superior a una hora. Aunque especificar una duración de partición inferior a una hora puede mejorar la latencia, la creación de muchas particiones en el destino también puede afectar al rendimiento (del destino) (especialmente en sistemas con grandes volúmenes de cambios).
Si reanuda una tarea ANTES del momento en que se creó la última partición, la tarea de inicio del lago de datos escribirá en una partición que ya se ha cerrado.
- Hora base de partición: las particiones se crean durante un período de 24 horas, que se calcula de acuerdo con la "hora base de partición" especificado en la base de datos de origen (en hora UTC). Por ejemplo, un intervalo de partición de 8 horas con una "hora base de partición" de 02:00 creará las siguientes particiones: 02:00-10:00, 10:00-18:00, 18:00-02:00, pero no necesariamente en ese orden. Por ejemplo, si una tarea comenzó a la 01:00, entonces el período de tiempo de la primera partición será de 18:00 a 02:00. Además, si una tarea comenzó en medio de una partición (por ejemplo, a las 04:00), sus datos de cambios se insertarán en la partición de 02:00 a 10:00 (aunque no se hayan captado cambios antes de las 04:00).
Columnas de encabezado de tabla
No puede añadir ni eliminar columnas mientras se ejecuta una tarea. Para modificar su selección de columnas, detenga la tarea, actualice sus preferencias y, a continuación, vuelva a cargar las tablas de destino.
La tabla de cambios incluye columnas de metadatos del sistema con un prefijo configurable. Por defecto, estas columnas tienen el prefijo header__ (por ejemplo, header__stream_position, header__operation). Estas columnas proporcionan información sobre cada registro de cambios, como el tipo de operación (INSERT, UPDATE, DELETE) y el orden en que se produjeron los cambios.
Puede excluir columnas de encabezado específicas de la tabla de cambios si no necesita esos metadatos. Esto reduce los requisitos de almacenamiento en la plataforma de destino.
Cuando Cambiar la partición de datos está habilitado, el sistema añade automáticamente una columna de sistema adicional denominada partition_name a las tablas de cambios y la selecciona automáticamente en la interfaz de usuario. Dado que esta columna es necesaria para el seguimiento de particiones, no se puede excluir.
Manejo de errores
Errores de datos
El manejo de errores de datos solo se admite con el método de actualización Captura de datos de cambios (CDC).
Errores de truncamiento de datos
Para errores de truncamiento de datos: Seleccione lo que desea que suceda cuando se produzca un truncamiento en uno o más registros específicos. Puede seleccionar uno de los siguientes de la lista:
- Ignorar: La tarea continúa y el error se ignora.
- Suspender tabla: La tarea continúa, pero los datos de la tabla con el registro de error pasan a un estado de error y sus datos no se replican.
- Detener tarea: La tarea se detiene y se requiere intervención manual.
Otros errores de datos
Para otros errores de datos: Seleccione lo que desea que suceda cuando ocurra un error en uno o más registros específicos. Puede seleccionar uno de los siguientes de la lista:
- Ignorar: La tarea continúa y el error se ignora.
- Suspender tabla: La tarea continúa, pero los datos de la tabla con el registro de error pasan a un estado de error y sus datos no se replican.
- Detener tarea: La tarea se detiene y se requiere intervención manual.
Escalar el manejo de errores de datos
Escalar el manejo de errores cuando los errores de datos lleguen a (por tabla): Seleccione esta casilla de verificación para escalar el manejo de errores cuando el número de errores de datos no truncados (por tabla) alcance la cantidad especificada. Los valores válidos son 1-10.000.
Acción de escalada: Elija qué debe suceder cuando se intensifica el manejo de errores. Tenga en cuenta que las acciones disponibles dependen de la acción seleccionada en la lista desplegable Para otros errores de datos descrita anteriormente.
-
Suspender tabla (opción predeterminada): La tarea continúa, pero los datos de la tabla con el registro de error pasan a un estado de error y sus datos no se landed.
- Detener tarea: La tarea se detiene y se requiere intervención manual.
Errores de tabla
Cuando encuentre un error: Seleccione una de las siguientes opciones en la lista desplegable:
- Suspender la tabla (opción predeterminada): la tarea continúa, pero los datos de la tabla con el registro de error pasan a un estado de error y sus datos no se replican.
- Detener la tarea: la tarea se detiene y se requiere intervención manual.
Escalar el manejo de errores cuando los conflictos de errores de tabla lleguen a (por tabla): seleccione esta casilla de verificación para escalar el manejo de errores cuando el número de conflictos de errores de tabla (por tabla) alcance la cantidad especificada. Los valores válidos son 1-10.000.
Acción de escalada: la política de escalada para los errores de tabla está configurada en Detener la tarea y no se puede modificar.
Error de entorno
-
Recuento máximo de reintentos: Seleccione esta opción y luego especifique el número máximo de intentos de ejecutar una tarea cuando se produzca un error de entorno recuperable. Después de que la tarea se haya reintentado la cantidad de veces especificada, la tarea se detiene y se requiere intervención manual.
Para no volver a intentar nunca una tarea, desactive la casilla de verificación o especifique "0".
Para volver a intentar ejecutar una tarea un número infinito de veces, especifique "-1"
-
Intervalo entre reintentos (segundos): Utilice el contador para seleccionar o escribir la cantidad de segundos que el sistema debe esperar entre intentos para volver a ejecutar una tarea.
Los valores válidos son 0-2.000.
-
- Aumentar el intervalo de reintentos en caso de interrupciones prolongadas: Seleccione esta casilla de verificación para aumentar el intervalo de reintentos en caso de interrupciones prolongadas. Cuando esta opción está habilitada, se duplica el intervalo entre cada reintento y el siguiente, hasta alcanzar el Intervalo máximo de reintentos (y continúa intentándolo conforme al intervalo máximo especificado).
- Intervalo máximo de reintentos (segundos): Utilice el contador para seleccionar o escribir el número de segundos que se debe esperar entre los intentos de activar una tarea cuando la opción Aumentar el intervalo de reintentos en caso de interrupciones prolongadas está habilitada. Los valores válidos son 0-2.000.
Ajustes en el procesamiento de cambios
Ajustes de descargas de transacciones
-
Descargar transacciones en curso en el disco si:
Los datos de una transacción generalmente se mantienen en la memoria hasta que se confirman por completo en el origen o el destino. Sin embargo, las transacciones que superen la memoria asignada o que no se consignen en el plazo especificado se descargarán al disco.
- El tamaño total de la memoria de transacciones excede (MB): el tamaño máximo que pueden ocupar todas las transacciones en memoria antes de ser descargadas a disco. El valor predeterminado es 1024.
- La duración de las transacciones supera (segundos): el tiempo máximo que cada transacción puede permanecer en memoria antes de ser descargada a disco. La duración se calcula a partir de la hora en que Qlik Talend Data Integration comenzó a capturar la transacción. El valor predeterminado es 60.
Ajuste por lotes
-
Número mínimo de cambios por transacción: el número mínimo de cambios que se ha de incluir en cada transacción. El valor predeterminado es 1000.
Nota informativaLos cambios se aplicarán al objetivo cuando el número de cambios sea igual o mayor que el Número mínimo de cambios por transacción o cuando se alcance el Tiempo máximo para procesar transacciones por lotes antes de aplicarlas (segundos), el valor que ocurra primero. Dado que la frecuencia de los cambios aplicados al destino está controlada por estos dos parámetros, es posible que los cambios en los registros de origen no se reflejen inmediatamente en los registros de destino.
- Tiempo máximo para procesar transacciones por lotes antes de aplicarlas (segundos): el tiempo máximo para recopilar transacciones por lotes antes de declarar un tiempo de espera. El valor predeterminado es 1.
Intervalo
-
Leer los cambios cada (Minutos)
El intervalo entre la lectura de cambios de la fuente en minutos. El rango válido es de 1 a 1440.
Nota informativaEsta opción es solo para tareas que utilizan:
- Data Movement gateway
- El método de actualización Captura de datos de cambios (CDC)
Ver cambios
-
Según el intervalo de extracción delta:Cuando se selecciona esta opción, la tarea de datos comprueba si hay cambios según el Intervalo de extracción delta.
Nota informativaEl intervalo comenzará después de cada "ronda". Una ronda se puede definir como el tiempo que tarda la tarea de datos en leer los cambios de las tablas de origen y enviarlos al destino (como una única transacción). La duración de una ronda varía según el número de tablas y cambios. Así que si especifica un intervalo de 10 minutos y una ronda tarda 4 minutos, entonces el tiempo real entre las comprobaciones de cambios será de 14 minutos.-
Intervalo de extracción delta: La frecuencia con la que se extraerán los deltas de su sistema. El valor predeterminado es cada 60 segundos.
-
-
Según lo programado: cuando se selecciona esta opción, la tarea de datos extraerá el delta una vez y luego se detendrá. Luego continuará ejecutándose según lo programado.
Nota informativaEsta opción solo es relevante si el intervalo entre los ciclos de CDC es de 24 horas o más.Para obtener información sobre la programación:
-
"Tareas de aterrizaje de datos en el lago de datos" en un proyecto de replicación, consulte Programación de CDC para tareas de destino/aterrizaje en un lago de datos
-
Optimización variada
- Tamaño de la caché de sentencias (número de sentencias): El número máximo de sentencias preparadas que se puede almacenar en el servidor para su posterior ejecución (al aplicar cambios al destino). El valor predeterminado es 50. El máximo es 200.
-
ELIMINAR e INSERTAR al actualizar una columna de clave principal Esta opción requiere que el registro complementario completo esté activado en la base de datos de origen.
Nota informativaEste parámetro no está disponible para tareas que utilizan un conector de aplicación SaaS, a menos que sea un conector Lite.
Evolución automática del esquema
Seleccione cómo manejar los siguientes tipos de cambios de DDL en el esquema. Cuando haya modificado las opciones de evolución del esquema, deberá preparar de nuevo la tarea. La tabla siguiente describe las acciones disponibles para los cambios de DDL admitidos.
| Cambio de DDL | Aplicar al objetivo | Ignorar | Suspender tabla | Detener tarea |
|---|---|---|---|---|
| Añadir columna | Sí | Sí | Sí | Sí |
| Renombrar columna | No | No | Sí | Sí |
| Renombrar tabla | No | No | Sí | Sí |
| Cambiar tipo de datos de columnas | No | Sí | Sí | Sí |
| Crear tabla
Si ha utilizado una regla de selección para añadir conjuntos de datos que coinciden con un patrón, se detectarán y añadirán nuevas tablas que cumplan el patrón. |
Sí | Sí | No | No |
Sustitución de caracteres
Puede sustituir o eliminar caracteres de origen en la base de datos de destino y/o puede sustituir o eliminar caracteres de origen que no sean compatibles con un conjunto de caracteres seleccionado.
-
Todos los caracteres deben especificarse como puntos de código Unicode.
- La sustitución de caracteres también se realizará en las tablas de control.
-
Los valores no válidos se indicarán mediante un triángulo rojo en la parte superior derecha de la celda de la tabla. Al pasar el cursor del ratón sobre el triángulo se mostrará el mensaje de error.
-
Cualquier transformación global o a nivel de tabla definida para la tarea se realizará después de que se haya completado la sustitución del carácter.
-
Las acciones de sustitución definidas en la tabla Sustituir o eliminar caracteres de origen se realizan antes de la acción de sustitución definida en la tabla Sustituir o eliminar caracteres de origen no admitidos por el conjunto de caracteres seleccionado.
- La sustitución de caracteres no admite tipos de datos LOB.
Sustituir o eliminar caracteres de origen
Utilice la tabla Sustituir o eliminar caracteres de origen para definir reemplazos para caracteres de origen específicos. Esto puede ser útil, por ejemplo, cuando la representación Unicode de un carácter es diferente en las plataformas de origen y destino. Por ejemplo, en Linux, el carácter menos en el juego de caracteres Shift_JIS se representa como U+2212, pero en Windows se representa como U+FF0D.
| Para | Haga esto |
|---|---|
|
Definir acciones de sustitución. |
|
|
Editar el carácter de origen o del destino especificado |
Haga clic en |
|
Eliminar entradas de la tabla |
Haga clic en |
Sustituir o eliminar caracteres de origen no admitidos por el juego de caracteres seleccionado
Utilice la tabla Caracteres de origen no admitidos por juego de caracteres para definir un único carácter de sustitución para todos los caracteres no admitidos por el juego de caracteres seleccionado.
| Para | Haga esto |
|---|---|
|
Defina o edite una acción de sustitución. |
|
|
Desactivar la acción de sustitución. |
Seleccione la entrada en blanco de la lista desplegable Juego de caracteres. |
Cargar segmentos de conjuntos de datos en paralelo
Durante la carga completa, puede acelerar la carga de grandes conjuntos de datos dividiéndolos en segmentos, que se cargarán en paralelo. Las tablas se pueden dividir por rangos de datos, todas las particiones, todas las subparticiones o particiones específicas.
Para más información, vea Replicar segmentos de conjuntos de datos en paralelo.
Más opciones
Estas opciones no están expuestas en la interfaz de usuario ya que solo son relevantes para versiones o entornos específicos. En consecuencia, no configure estas opciones a menos que se lo indique explícitamente el Soporte de Qlik o la documentación del producto.
Para configurar una opción, simplemente copie la opción en el campo Añadir nombre de característica y haga clic en Añadir. Luego configure el valor o habilite la opción de acuerdo con las instrucciones que recibió.
Programación de CDC para tareas de destino/aterrizaje en un lago de datos
En los siguientes casos de uso, debe definir un intervalo de programación para mantener actualizados los datos de destino:
- Acceder a una fuente de datos sin Data Movement gateway
- Usar un conector de aplicación SaaS que no sea un conector Lite.
- Al capturar cambios de una fuente SAP OData usando la opción Según lo programado.
La programación determina la frecuencia con la que se actualizarán los conjuntos de datos de destino con los cambios realizados en los conjuntos de datos de la fuente. Mientras que la programación determina la frecuencia de actualización, el tipo de conjunto de datos determina el método de actualización. Si un conjunto de datos admite CDC, solo se recuperarán los cambios de ese conjunto de datos y se propagarán a la tabla de destino correspondiente. Si un conjunto de datos no admite CDC (por ejemplo, una vista), los cambios se propagarán recargando todo el conjunto de datos. Con los conectores de aplicaciones SaaS, se creará una única tarea con la capacidad de programar intervalos de CDC e intervalos de recarga durante la incorporación, y más adelante en la configuración de programación de la tarea. Al utilizar otros tipos de conectores (por ejemplo, bases de datos) con el método de actualización de CDC, si algunos de los conjuntos de datos seleccionados admiten CDC y otros no, se crearán dos subtareas distintas: una para recuperar los cambios en los conjuntos de datos que admiten CDC y la otra para recargar los conjuntos de datos que no admiten CDC.
Para cambiar la programación:
-
Abra su proyecto de canalización y a continuación, realice una de las siguientes acciones:
- En la vista de tareas, haga clic en
en una tarea de datos y seleccione Programación.
- En la vista de canalización, haga clic en
en una tarea de datos y seleccione Programación.
- Abra la tarea de replicación y haga clic en el botón de la barra de herramientas Programación.
- En la vista de tareas, haga clic en
- Cambie la configuración de programación según sea necesario y, a continuación, haga clic en Aceptar.
Ejecutar una ejecución perdida para una tarea basada en Data Movement gateway
En ocasiones, un problema de red puede hacer que se pierda la conexión con Data Movement gateway. Si la conexión a Data Movement gateway no se restablece antes de la siguiente ejecución programada, la tarea de datos no podrá ejecutarse según lo previsto. En estos casos, puede elegir si iniciar o no una ejecución inmediatamente después de que se restablezca la conexión.
Las opciones de configuración predeterminadas para todas las Data Movement gateways vienen definidas en el centro de actividades Administración. Puede anular esta configuración para tareas individuales como se describe a continuación.
Para ello
-
Abra su proyecto y realice una de las siguientes acciones:
-
En la vista de tareas, haga clic en
en la tarea de datos y seleccione Programación.
-
En la vista de canalización, haga clic en
en la tarea de datos y seleccione Programación.
-
Abra la tarea de datos y haga clic en el botón de la barra de herramientas Programación.
Se abre el diálogo Programación - <task>.
-
-
Active Utilizar configuraciones personalizadas para esta tarea.
-
En la parte inferior del diálogo, elija una de las siguientes opciones de Ejecutar tareas programadas perdidas.
-
Lo antes posible y según lo programado si es importante ejecutar una tarea antes de la siguiente instancia programada.
-
Según lo programado para ejecutar la tarea en la siguiente instancia programada.
-
-
Guarde su configuración.
Vea también: Ejecutar una ejecución de tarea después de una programación omitida.