Настройки для целей типа «облачное хранилище»
В соответствии с потребностями можно изменить параметры по умолчанию для промежуточного хранения данных в озере.
Общее
Метод обновления
Промежуточное хранение данных можно осуществлять двумя разными способами. После завершения подготовки задачи промежуточного хранения в озере данных режим изменить невозможно.
-
Захват измененных данных (CDC) с использованием таблиц изменений: Задачи промежуточного хранения в озере данных начинаются с полной загрузки (во время которой все выбранные таблицы загружаются в цель). После этого актуальность данных в цели поддерживается с использованием технологии CDC (Change Data Capture, захват данных изменений).
Примечание к информацииCDC (Захват изменений данных) для операций DDL не поддерживается.При работе с Шлюз движения данных, за исключением случаев использования источника приложения SaaS, изменения захватываются из источника практически в режиме реального времени. При работе без Шлюз движения данных или с источниками приложений SaaS, изменения захватываются в соответствии с параметрами планировщика. Для получения дополнительной информации см. раздел Scheduling tasks.
-
Перезагрузка: выполняется полная загрузка данных из выбранных исходных таблиц на целевую платформу, при необходимости создаются целевые таблицы. Полная загрузка выполняется автоматически, когда запускается задача, но при необходимости ее можно выполнять вручную или по расписанию на регулярной основе.
Примечание к информацииЭтот параметр недоступен при использовании коннектора для приложений SaaS.
Папка для использования
Выберите один из следующих вариантов в зависимости от того, в какую папку блока вы хотите записать файлы:
-
Папка по умолчанию
Формат папки по умолчанию: <имя-вашего-проекта>/<имя-вашей-задачи>
-
Корневая папка
Файлы будут записаны в корневую папку блока.
-
Папка
Укажите имя папки. Папка будет создана во время выполнения задачи данных, если она еще не существует.
Примечание к информации Имя папки не может содержать специальные символы (например, @, #, ! и так далее).
Загрузка данных
Атрибуты файла
Формат
По выбору можно создать целевые файлы в формате CSV, JSON или Parquet.
В файле JSON каждая запись представлена одной строкой, как в следующем примере:
{ "book_id": 123, "title": "Alice in Wonderland", "price": 6.99, "is_hardcover": false }
{ "book_id": 456, "title": "Winnie the Pooh", "price": 6.49, "is_hardcover": true }
{ "book_id": 789, "title": "The Cat in the Hat", "price": 7.23, "is_hardcover": true }
См. также: Свойства content-type и content-encoding
- При выборе формата JSON или Parquet следующие поля будут скрыты, так как они релевантны только для формата CSV: Разделитель полей, Разделитель записей, Нулевое значение, Символ кавычек, Escape-символ кавычек и Добавить заголовок метаданных.
- Следующие поля применяются только для формата Parquet: Версия Parquet, Единица измерения метки времени Parquet и Минимальный размер LOB Parquet (КБ).
Для получения информации о сопоставлении типов данных при использовании формата Parquet и об ограничениях см. Mapping from Qlik Cloud data types to Parquet
Разделитель полей
Разделитель, который будет использоваться для разделения полей (столбцов) в целевых файлах. По умолчанию используется запятая.
Пример использования запятой в качестве разделителя:
"mike","male"
Разделители могут быть представлены стандартными символами или шестнадцатеричными значениями. Обратите внимание, что префикс «0x» должен использоваться для обозначения шестнадцатеричного разделителя (например, 0x01 = SOH0x01 = SOH). В полях Разделитель полей, Разделитель записей и Нулевое значение разделитель может состоять из объединенных шестнадцатеричных значений (например, 0x0102 = SOHSTX), а поля Символ кавычек и Escape-символ кавычек могут содержать только одно шестнадцатеричное значение.
Шестнадцатеричное число 0x00 не поддерживается (то есть, поддерживаются только 0x01–0xFF).
Значение null
Строка, которая будет использоваться для указания нулевого значения в целевых файлах.
Пример (где «\n» является разделителем записей, а @ — это нулевое значение):
Разделитель записей
Разделитель, который будет использоваться для разделения записей (строк) в целевых файлах. По умолчанию это новая строка (\n).
Пример:
Символ кавычек
Символ, который будет использоваться в начале и в конце текстового столбца. По умолчанию это символ двойных кавычек ("). Когда столбец, содержащий разделители столбцов, заключен в двойные кавычки, символы разделителей столбцов интерпретируются как фактические данные, а не как разделители.
Пример (где @ является символом кавычек):
Символ изолирования кавычек
Символ, используемый для маскирования символа кавычек в фактических данных. По умолчанию это символ двойных кавычек (").
Пример (где «"» — это символ кавычек, а «\» — escape-символ):
Версия Parquet
Выберите, какую версию использовать в соответствии с тем, какую версию поддерживает целевая платформа. Обратите внимание, что Parquet версии 1.0 поддерживает только единицу измерения метки времени MICRO (МИКРО), а Parquet версии 2.6 поддерживает единицы MICRO и NANO (НАНО).
Единица измерения метки времени Parquet
Когда задана версия Parquet 2.6, выберите MICRO или NANO. Когда задана версия Parquet 1.0, поддерживается только MICRO.
Максимальный размер LOB Parquet (КБ)
По умолчанию максимальный размер LOB составляет 64 КБ, а максимальное значение, которое можно ввести в этом поле ― 10 000 КБ. Для обработки столбцов LOB требуется больше ресурсов, что, в свою очередь, влияет на производительность. Увеличивайте это значение, только если выполняется репликация данных LOB, размер которых превышает 64 КБ, и требуется, чтобы все данные LOB были реплицированы в цель.
Максимальный размер файла
Максимальный размер, по достижении которого файл закрывается (и сжимается, по выбору).
Максимальный размер, по достижении которого файл закрывается. Для загрузки файлов меньшего размера может требоваться меньше времени (в зависимости от сети), благодаря чему повышается быстродействие при использовании вместе с параметром «Параллельное выполнение». Однако, как правило, не рекомендуется загромождать базу данных маленькими файлами.
Сжимать файлы с помощью
Выберите один из вариантов сжатия, чтобы сжимать целевые файлы или NONE (НЕТ) (по умолчанию), чтобы оставить исходный размер. Обратите внимание, что доступные варианты сжатия определяются выбранным форматом файла.
Добавить заголовок метаданных
На свое усмотрение, можно добавить строку заголовка в файлы данных. Строка заголовка может содержать имена исходных столбцов и (или) промежуточные типы данных (то есть Qlik Talend Data Integration).
Пример целевого файла со строкой заголовка, когда установлены флажки С именами столбцов и С типами данных:
Position:DECIMAL(38,0),Color:VARCHAR(10)
1,"BLUE"
2,"BROWN"
3,"RED"
...
Обработка изменений
В этом разделе описаны условные параметры на странице Обработка изменений.
Применять/сохранять изменения в следующих случаях
- Размер файла достигает: укажите максимальный объем накапливаемых изменений данных, по достижении которого файл отправляется в цель.
- Прошедшее время достигает: прошедшее время достигает x.
Файлы метаданных
Когда установлен флажок Создать файлы метаданных в целевой папке, для каждого файла данных создается соответствующий файл метаданных с расширением .dfm в указанной целевой папке. Файл метаданных предоставляет дополнительную информацию о задаче/данных, например тип коннектора источника, имя исходной таблицы, количество записей в файле данных и пр.
Полное описание файла метаданных, а также его возможное применение см. в разделе Описание файла метаданных
Метаданные
Столбцы LOB
Включить столбцы LOB и ограничить размер столбцов до (КБ)
По выбору можно включить столбцы LOB и задать максимальный размер LOB. Большие объекты, чей размер больше максимального, обрезаются.
Сопоставление столбцов JSON
Сопоставите совместимые столбцы JSON источника со столбцами JSON цели
-
Если доступ к источнику осуществляется через Шлюз движения данных, необходимы шлюзы версии 2024.11.70 или выше.
В этом случае столбцы JSON в источнике будут автоматически сопоставлены со столбцами JSON в цели.
Состояние и видимость этой опции определяется следующими факторами:
-
Новые задачи: Эта опция включена по умолчанию, если и источник, и цель поддерживают тип данных JSON.
-
Существующие задачи: Эта опция отключена по умолчанию, если и источник, и цель поддерживают тип данных JSON. Это условие используется, чтобы сохранить обратную совместимость с последующими процессами, например преобразованиями данных, в которых ожидаются целевые данные в формате STRING (что является устаревшим поведением). Можно оставить эту опцию отключенной. Можно также изменить нижестоящие процессы так, чтобы обеспечить совместимость с форматом JSON, после чего включить эту опцию.
-
Новые и существующие задачи: Если тип данных JSON поддерживается только в источнике, эта опция не отображается. Если поддержка JSON появится в цели позже, эта опция появится, но будет отключенной. Это условие используется, чтобы сохранить обратную совместимость с последующими процессами, например преобразованиями данных, в которых ожидаются целевые данные в формате STRING (что является устаревшим поведением).
Управляющие таблицы
Выберите, какие из следующих управляющих таблиц требуется создать в целевой платформе:
- Статус репликации: предоставляет сведения о текущей задаче промежуточного хранения, включая состояние задачи, объем памяти, потребляемой задачей, количество изменений, пока не примененных к платформе данных, и позиция в источнике данных, из которого в данный момент считываются данные.
- Приостановленные таблицы: предоставляет список приостановленных таблиц с указанием причин их приостановки.
- История промежуточного хранения: предоставляет информацию об истории задач, включая количество и объем записей, обработанных во время задачи промежуточного хранения, задержка в конце задачи CDC и многое другое.
- Изменение разделов данных: предоставляет записи разделов, созданных в целевой базе данных вследствие Создание разделов изменений данных. Эти сведения можно использовать для идентификации разделенных данных, требующих дальнейшей обработки.
Для ознакомления с подробным описанием каждой управляющей таблицы см. Управляющие таблицы
Полная загрузка
Настройка производительности
- Максимальное количество таблиц для параллельной загрузки: укажите максимальное количество таблиц, которое можно загружать в таблицу за один раз. Значение по умолчанию — 5.
-
Тайм-аут непротиворечивости транзакций (в секундах): введите количество секунд, в течение которого следует ожидать закрытия открытых транзакций, прежде чем начинать операцию полной загрузки. Значение по умолчанию — 600 (10 минут). Полная загрузка начнется по истечении времени тайм-аута, даже если остались открытые транзакции.
Примечание к информацииЧтобы реплицировать транзакции, открытые на момент начала полной загрузки, но зафиксированные только после истечения тайм-аута, необходимо перезагрузить целевые таблицы. - Скорость фиксации при полной загрузке: максимальное количество событий, передаваемых вместе. Значение по умолчанию — 10 000.
После завершения полной загрузки
Создать первичный ключ или уникальный индекс: установите этот параметр, если требуется отложить создание первичного ключа или уникального индекса на платформе данных до окончания полной загрузки.
Для начальной загрузки
| Использовать кэшированные данные |
Этот параметр позволяет использовать кэшированные данные, которые были прочитаны при создании метаданных с установленным флажком Полное сканирование данных. Это уменьшает накладные расходы, связанные с квотами и использованием API, поскольку данные уже считаны из источника. Все изменения, внесенные после начального сканирования данных, можно получить в режиме «Захват изменений данных (CDC)». |
| Загрузить данные из источника |
Этот параметр выполняет новую загрузку из источника данных. Этот параметр полезен, если:
|
Сохранение изменений
Когда вы выбираете метод обновления "Захват изменений данных (CDC)", изменения в исходных данных будут храниться в таблицах изменений на целевой платформе. Таблицы изменений фиксируют все операции вставки, обновления и удаления из источника, позволяя нижестоящим приложениям обрабатывать изменения инкрементально.
В этом разделе описывается, как настроить параметры таблицы изменений: обработка DDL, хранение образов обновлений и поведение при создании таблиц.
Обработка изменений хранилища доступна только при использовании метода обновления CDC (захват изменений данных).
Любые изменения этих настроек вступят в силу только в следующий раз, когда будет выполнена полная загрузка. Если вы измените эти настройки, пока задача остановлена, необходимо перезагрузить целевые таблицы, чтобы применить изменения.
Для получения подробной информации о таблицах изменений см. Использование таблиц изменений.
Основные настройки
Параметры DDL
Параметры DDL (языка определения данных) определяют, как изменения схемы из источника обрабатываются в таблицах изменений.
-
Применить к таблице изменений: При выборе этой опции система автоматически применяет изменения DDL из исходных таблиц (такие как добавление или удаление столбцов) к соответствующим таблицам изменений. Используйте этот параметр, когда вашим нижестоящим приложениям требуется, чтобы таблицы изменений отражали все изменения схемы из источника.
-
Игнорировать: Система игнорирует все изменения DDL в источнике. Структура таблицы изменений остается неизменной. Используйте этот параметр, когда изменения DDL в источнике не должны влиять на сохраненные изменения, или когда ваша целевая система требует фиксированных схем таблиц.
Расширенные настройки
При обновлении
Настройки ОБНОВЛЕНИЯ определяют, какие данные фиксируются при обновлении исходной записи.
Сохранять предыдущий образ и последующий образ: Система фиксирует как исходные данные (до обновления), так и измененные данные (после обновления). Этот вариант требует больше места для хранения, но предоставляет полную информацию для аудита, позволяя нижестоящим системам сравнивать старые и новые значения или выполнять сложный анализ изменений. Используйте это, когда вашим приложениям требуется полный контекст изменений.
Когда эта опция отключена, система фиксирует только измененные данные (после обновления), а не исходные значения. Эта опция уменьшает требования к хранилищу на целевом объекте. Используйте это, когда вам требуется только текущее состояние измененных записей и не требуются исторические предыдущие значения.
Создание таблицы изменений
Переопределение суффикса таблицы изменений по умолчанию и префикса столбца заголовка
- Суффикс: Укажите строку, которая будет использоваться в качестве суффикса для всех таблиц изменений. Значение по умолчанию ― __ct. Имена таблиц изменений образуются путем добавления суффикса к имени целевой таблицы. Так, например, при использовании суффикса по умолчанию имя таблицы изменений будет HR__ct.
- Префикс столбца заголовка: Укажите строку, которая будет использоваться в качестве префикса для всех столбцов заголовков таблицы изменений. Значение по умолчанию ― header__. Например, при использовании значения по умолчанию столбец заголовка stream_position получит имя header__stream_position.
Определение того, как обрабатываются существующие таблицы изменений при запуске полной загрузки
Когда начинается полная загрузка, эти настройки определяют, как обрабатываются существующие таблицы изменений на целевом объекте. Выберите вариант, который наилучшим образом соответствует вашим требованиям к восстановлению и хранению данных:
-
Удалить и создать: Система полностью удаляет существующую таблицу изменений и создает новую пустую. Все ранее сохраненные изменения удаляются. Используйте это, когда вы хотите начать с чистого листа с каждым циклом полной загрузки.
-
Удалять старые изменения и сохранять новые изменения в существующей таблице изменений: Система удаляет все данные из существующей таблицы изменений, не затрагивая ее структуру или метаданные. Новые изменения хранятся в той же таблице. Используйте это, когда вы хотите сохранить структуру таблицы, но очистить предыдущие изменения.
-
Сохранять старые изменения и записывать новые изменения в существующую таблицу изменений: Система сохраняет все существующие данные и метаданные в таблице изменений. Новые изменения добавляются к существующим данным. Используйте это, когда вам нужно накопить все изменения за несколько циклов полной загрузки.
Создание разделов изменений данных
В стандартной задаче промежуточного хранения (без разделения данных изменений) изменения передаются в цель без соблюдения какого-то определенного порядка. Функция «Создание разделов изменений данных» позволяет согласованно обрабатывать данные изменений из нескольких таблиц. Можно определить продолжительность разделов, а также базовое время разбиения, чтобы тем самым обеспечить общую согласованность разделенных данных (то есть нет частичных транзакций, нет заголовков заказов без строк заказа и т. д.)
Информация о разделах вносится в управляющую таблицу attrep_cdc_partitions в целевой базе данных. Эти сведения можно использовать для идентификации разделенных данных, требующих дальнейшей обработки.
Понимание того, как работает разделение в зависимости от типа источника
-
Из источников базы данных:
В стандартной задаче промежуточного хранения (без разделения данных изменений) изменения передаются в цель без соблюдения какого-то определенного порядка. Функция «Создание разделов изменений данных» позволяет согласованно обрабатывать данные изменений из нескольких таблиц. Можно определить продолжительность разделов, а также базовое время разбиения, чтобы тем самым обеспечить общую согласованность разделенных данных (то есть нет частичных транзакций, нет заголовков заказов без строк заказа и т. д.)
-
CDC по расписанию: Разделы создаются при выполнении экземпляра запланированной задачи. Например, если задача запланирована на запуск в полночь каждый день, и Раздел каждые установлен на 4 часа, то количество созданных разделов будет представлять время, когда были выполнены коммиты за последние 24 часа. Если фиксации произошли в 01:00–03:00 и 16:15–18:00, а базовое время разбиения установлено на 0:00, то будут созданы два раздела: 0:00–04:00 и 16:00–20:00.
-
Непрерывный CDC: Если Раздел кажд. установлено на 4 часа, Replicate создает раздел каждые 4 часа, содержащий все фиксации, которые произошли в течение этого периода. Если не было коммитов в течение 4 часов, то раздел не будет создан за этот период.
-
-
Из источников приложений SaaS:
Задачи, которые извлекают данные из источников приложений SaaS, всегда выполняются по расписанию. Разделы основаны на времени извлечения данных, поскольку понятие коммитов не существует в источниках приложений SaaS. Извлечение данных начинается, когда запускается запланированный экземпляр задачи. Итак, например, если задача запланирована на запуск в полночь каждый день, и Раздел каждые установлено на 4 часа, то количество созданных разделов будет представлять продолжительность извлечения данных. Если извлечение данных занимает меньше двух часов, будет создан один раздел. Но если извлечение занимает шесть часов (например), будут созданы два раздела.
Варианты создания разделов
-
Раздел кажд. — укажите продолжительность каждого раздела (в часах и минутах).
Примечание к информацииРекомендуется задавать продолжительность раздела больше одного часа. Хотя при выборе продолжительности раздела меньше одного часа может уменьшаться задержка, создание большого количества разделов в цели также может повлиять на производительность целевой базы данных (особенно в системах с большим количеством изменений).
Если задача будет возобновлена ДО времени создания последнего раздела, задача промежуточного хранения в озере данных будет записывать информацию в раздел, который уже закрыт.
- Базовое время разбиения — разделы создаются в течение 24-часового периода времени, который рассчитывается в соответствии с базовым временем разбиения, указанным в исходной базе данных в формате UTC. Например, если интервал разделов составляет 8 часов, а базовое время разбиения — 02:00, то будут созданы следующие разделы: 02:00–10:00, 10:00–18:00, 18:00–02:00, но необязательно в таком порядке. Например, если задача запущена в 01:00, то временной интервал первого раздела будет 18:00–02:00. Кроме того, если задача запущена в середине раздела (например, в 04:00), изменения данных будут включены в раздел 02:00–10:00, даже если до 04:00 не было зарегистрировано никаких изменений.
Столбцы заголовка таблицы
Нельзя добавлять или удалять столбцы во время выполнения задачи. Чтобы изменить выбор столбцов, остановите задачу, обновите свои предпочтения, а затем перезагрузите целевые таблицы.
Таблица изменений включает системные столбцы метаданных с настраиваемым префиксом. По умолчанию, эти столбцы имеют префикс header__ (например, header__stream_position, header__operation). Эти столбцы предоставляют информацию о каждой записи изменения, такую как тип операции (INSERT (ВСТАВИТЬ), UPDATE (ОБНОВИТЬ), DELETE (УДАЛИТЬ)) и порядок, в котором произошли изменения.
Можно исключить определенные столбцы заголовков из таблицы изменений, если эти метаданные не нужны. Это сокращает требования к хранилищу на целевой платформе.
Когда Создание разделов изменений данных включен, система автоматически добавляет дополнительный системный столбец с именем partition_name в таблицы изменений и автоматически выбирает его в пользовательском интерфейсе. Так как этот столбец является обязательным для отслеживания разделов, его нельзя исключить.
Обработка ошибок
Ошибки данных
Обработка ошибок данных поддерживается только при использовании метода обновления CDC (захват изменений данных).
Ошибки усечения данных
В случае ошибок усечения данных: выберите, что должно произойти в случае усечения одной или нескольких конкретных записей. Можно выбрать из списка одно из следующих действий:
- Игнорировать: задача продолжается, ошибка игнорируется.
- Приостановить таблицу: задача продолжается, но данные из таблицы с записью, которая вызвала ошибку, переводятся в состояние ошибки и не реплицируются.
- Остановить задачу: задача останавливается, требуется вмешательство вручную.
Другие ошибки данных
В случае других ошибок данных: выберите, что должно произойти в случае ошибки в одной или нескольких конкретных записях. Можно выбрать из списка одно из следующих действий:
- Игнорировать: задача продолжается, ошибка игнорируется.
- Приостановить таблицу: задача продолжается, но данные из таблицы с записью, которая вызвала ошибку, переводятся в состояние ошибки и не реплицируются.
- Остановить задачу: задача останавливается, требуется вмешательство вручную.
Эскалация обработки ошибок данных
Эскалировать обработку при достижении количества других ошибок данных (для каждой таблицы): установите этот флажок, чтобы эскалировать обработку ошибок, когда количество ошибок данных, не связанных с усечением, (в одной таблице) достигает заданного значения. Допустимые значения: 1-10 000.
Действие при эскалации: выберите, что должно произойти в случае эскалации обработки ошибок. Обратите внимание, что доступные действия зависят от действия, выбранного в раскрывающемся списке Для других ошибок данных, описанном выше.
-
Приостановить таблицу (по умолчанию): задача продолжается, но данные из таблицы с записью, которая вызвала ошибку, переводятся в состояние ошибки и не помещаются на промежуточное хранение (landed).
- Остановить задачу: задача останавливается, требуется вмешательство вручную.
Ошибки таблицы
При возникновении ошибки таблицы: Выберите из списка одно из следующих действий:
- Приостановить таблицу(по умолчанию): задача продолжается, но данные из таблицы с записью, которая вызвала ошибку, переводятся в состояние ошибки и не реплицируются
- Остановить задачу: задача останавливается, требуется вмешательство вручную.
Эскалировать обработку при достижении количества ошибок таблицы (для каждой таблицы): установите этот флажок, чтобы эскалировать обработку ошибок, когда количество ошибок таблиц (в одной таблице) достигает заданного значения. Допустимые значения: 1-10 000.
Действие эскалации: для ошибок таблиц задается политика эскалации Остановить задачу , ее нельзя изменить.
Среда
-
Максимальное количество повторных попыток: установите этот флажок, а затем укажите максимальное количество повторных попыток выполнить задачу в случае возникновения исправимых ошибок среды. После того как будет предпринято указанное количество повторных попыток выполнения, задача останавливается, что требует вмешательства вручную.
Чтобы никогда не предпринимать повторных попыток, снимите флажок или задайте значение «0».
Чтобы предпринимать неограниченное количество повторных попыток, задайте значение «-1»
-
Интервал между повторными попытками (секунды): используйте счетчик для выбора или ввода количества секунд ожидания перед повторной попыткой выполнения задачи.
Допустимые значения: 1-2000.
-
- Увеличивать интервал повтора при длительных перерывах в работе: установите этот флажок, чтобы увеличить время перед повтором при длительных перерывах в работе. Когда этот параметр включен, удваивается интервал ожидания перед каждой следующей попыткой повтора, пока не будет достигнуто значение Максимальный интервал повтора (и продолжает повторять попытки через указанный максимальный интервал).
- Максимальный интервал повтора (секунды): используйте счетчик для выбора или ввода количества секунд ожидания между повторными попытками выполнения задачи, когда установлен флажок Увеличивать интервал повтора при длительных перерывах в работе. Допустимые значения: 1-2000.
Настройка обработки изменений
Настройка выгрузки транзакций
-
Выгрузить выполняемые транзакции на диск в следующих случаях:
Данные транзакции обычно сохраняются в памяти до их полной фиксации в источнике или цели. Однако транзакции, размер которых превышает выделенную память или которые не фиксируются в течение заданного периода времени, выгружаются на диск.
- Общий объем памяти для всех транзакций превышает (МБ): максимальный размер, который могут занимать все транзакции в памяти и по достижении которого они выгружаются на диск. По умолчанию установлено значение 1024.
- Длительность транзакции превышает (секунды): максимальное время, в течение которого каждая транзакция может оставаться в памяти, по истечении которого она выгружается на диск. Продолжительность рассчитывается от времени, когда Qlik Talend Data Integration начал захват транзакции. По умолчанию установлено значение 60.
Настройка пакета
-
Минимальное количество изменений для каждой транзакции: минимальное количество изменений, которое должна содержать каждая транзакция. Значение по умолчанию — 1000.
Примечание к информацииИзменения будут применены к цели, когда количество изменений больше или равно значению параметра Минимальное количество изменений для каждой транзакции ИЛИ когда наступает значение Максимальное время для сбора транзакций в пакет до применения (секунды), описанное ниже, — в зависимости от того, что случится раньше. Так как частота применения изменений к цели регулируется этими двумя параметрами, изменения исходных записей могут быть отражены в целевых записях спустя некоторое время.
- Максимальное время для сбора транзакций в пакет до применения (секунды): максимальное время сбора транзакций в пакеты, по истечении которого объявляется тайм-аут. Значение по умолчанию — 1.
Интервал
-
Считывание изменений кажд. (минуты)
Интервал между чтением изменений из источника в минутах. Допустимый диапазон от 1 до 1440.
Примечание к информацииЭтот параметр предназначен только для задач, использующих:
- Шлюз движения данных
- Метод обновления Захват данных изменений (CDC)
Проверить на наличие изменений
-
В соответствии с интервалом извлечения дельты: Если выбран этот параметр, задача данных проверяет изменения в соответствии с интервалом извлечения дельты.
Примечание к информацииИнтервал будет начинаться после каждого «раунда». Раунд можно определить как время, необходимое задаче данных для считывания изменений из исходных таблиц и отправки их в целевую (в виде одной транзакции). Длительность раунда варьируется в зависимости от количества таблиц и изменений. Таким образом, если вы укажете интервал в 10 минут, а раунд занимает 4 минуты, то фактическое время между проверками изменений составит 14 минут.-
Интервал извлечения дельта-изменений: Частота, с которой дельта-изменения будут извлекаться из вашей системы. По умолчанию каждые 60 секунд.
-
-
По расписанию: Если выбран этот параметр, задача данных извлечет дельта-изменения один раз, а затем остановится. Затем она продолжит выполняться по расписанию.
Примечание к информацииЭтот параметр актуален только если интервал между циклами CDC составляет 24 часа или более.Для получения информации о планировании:
-
задачи «Размещение данных в озере данных» в проекте репликации, см. Планирование CDC для задач промежуточного хранения в озере
-
Прочие настройки
- Размер кэша операторов (количество операторов): Максимальное количество подготовленных операторов для хранения на сервере для последующего выполнения (при применении изменений к цели). Значение по умолчанию — 50. Максимальное значение — 200.
-
УДАЛЕНИЕ и ВСТАВКА при обновлении столбца первичного ключа: Этот параметр требует, чтобы в исходной базе данных было включено ведение полных дополнительных журналов.
Примечание к информацииЭта настройка недоступна для задач, использующих коннектор приложений SaaS, если только это не Lite коннектор.
Автоматическая эволюция схемы
Выберите, как обрабатывать следующие типы изменений DDL в схеме. Если параметры эволюции схемы изменены, необходимо подготовить задачу заново. В таблице ниже описано, какие действия доступны для поддерживаемых изменений DDL.
| Изменение DDL | Применить к цели | Игнорировать | Приостановить таблицу | Остановить задачу |
|---|---|---|---|---|
| Добавить столбец | Да | Да | Да | Да |
| Переименовать столбец | Нет | Нет | Да | Да |
| Переименование таблицы | Нет | Нет | Да | Да |
| Изменить тип данных столбца | Нет | Да | Да | Да |
| Создать таблицу
Если использовалось правило выбора для добавления наборов данных, соответствующих шаблону, будут обнаруживаться и добавляться новые таблицы, соответствующие шаблону. |
Да | Да | Нет | Нет |
Подстановка символов
Можно заменять или удалять исходные символы в целевой базе данных и (или) исходные символы, не поддерживаемые выбранным набором символов.
-
Все символы должны быть указаны в виде кодовых точек Юникода.
- Подстановка символов также будет выполняться в управляющих таблицах.
-
Недопустимые значения отмечаются красным треугольником в верхнем правом углу ячейки таблицы. При наведении указателя мыши на треугольник отображается сообщение об ошибке.
-
Любые преобразования на уровне таблицы и глобальные преобразования, определенные для таблицы, будут выполняться после завершения подстановки символов.
-
Действия подстановки, определенные в таблице Подставлять или удалять исходные символы, выполняются до определения действия подстановки в таблице Неподдерживаемые исходные символы по набору символов.
- Подстановка символов не поддерживается для типов данных LOB.
Подстановка или удаление исходных символов
Используйте таблицу Подставлять или удалять исходные символы, чтобы определить замены для конкретных исходных символов. Это может быть полезно, например, когда представление символа в Юникоде отличается на исходной и целевой платформах. Например, на платформе Linux символ «минус» в наборе символов Shift_JIS представлен как U+2212, а в ОС Windows как U+FF0D.
| Параметр управления | Сделайте это |
|---|---|
|
Определите действия подстановки. |
|
|
Изменение указанного исходного или целевого символа |
Нажмите кнопку |
|
Удаление записей из таблицы |
Нажмите кнопку |
Замена или удаление исходных символов, не поддерживаемых выбранным набором символов
Используйте таблицу Неподдерживаемые исходные символы по набору символов, чтобы определить один символ подстановки для всех символов, не поддерживаемых выбранным набором символов.
| Параметр управления | Сделайте это |
|---|---|
|
Определите или измените действие подстановки. |
|
|
Отключите действие подстановки. |
Выберите пустую запись в раскрывающемся списке Набор символов. |
Параллельная загрузка сегментов набора данных
В режиме полной загрузки можно ускорить загрузку больших наборов данных, разбив их на сегменты, которые будут загружаться параллельно. Таблицы можно разделить по диапазонам данных, по всем разделам, по всем подразделам или по конкретным разделам.
Для получения дополнительной информации см. раздел Параллельная репликация сегментов набора данных.
Дополнительные параметры
Эти параметры не раскрываются в пользовательском интерфейсе, так как они применяются только в определенных версиях или средах. Поэтому не следует устанавливать их, если на это нет соответствующих указаний службы поддержки Qlik или в документации по продукту.
Чтобы задать параметр, просто скопируйте его в поле Добавить имя признака и нажмите кнопку Добавить. Затем задайте значение или включите параметр в соответствии с полученными инструкциями.
Планирование CDC для задач промежуточного хранения в озере
В следующих сценариях использования необходимо определить интервал планирования, чтобы поддерживать целевые данные в актуальном состоянии:
- Доступ к источникам данных без Шлюз движения данных
- Использование коннектора SaaS-приложения, который не является Lite-коннектором.
- В случае, когда получение изменений из источника SAP OData производится По графику.
График определяет частоту обновления целевых наборов данных в соответствии с изменениями исходных наборов данных. Тогда как график определяет частоту обновления, тип набора данных определяет метод обновления. Если набор данных поддерживает CDC, только изменения в этом наборе данных будут реплицированы в соответствующую целевую таблицу. Если набор данных не поддерживает CDC, (например, представление), изменения будут распространяться путем перезагрузки всего набора данных. С коннекторами приложений SaaS будет создана одна задача с возможностью планирования интервалов CDC и интервалов перезагрузки во время адаптации, а также позже в настройках расписания задачи. При использовании других типов коннекторов (например, баз данных) с методом обновления CDC, если одни из выбранных наборов данных поддерживают CDC, а другие нет, будут созданы две отдельные подзадачи: одна для получения изменений наборов данных, которые поддерживают CDC, а другая для перезагрузки наборов данных, которые не поддерживают CDC.
Чтобы изменить график, выполните следующие действия.
-
Откройте свой проект конвейера, а затем выполните одно из следующих действий:
- В представлении задач щелкните
рядом с задачей данных и выберите Планирование.
- В представлении конвейера, щелкните
рядом с задачей данных и выберите Планирование.
- Откройте задачу репликации и нажмите кнопку Планирование на панели инструментов.
- В представлении задач щелкните
- Измените параметры планирования , затем нажмите кнопку ОК.
Выполнение пропущенной задачи Шлюз движения данных
Иногда проблемы с сетью могут привести к потере подключения к Шлюз движения данных. Если подключение к Шлюз движения данных не будет восстановлено до следующего запланированного запуска, задача данных не будет выполнена в запланированное время. В таких случаях можно выбрать, нужно ли выполнять задачу сразу после восстановления подключения.
Настройки по умолчанию для всех Шлюз движения данных определяются в центре активности Администрирование. Вы можете переопределить эти настройки для отдельных задач, как описано ниже.
Для этого
-
Откройте проект, а затем выполните одно из следующих действий:
-
В представлении задач щелкните
рядом с задачей данных и выберите Планирование.
-
В представлении конвейера, щелкните
рядом с задачей данных и выберите Планирование.
-
Откройте задачу данных и нажмите кнопку Планирование на панели инструментов.
Откроется диалоговое окно График — <задача>.
-
-
Включите Использовать пользовательские настройки для этой задачи.
-
В нижней части диалогового окна выберите один из следующих вариантов Выполнить пропущенные запланированные задачи.
-
Как можно скорее, а затем по расписанию, если задачу нужно выполнить до следующего срока
-
По графику, чтобы запустить задачу в следующий запланированный срок
-
-
Сохраните настройки.
См. также: Выполнение задачи, не выполненной по графику.