Ввод данных из Qlik Replicate
Вы можете воспользоваться всей функциональностью Открытое озеро данных Qlik не отказываясь от существующей Replicate инфраструктуры. Используйте мастер ввода данных для создания конвейера, который обрабатывает данные из выходных данных Qlik Replicate Amazon S3 и сохраняет их в виде таблиц Iceberg с помощью Открытое озеро данных Qlik.
Необходимые условия
Перед запуском мастера подключения данных убедитесь, что вы выполнили следующие предварительные условия.
Qlik Replicate предварительные требования
Настройте задачу Qlik Replicate для перемещения данных в блок Amazon S3 (через конечную точку Amazon S3).
Qlik Replicate предварительные условия задачи
-
Включите только параметры репликации Полная загрузка и/или Сохранить изменения (требуется для поддержания актуальности данных).
-
В параметрах задачи на вкладке Параметры сохранения изменений:
-
Настройте Изменение параметров таблицы следующим образом:
-
Суффикс: __ct
-
Префикс столбца заголовка: header__
-
Параметры DDL: Применить к таблице изменений
-
При UPDATE: Сохранить только после создания образа
-
-
Оставьте Изменение раздела данных отключенным (по умолчанию).
-
-
В параметрах задачи на вкладке Метаданные > Управляющие таблицы, убедитесь, что выбраны управляющие таблицы Применить исключения и История DDL.
Для получения дополнительной информации об этих параметрах см. справку по настройкам задач Qlik Replicate (только английский язык).
Предварительные условия для целевой конечной точки Amazon S3 в Qlik Replicate
На вкладке Общие выполните следующие действия:
- В разделе Файлы метаданных включите параметр Создать файлы метаданных в целевой папке (Replicate ноябрь 2025 г. или ранее) или Создать файл метаданных для каждого файла данных (Replicate май 2026 г. или позднее). Это создаст файлы с .dfm расширением в блоке S3.
- В разделе Атрибуты файла убедитесь, что:
- CSV — это выбранный Формат (по умолчанию)
- Сжимать файлы с помощью установлено на Нет (по умолчанию)
- Обе опции Добавить заголовок метаданных включены (С именами столбцов и С типами данных)
- При настройке параметров хранилища Amazon S3, если ваш блок содержит файлы, не относящиеся к Replicate, рекомендуется указать целевую папку. Это упростит поиск необходимого вывода при подключении данных с помощью Открытое озеро данных Qlik.
Для получения дополнительной информации об этих настройках см. справку по конечной точке назначения Amazon S3 (только английский язык).
Открытое озеро данных Qlik необходимые условия
Коннектор потока данных AWS S3, настроенный для доступа к выводу Amazon S3 Replicate.
Для получения инструкций см.: Поток данных AWS S3.
Как Replicate организует данные в S3
Знакомство со структурой, которую Qlik Replicate использует для организации данных в S3, упростит поиск этих файлов в браузере каталогов, описанном в Создание задачи адаптации ниже.
-
s3://bucket-name/target-path/schema.table/
Содержит полные файлы загрузки и файлы метаданных DFM в последовательном формате, как в следующем примере:
-
LOAD00000001.csv
-
LOAD00000001.dfm
-
LOAD00000002.csv
-
LOAD00000002.dfm
-
-
s3://bucket-name/target-path/schema.table__ct/
Содержит файлы Change Data Capture и файлы метаданных DFM в формате Метки времени, как в следующем примере:
-
20250121-083015000.csv
-
20250121-083015000.dfm
-
20250121-091522000.csv
-
20250121-091522000.dfm
-
Создать задачу по адаптации
Выполните следующие действия для настройки задачи адаптации для данных Replicate:
-
Запустите мастер подключения следующим образом:
-
Новый проект: Нажмите Подключить данные в центре окна проекта.
-
Существующий проект: В правом верхнем углу вашего Открытое озеро данных Qlik проекта щелкните Создать > Подключить данные, чтобы запустить мастер подключения данных.
-
- Введите имя задачи и описание.
- В опциях Источник данных выберите Qlik Replicate. Затем нажмите Далее.
- Выберите AWS S3 Data Stream коннектор, который вы настроили ранее. Затем нажмите Далее.
-
В области Обозреватель каталогов слева выберите корневой каталог, содержащий выходные данные Replicate.
Примечание к подсказкеЕсли вы не указали целевую папку в настройках целевой конечной точки Replicate Amazon S3 (как рекомендовано в предварительных условиях выше), ваш блок может содержать много несвязанных файлов. В этом случае, если вы знаете точный путь, вы можете вставить его непосредственно в поле Путь к корневому каталогу Replicate. - Нажмите Загрузить, чтобы обнаружить доступные таблицы. Любые доступные таблицы будут показаны в списке Выбранные таблицы для регистрации.
- В области Выбор источника данных для обнаружения таблиц справа доступны следующие параметры:
- Включить все текущие таблицы: Включите, чтобы выгрузить все существующие таблицы. Когда эта опция отключена, необходимо выбрать отдельные таблицы.
Удалить исходные файлы после приема: Включите, чтобы окончательно удалить файлы из Replicate S3 блока после их успешной обработки.
После удаления файлов S3 все связанные конвейеры, которые используют те же файлы S3 в качестве источника, станут неактивными и не смогут функционировать. Поэтому включайте эту опцию только в том случае, если вы уверены, что файлы не требуются никаким другим процессом конвейера.
- Нажмите Далее.
- На шаге Тип контента формат файла (CSV) автоматически определяется из ваших данных Replicate. Следующие параметры также доступны:
- Хранилище исторических данных (тип 2): Включите, если вам нужно поддерживать исторические версии записей и вести архив изменений.
- Убедитесь, что события загружены правильно: Вы можете выбрать набор данных, чтобы убедиться, что он содержит правильные данные.
- Нажмите Далее.
- Просмотрите конфигурацию задачи и нажмите Создать, чтобы создать задачу подключения.
-
Нажмите Подготовить, чтобы сохранить в каталоге задачу данных и подготовить ее для выполнения.
Вы можете отслеживать ход подготовки в плитке задачи. По завершении, Подготовка: Успех должно отобразиться.
-
Если вы готовы начать адаптацию данных, нажмите Запустить.
Что произойдет дальше
После активации, задача подключения:
- Начинает мониторинг вашего Replicate S3 блока на предмет изменений данных
- Обнаруживает файлы полной загрузки и CDC (захват изменений данных) из Replicate
- Обрабатывает файлы и создает таблицы Iceberg в Открытое озеро данных Qlik
- Продолжает отслеживать новые данные
- Если включено, автоматически удаляет исходные файлы после успешного импорта
Настройки задач
Чтобы изменить параметры задачи, откройте задачу Onboarding_Qlik_Replicate (имя по умолчанию) и нажмите кнопку Параметры на панели инструментов.
Откроется диалоговое окно Параметры: <task name>.
Вкладка Общие
Эти параметры описаны в шаге 7 Создание задачи промежуточного хранения выше.
-
Автоматически включать все текущие и будущие таблицы
-
Удалить исходные файлы после приема
Вкладка Время выполнения
Изменить Кластер хранилищ в озерах данных
Замечания и ограничения
Общие важные моменты и ограничения
- Операции полной загрузки и перезагрузки могут испытывать задержку обработки, прежде чем данные появятся в таблицах Iceberg. Система ожидает до 15 минут после завершения полной загрузки, чтобы убедиться в полноте файлов. В результате, запуск полных загрузок в Replicate (запланированных или вручную) с интервалом менее 15 минут не поддерживается.
- Пустые Replicate таблицы (таблицы без файлов данных) не обнаруживаются и не регистрируются системой.
- Если вы включите Удалить исходные файлы после приема, задача промежуточного хранения не может быть перезагружена. Чтобы перезагрузить данные, вы должны повторно сгенерировать их в Replicate.
- У Qlik Replicate Таблицы уже загружены. (только английский язык)Начать обработку изменений с (только английский язык) расширенная функция запуска не поддерживается. Когда включен тип 2 (исторические данные), использование этой опции приведет к повреждению таблицы истории.
- Эволюция схемы не поддерживается
CDC против Replicate конвейера
В обычном конвейере, получающем данные из источников CDC, метрика Данные обновлены до всегда показывает текущую Свежесть данных (например, 1 минуту назад). Это связано с тем, что конвейер имеет прямой доступ к журналу транзакций базы данных, что обеспечивает информацию в реальном времени о каждом событии INSERT/UPDATE/DELETE. Однако, в конвейере, получающем данные из Replicate, метрика Данные обновлены до не указывает на текущую Свежесть данных и может фактически создать ложное впечатление, что данные устарели (например, 8 часов назад). Это связано с тем, что конвейер Replicate не имеет прямого доступа к журналу транзакций. Вместо этого, Replicate записывает файлы в блок S3, и конвейер проверяет Метку времени создания файла, чтобы определить Свежесть данных. Итак, если в исходной базе данных какое-то время не было новых изменений, Replicate не будет создавать новый файл, и метка времени Данные обновлены до устареет (создавая ошибочное впечатление, что данные устарели).