Accéder au contenu principal

Effectuer un rapprochement continu à l'aide du tMatchIndexPredict

Ce scénario s'applique uniquement aux produits Talend Platform avec Big Data et à Talend Data Fabric.

Après avoir indexé des données de référence dans Elasticsearch à l'aide du tMatchIndex, il n'est pas nécessaire de recommencer le processus de rapprochement depuis le début. Le composant tMatchIndexPredict compare de nouveaux enregistrements aux données indexées dans Elasticsearch.

Dans cet exemple, une liste de centres d'éducation centres d'éducation de la petite enfance, à Chicago, provenant de dix sources différentes, a été nettoyée, dédoublonnée et indexée dans Elasticsearch. Vous souhaitez effectuer un rapprochement entre de nouveaux enregistrements contenant des informations sur des centres d'éducation centres d'éducation de la petite enfance situés à Chicago, et le jeu de données de référence stocké dans Elasticsearch.

tMatchIndexPredict utilise un modèle permettant de constituer des paires d'enregistrements et un modèle de rapprochement afin de regrouper les enregistrements source et les enregistrements correspondants issus du jeu de données de référence indexé dans Elasticsearch, puis libeller ces paires suspectes.

tMatchIndexPredict écrit en sortie les doublons potentiels et les enregistrements uniques dans des fichiers séparés.

Prérequis :

Cette page vous a-t-elle aidé ?

Si vous rencontrez des problèmes sur cette page ou dans son contenu – une faute de frappe, une étape manquante ou une erreur technique – faites-le-nous savoir.