Accéder au contenu principal

tMatchPairing

Ce composant vous permet de calculer des paires de doublons suspects de toute source de données, y compris dans de grands volumes dans le contexte de l'apprentissage automatique dans Spark.

Ce composant lit un jeu de données ligne par ligne, exclut les lignes uniques et les doublons exacts dans des fichiers séparés. Il calcule des paires d'enregistrements suspects selon la définition d'une clé de bloc. Il crée un échantillon d’enregistrements suspects représentatif du jeu de données.

Vous pouvez libeller des paires suspectes manuellement ou les charger dans une campagne de type Grouping déjà définie sur le serveur de Talend Data Stewardship.

Ce composant s'exécute avec Apache Spark versions 1.6.0 et supérieures.

Cette page vous a-t-elle aidé ?

Si vous rencontrez des problèmes sur cette page ou dans son contenu – une faute de frappe, une étape manquante ou une erreur technique – faites-le-nous savoir.