tMatchPairing
Ce composant vous permet de calculer des paires de doublons suspects de toute source de données, y compris dans de grands volumes dans le contexte de l'apprentissage automatique dans Spark.
Ce composant lit un jeu de données ligne par ligne, exclut les lignes uniques et les doublons exacts dans des fichiers séparés. Il calcule des paires d'enregistrements suspects selon la définition d'une clé de bloc. Il crée un échantillon d’enregistrements suspects représentatif du jeu de données.
Vous pouvez libeller des paires suspectes manuellement ou les charger dans une campagne de type Grouping déjà définie sur le serveur de Talend Data Stewardship.
En mode local, les versions 2.4.0 et supérieures d'Apache Spark sont supportées.
Ce composant n'est pas intégré par défaut à votre Studio Talend. Vous devez l'installer à l'aide du gestionnaire des fonctionnalités. Pour plus d'informations, consultez Installer les fonctionnalités à l'aide du Gestionnaire des fonctionnalités.