Principes de travail
Ce composant implémente l'algorithme MapReduce, selon les clés de blocs définies dans la table Blocking definition de la vue Basic settings.
Cette implémentation se fait de la façon suivante :
-
Divise les lignes d'entrée en groupes d'une taille donnée.
-
Implémente une classe Map créant un mapping entre chaque clé et une liste d'enregistrements.
-
Mélange les enregistrements afin de regrouper ceux ayant la même clé.
-
Applique, sur chaque clé, l'algorithme défini dans la table Key definition de la vue Basic settings.
Ce composant lit les enregistrements, les compare aux enregistrements maître, regroupe les enregistrements similaires et classe les autres en tant qu'enregistrements maître.
-
Le composant écrit en sortie les groupes d'enregistrements similaires avec leur ID de groupe, la taille de leur groupe, les distances et les scores de correspondance.