tReservoirSampling
Ce composant extrait un échantillon de données aléatoires d'un ensemble de Big Data.
Le tReservoirSampling extrait un échantillon du jeu de données d'entrée afin que les résultats du profiling de cet échantillon de données soient uniformes et homogènes par rapport à ceux du profiling de l'intégralité du jeu de données.
En mode local, les versions 2.0, 2.3, 2.4 et 3.0 d'Apache Spark sont supportées.
Pour plus de technologies supportées par Talend, consultez Composants Talend.
Selon le produit Talend que vous utilisez, ce composant peut être utilisé dans un framework de Jobs, dans plusieurs, ou dans tous les frameworks :
-
Standard : consultez Propriétés du tReservoirSampling Standard.
Le composant de ce framework est disponible dans Talend Data Management Platform, Talend Big Data Platform, Talend Real Time Big Data Platform, Talend Data Services Platform et dans Talend Data Fabric.
-
Spark Batch : consultez Propriétés du tReservoirSampling pour Apache Spark Batch.
Le composant de ce framework est disponible dans tous les produits Talend Platform avec Big Data et dans Talend Data Fabric.