Propriétés du tFileOutputParquet pour Apache Spark Batch
Ces propriétés sont utilisées pour configurer le tFileOutputParquet s'exécutant dans le framework de Jobs Spark Batch.
Le composant tFileOutputParquet Spark Batch appartient à la famille Fichier.
Le composant de ce framework est disponible dans tous les produits Talend avec Big Data nécessitant une souscription et dans Talend Data Fabric.
Basic settings
| Propriétés | Description |
|---|---|
|
Define a storage configuration component |
Sélectionnez le composant de configuration à utiliser pour fournir les informations de configuration pour la connexion au système de fichiers cible, comme HDFS. Si vous laissez cette case décochée, le système de fichiers cible est le système local. Le composant de configuration à utiliser doit se trouver dans le même Job. Par exemple, si vous avez ajouté un composant tHDFSConfiguration dans votre Job, vous pouvez le sélectionner pour écrire le résultat dans un système HDFS donné. |
|
Property type |
|
|
Schema et Edit Schema |
|
|
Folder/File |
Parcourez votre système ou saisissez le chemin d'accès aux données à utiliser dans le système de fichiers. Le bouton pour parcourir votre système ne fonctionne pas en mode Local de Spark. Si vous utilisez les autres modes Yarn de Spark supportés par le Studio Talend avec votre distribution, assurez-vous d'avoir correctement configuré la connexion dans un composant de connexion dans le même Job. Utilisez le composant de configuration relatif au système de fichiers à utiliser. |
|
Action |
Sélectionnez une opération pour l'écriture des données :
|
|
Compression |
Par défaut, l'option Uncompressed est active mais vous pouvez sélectionner Gzip ou Snappy pour compresser les données de sortie. |
|
Fusionner les résultats en un fichier |
Cochez cette case pour fusionner les fichiers finaux part en un fichier et mettre ce fichier dans un répertoire spécifié. Une fois cochée, saisissez le chemin d'accès ou parcourez votre système jusqu'au dossier dans lequel stocker le fichier fusionné. Ce répertoire est automatiquement créé s'il n'existe pas. Les cases suivantes sont utilisées pour gérer les fichiers sources et cible :
Si vous cochez la case Define column partition dans la vue Advanced settings, vous devez décocher la case Remove source dir. Le partitionnement s'applique uniquement aux fichiers non fusionnés. |
Advanced settings
| Propriétés | Description |
|---|---|
| Define column partitions | Cochez cette case et renseignez la table qui apparaît en utilisant les colonnes du schéma des données entrantes. Les enregistrements des colonnes sélectionnées sont utilisés comme clés pour partitionner vos données. |
| Sort columns alphabetically | Cochez cette case pour trier les colonnes du schéma par ordre alphabétique. Si vous laissez cette case décochée, ces colonnes conservent l'ordre défini dans l'éditeur du schéma. |
| Do not convert dates to UTC | Cochez cette case pour stocker les dates utilisant le fuseau horaire local de votre session Spark. Comme Parquet ne contient pas d'information relative au fuseau horaire, si vous laissez cette case décochée, le fuseau horaire UTC est utilisé par défaut. |
Utilisation
| Conseils d'utilisation | Description |
|---|---|
|
Règle d'utilisation |
Ce composant est utilisé en tant que composant de fin et requiert un lien d'entrée. Ce composant, ainsi que la Palette Spark Batch à laquelle il appartient, ne s'affiche que lorsque vous créez un Job Spark Batch. Notez que, dans cette documentation, sauf mention contraire, un scénario présente uniquement des Jobs Standard, c'est-à-dire des Jobs Talend traditionnels d'intégration de données. |
|
Connexion à Spark |
Dans l'onglet Spark Configuration de la vue Run, définissez la connexion à un cluster Spark donné pour le Job complet. De plus, puisque le Job attend ses fichiers .jar dépendants pour l'exécution, vous devez spécifier le répertoire du système de fichiers dans lequel ces fichiers .jar sont transférés afin que Spark puisse accéder à ces fichiers :
Cette connexion fonctionne uniquement pour le Job dans lequel vous l'avez définie. |