Accéder au contenu principal Passer au contenu complémentaire

Définir les paramètres de connexion à Databricks Serverless avec Spark Universal

Availability-noteBêta

Pourquoi et quand exécuter cette tâche

Le Studio Talend se connecte au calcul Databricks Serverless pour exécuter votre Job Spark Batch. Le calcul Serverless est entièrement géré par Databricks et ne nécessite aucune configuration de cluster.

Avant de commencer, vérifiez que les conditions suivantes sont bien remplies :
  • Unity Catalog est activé dans l'espace de travail Databricks.
  • L'espace de travail se trouve dans une région qui supporte le calcul Serverless. Pour plus d'informations, consultez la Serverless compute (uniquement en anglais) dans la documentation Databricks.
  • Le profil de conformité PCI-DSS n'est pas activé dans l'espace de travail.
Note InformationsImportant : Databricks Serverless est disponible sur les fournisseurs de Cloud AWS et Azure uniquement.

Procédure

  1. Cliquez sur la vue Run (Exécuter) sous l'espace de modélisation graphique, puis sur la vue Spark configuration (Configuration Spark).
  2. Sélectionnez Built-in dans la liste déroulante Property type.
    Si vous avez déjà configuré les paramètres de connexion dans le Repository, comme expliqué dans Centraliser une connexion à Hadoop, vous pouvez réutiliser ces paramètres. Pour ce faire, sélectionnez Repository (Référentiel) dans la liste déroulante Property type (Type de propriété), cliquez sur [...] pour ouvrir la boîte de dialogue Repository Content (Contenu du référentiel) et sélectionnez la connexion à Hadoop à utiliser.
    Note InformationsConseil : Configurer la connexion dans le Repository vous permet d'éviter de configurer cette connexion chaque fois que vous en avez besoin dans la vue Spark Configuration de vos Jobs Spark. Les champs sont automatiquement renseignés.
  3. Sélectionnez Universal (Universelle) dans la liste déroulante Distribution, la version Spark de votre choix dans la liste déroulante Version et Databricks Serverless dans la liste déroulante Runtime mode/environment (Mode/environnement du Runtime).
  4. Saisissez les informations simples de configuration :
    Paramètre Utilisation
    Parallelize output files writing (Paralléliser l'écriture des fichiers de sortie) Cochez cette case pour permettre au Job Spark Batch d'exécuter plusieurs threads en parallèle lors de l'écriture de fichiers de sortie. Cette option améliore les performances du temps d'exécution.

    Lorsque vous laissez cette case décochée, les fichiers de sortie sont écrits en séquence dans un seul thread.

    Au niveau des sous-Jobs, chacun est traité en séquence. Seul le fichier de sortie contenu dans le sous-Job est parallélisé.

    Cette option est disponible uniquement pour les Jobs Spark Batch contenant les composants de sortie suivants :
    • tAvroOutput
    • tFileOutputDelimited (uniquement lorsque la case Use dataset API in migrated components (Utiliser l'API Dataset dans les composants migrés) est cochée)
    • tFileOutputParquet
    Note InformationsImportant : Pour éviter les problèmes de mémoire au cours de l'exécution du Job, vous devez prendre en compte la taille des fichiers en cours d'écriture et la capacité de l'environnement d’exécution utilisant ce paramètre.
  5. Renseignez les paramètres Databricks configuration :
    Paramètre Utilisation
    Catalog (Catalogue) Saisissez le nom de catalogue de Unity Catalog. Unity Catalog est obligatoire pour Databricks Serverless.
    Schema (Schéma) Saisissez le nom de schéma dans le catalogue Unity Catalog.
    Volume Saisissez le nom du volume Unity Catalog utilisé pour stocker les dépendances de Jobs lors de l'exécution.
    Endpoint Saisissez l'adresse URL de votre espace de travail Databricks.
    Authentication mode (Mode d'authentification) Sélectionnez la méthode d'authentification à Databricks :
    • Personal access token (Jeton d'accès personnel) : authentification via un Jeton d'accès personnel. Authentication token (Jeton d'authentification), saisissez le jeton généré pour votre compte d'utilisateur Databricks.
    • OAuth2 : authentification via OAuth2. Dans les champs Client ID et Secret ID, saisissez les identifiants clients générés pour votre principal de service Databricks.
    Dependencies folder (Dossier des dépendances) Saisissez le répertoire utilisé pour stocker les dépendances liées aux Jobs lors de l'exécution, avec une barre oblique de fin. Par exemple, /jars/.
    Poll interval when retrieving Job status (in ms) (Intervalle d'interrogation lors de la récupération du statut du Job (en ms)) Saisissez l'intervalle de temps en millisecondes à la fin duquel le Studio Talend demande à Databricks le statut de votre Job.
    Job timeout (in ms) (Délai avant expiration du Job (en ms)) Saisissez le temps maximal en millisecondes pendant lequel un Job est autorisé à s'exécuter avant qu'il n'y soit mis fin. Définissez cette valeur sur 0 pour désactiver le délai avant expiration.
    Parallelism for joins/aggregations (Parallélisme pour jointures/agrégations) Saisissez le nombre de partitions à utiliser pour les jointures et les agrégations. Utilisez auto pour laisser Databricks déterminer automatiquement la valeur optimale.
    Max partition size for file reads (Taille de partition maxi. des lectures de fichiers) Saisissez la taille maximale en octets d'une partition lors de la lecture de fichiers.
    Fetch driver logs after run (Récupérer les logs du pilote après l'exécution) Cochez cette case pour récupérer les logs du pilote Spark auprès de Databricks après la fin de l'exécution du Job.
    Enable job queueing (Activer la mise en file d'attente des Jobs) Cochez cette case pour permettre la mise en file d'attente des Jobs lorsque la fonctionnalité de calcul Serverless n'est pas immédiatement disponible.
    Set a budget policy (Définir une politique budgétaire) Cochez cette case pour appliquer une politique budgétaire Databricks afin de contrôler le coût de vos charges de travail Serverless. Si cette case est cochée, saisissez l'ID de politique dans le champ qui apparaît.
    Enable ACL (Activer l'ACL) Cochez cette case pour utiliser des listes de contrôle d'accès (ACL) afin de configurer les autorisations relatives aux objets au niveau des espaces de travail ou des comptes.
    Environment name (Nom de l'environnement) Saisissez le nom de votre environnement Serverless pour utiliser votre Job.
    Environment version (Version de l'environnement) Saisissez la version de l'environnement Serverless. Les versions supportées sont 4 et 5.

Résultats

Les détails de connexion de Databricks Serverless sont complets. Vous pouvez exécuter votre Job Spark Batch à partir du calcul Serverless.

Cette page vous a-t-elle aidé ?

Si vous rencontrez des problèmes sur cette page ou dans son contenu – une faute de frappe, une étape manquante ou une erreur technique – faites-le-nous savoir.