Accéder au contenu principal Passer au contenu complémentaire

Propriétés du tChunking Standard

Availability-noteBêta

Ces propriétés sont utilisées pour configurer le tChunking s'exécutant dans le framework de Jobs Standard.

Le composant tChunking Standard appartient à la famille IA.

Basic settings

Schema et Edit Schema

Un schéma est une description de lignes. Il définit le nombre de champs (colonnes) à traiter et à passer au composant suivant. Lorsque vous créez un Job Spark, évitez le mot réservé line lors du nommage des champs.

Cliquez sur Sync columns pour récupérer le schéma du composant précédent dans le Job.

Créez le schéma en cliquant sur le bouton Edit Schema. Si le schéma est en mode Repository, trois options sont disponibles :

  • View schema : sélectionnez cette option afin de voir uniquement le schéma.

  • Change to built-in property : sélectionnez cette option pour passer le schéma en mode Built-In et effectuer des modifications locales.

  • Update repository connection : sélectionnez cette option afin de modifier le schéma stocké dans le référentiel et décider de propager ou non les modifications à tous les Jobs.

    Si vous souhaitez propager les modifications uniquement au Job courant, cliquez sur No et sélectionnez à nouveau la métadonnée du schéma dans la fenêtre Repository Content.

 

Built-in : le schéma est créé et conservé localement pour ce composant seulement.

 

Repository : le schéma existe déjà et est stocké dans le Repository. Ainsi, il peut être réutilisé dans des Jobs et projets.

Split column Sélectionnez la colonne à scinder en morceaux.
Chunking method Sélectionnez la méthode dans la liste déroulante :
  • Fixed-size : chaque morceau contient le même nombre de caractères.
  • Token-based : chaque morceau contient le même nombre de jetons.

Les morceaux auront au maximum la taille définie.

Chunk size Saisissez le nombre de caractères ou de jetons devant être contenus dans un morceau.
Lorsque la méthode est Chunking method :
  • Fixed-size. La taille se base sur le nombre de caractères. Par exemple, How are you? équivaut à 12 caractères.
  • Token-based. La taille se base sur le jeton. How are you? équivaut à 4 jetons. How, are, you et ? valent chacun un jeton.
Chunk overlap

Saisissez le nombre de caractères ou de jetons devant se chevaucher entre deux morceaux adjacents. Ce nombre doit être inférieur à la valeur définie dans Chunk size.

Le chevauchement assure la continuité et le contexte entre les morceaux. Il empêche également la segmentation de perturber le flux et la cohérence du texte.

Le chevauchement se base sur la méthode de scission en morceaux, Fixed-size ou Token-based.

Tokenizer Cette option est disponible lorsque l'option Token-based est sélectionnée dans la liste Chunking method.

Sélectionnez le modèle dans la liste déroulante.

Hugging Face peut nécessiter davantage de temps que les autres modèles.

Advanced settings

tStatCatcher Statistics

Cochez cette case pour collecter les métadonnées de traitement du Job, aussi bien au niveau du Job qu'au niveau de chaque composant.

Utilisation

Règle d'utilisation

Ce composant est utilisé comme étape intermédiaire. Il nécessite un flux d'entrée et un flux de sortie.

Cette page vous a-t-elle aidé ?

Si vous rencontrez des problèmes sur cette page ou dans son contenu – une faute de frappe, une étape manquante ou une erreur technique – faites-le-nous savoir.