Propriétés du tChunking Standard
Ces propriétés sont utilisées pour configurer le tChunking s'exécutant dans le framework de Jobs Standard.
Le composant tChunking Standard appartient à la famille IA.
Basic settings
Schema et Edit Schema |
Un schéma est une description de lignes. Il définit le nombre de champs (colonnes) à traiter et à passer au composant suivant. Lorsque vous créez un Job Spark, évitez le mot réservé line lors du nommage des champs. Cliquez sur Sync columns pour récupérer le schéma du composant précédent dans le Job. Créez le schéma en cliquant sur le bouton Edit Schema. Si le schéma est en mode Repository, trois options sont disponibles :
|
|
Built-in : le schéma est créé et conservé localement pour ce composant seulement. |
|
Repository : le schéma existe déjà et est stocké dans le Repository. Ainsi, il peut être réutilisé dans des Jobs et projets. |
Split column | Sélectionnez la colonne à scinder en morceaux. |
Chunking method | Sélectionnez la méthode dans la liste déroulante :
Les morceaux auront au maximum la taille définie. |
Chunk size | Saisissez le nombre de caractères ou de jetons devant être contenus dans un morceau. Lorsque la méthode est Chunking method :
|
Chunk overlap |
Saisissez le nombre de caractères ou de jetons devant se chevaucher entre deux morceaux adjacents. Ce nombre doit être inférieur à la valeur définie dans Chunk size. Le chevauchement assure la continuité et le contexte entre les morceaux. Il empêche également la segmentation de perturber le flux et la cohérence du texte. Le chevauchement se base sur la méthode de scission en morceaux, Fixed-size ou Token-based. |
Tokenizer | Cette option est disponible lorsque l'option Token-based est sélectionnée dans la liste Chunking method. Sélectionnez le modèle dans la liste déroulante. Hugging Face peut nécessiter davantage de temps que les autres modèles. |
Advanced settings
tStatCatcher Statistics |
Cochez cette case pour collecter les métadonnées de traitement du Job, aussi bien au niveau du Job qu'au niveau de chaque composant. |
Utilisation
Règle d'utilisation |
Ce composant est utilisé comme étape intermédiaire. Il nécessite un flux d'entrée et un flux de sortie. |