tChunking
Ce composant scinde de grands textes en morceaux plus petits et plus gérables.
Ce composant n'est pas intégré par défaut à votre Studio Talend. Vous devez l'installer à l'aide du gestionnaire des fonctionnalités. Pour plus d'informations, consultez Installer les fonctionnalités à l'aide du Gestionnaire des fonctionnalités.
Propriétés du tChunking Standard
Ces propriétés sont utilisées pour configurer le tChunking s'exécutant dans le framework de Jobs Standard.
Le composant tChunking Standard appartient à la famille IA.
Basic settings
| Propriétés | Description |
|---|---|
|
Schema et Edit Schema |
|
| Split column | Sélectionnez la colonne à scinder en morceaux. |
| Chunking method | Sélectionnez la méthode dans la liste déroulante :
Les morceaux auront au maximum la taille définie. |
| Chunk size | Saisissez le nombre de caractères ou de jetons devant être contenus dans un morceau. Lorsque la méthode est Chunking method :
|
| Chunk overlap |
Saisissez le nombre de caractères ou de jetons devant se chevaucher entre deux morceaux adjacents. Ce nombre doit être inférieur à la valeur définie dans Chunk size. Le chevauchement assure la continuité et le contexte entre les morceaux. Il empêche également la segmentation de perturber le flux et la cohérence du texte. Le chevauchement se base sur la méthode de scission en morceaux, Fixed-size ou Token-based. |
| Tokenizer | Cette option est disponible lorsque l'option Token-based est sélectionnée dans la liste Chunking method. Sélectionnez le modèle dans la liste déroulante. Hugging Face peut nécessiter davantage de temps que les autres modèles. |
Advanced settings
| Propriétés | Description |
|---|---|
|
tStatCatcher Statistics |
Cochez cette case pour collecter les métadonnées de traitement du Job, aussi bien au niveau du Job qu'au niveau de chaque composant. |
Utilisation
| Conseils d'utilisation | Description |
|---|---|
|
Règle d'utilisation |
Ce composant est utilisé comme étape intermédiaire. Il nécessite un flux d'entrée et un flux de sortie. |