P
Parsyn
/Docs
Retour à l'accueil

Gestion des datasets

Upload, validation et preparation des datasets pour le fine-tuning. Couvre les formats pris en charge, le pipeline d'upload et les operations de traitement integrees.

Formats pris en charge

JSONL (recommande)

Un objet JSON par ligne. Le format privilegie pour l'instruction tuning car il represente naturellement les paires prompt/completion et prend en charge les structures imbriquees.

{"prompt": "Translate to French: Hello, how are you?", "completion": "Bonjour, comment allez-vous ?"}
{"prompt": "Summarize: The cat sat on the mat.", "completion": "A cat rests on a mat."}
{"prompt": "Extract the entity: John works at Google.", "completion": "Person: John, Organization: Google"}

Pour du fine-tuning au format chat, utilisez un champ messages avec un formatage par roles :

{"messages": [{"role": "system", "content": "You are a helpful assistant."}, {"role": "user", "content": "What is Python?"}, {"role": "assistant", "content": "Python is a high-level programming language."}]}
{"messages": [{"role": "user", "content": "Explain recursion."}, {"role": "assistant", "content": "Recursion is when a function calls itself to solve a problem by breaking it into smaller instances of the same problem."}]}

CSV

Format standard a valeurs separees par des virgules. Les en-tetes de colonnes sont obligatoires.

prompt,completion
"What is a neural network?","A neural network is a computational model inspired by biological neurons."
"Define overfitting.","Overfitting is when a model memorizes training data instead of learning general patterns."

Les champs CSV contenant des virgules, des retours a la ligne ou des guillemets doivent etre correctement echappes. Parsyn verifie cela lors de l'etape de validation, mais les CSV mal formes seront rejetes.

Parquet

Format colonnaire avec compression efficace. Recommande pour les datasets de plus de 1 Go. Meme structure de colonnes : prompt/completion ou messages.

Importer un dataset

Rendez-vous sur la page Datasets et cliquez sur Upload Dataset. Dans la fenetre :

  1. Saisissez un nom pour votre dataset
  2. Ajoutez une description facultative
  3. Selectionnez votre fichier (.jsonl, .json, .csv ou .parquet) ou glissez-deposez-le dans la zone de fichier. La taille maximale est de 10 Go.
  4. Cliquez sur Upload

Le fichier est importe via un pipeline multipart. Les fichiers volumineux sont automatiquement decoupes en morceaux, reassembles cote serveur et stockes dans S3. Si un upload est interrompu, vous pouvez relancer sans perdre la progression.

Une fois importe, le dataset apparait dans votre liste avec son nom, un badge de format, sa taille et le nombre de lignes.

Vue detail d'un dataset

Cliquez sur n'importe quel dataset dans la liste pour ouvrir sa page de detail. La vue detail comporte plusieurs onglets :

  • Vue d'ensemble : Nom, description, format, taille, nombre de lignes, date de creation.
  • Schema : Noms et types des champs detectes.
  • Distributions : Graphiques montrant la distribution du nombre de tokens et des valeurs des champs.
  • Validation : Rapport de qualite des donnees avec les eventuels problemes detectes.
  • Apercu : Echantillon de lignes du dataset sous forme de tableau.

Statistiques

Sur la page de detail du dataset, cliquez sur Compute Statistics pour lancer une analyse. Celle-ci s'execute de maniere asynchrone en arriere-plan. La page interroge la progression et affiche les resultats une fois termines.

Les statistiques incluent :

  • Nombre total d'exemples
  • Longueur moyenne, minimale et maximale des prompts/completions (en caracteres et en tokens)
  • Distributions des champs pour les donnees categorielles
  • Nombre de doublons

Les resultats apparaissent dans l'onglet Distributions avec des graphiques visuels.

Operations sur les donnees

Depuis la page de detail du dataset, ouvrez l'assistant de preprocessing pour executer des operations sur vos donnees. Chaque operation cree un nouveau dataset, en conservant l'original intact. Il vous sera demande de nommer le dataset de sortie.

Deduplication

Supprime les exemples en double. Deux modes :

  • Exacte : Supprime les lignes identiques caractere par caractere.
  • Approximative : Supprime les lignes au-dessus d'un seuil de similarite (90 % par defaut). Utile pour reperer les quasi-doublons avec des variations mineures.

Normalisation

Nettoie le formatage du texte. Les options disponibles sont :

  • Supprimer les espaces en debut et fin de chaine
  • Regrouper les espaces consecutifs
  • Convertir en minuscules
  • Supprimer les URLs
  • Supprimer les balises HTML

Split train/validation

Divise le dataset en ensembles de training et de validation distincts (et eventuellement un ensemble de test). Configurez les ratios (la somme doit faire 100 %), activez ou desactivez le melange aleatoire, et definissez un seed pour la reproductibilite.

Conversion de format

Convertit entre JSONL, CSV et Parquet. Les six directions sont prises en charge.

Echantillonnage

Cree un dataset reduit a partir d'un echantillon aleatoire. Definissez soit un nombre fixe d'exemples, soit un pourcentage des donnees d'origine. Pratique pour des experiences rapides avant de lancer un training complet.

Normalisation du schema

Fait correspondre les noms de champs non standards (input/output, instruction/response, etc.) au schema standard prompt/completion attendu par le pipeline de training.

Lancez la deduplication et la normalisation avant le split. Ainsi, votre ensemble de validation est propre et ne contient pas de doublons provenant de l'ensemble de training.

Bonnes pratiques

Qualite des donnees

  • Soyez coherent. Meme format et meme style dans tous les exemples. Si certaines completions se terminent par un point et d'autres non, choisissez une convention et tenez-vous-y.
  • Variez les exemples. 100 exemples diversifies sont souvent plus performants que 1000 exemples similaires pour l'instruction tuning.
  • Verifiez la contamination. Si votre jeu d'evaluation chevauche les donnees de training, vos metriques seront trompeuses.

Dimensionnement

  • Instruction tuning avec LoRA : entre 500 et 5 000 exemples est une bonne fourchette de depart.
  • Full fine-tuning : 10 000 exemples ou plus pour constater une amelioration significative.
  • La qualite compte plus que la quantite. Un petit dataset propre l'emporte sur un grand dataset bruite.

Format de fichier

  • Utilisez le JSONL pour les datasets de moins de 1 Go. Lisible, facile a deboguer.
  • Utilisez le Parquet pour les grands datasets. Meilleure compression, chargement plus rapide.
  • Evitez le CSV pour les donnees complexes (objets imbriques, texte multi-lignes).