Un jeu de données créatif peut contenir des millions d'images, de vidéos, de modèles ou d'enregistrements multimodaux, et pourtant faire échouer un projet d'IA. Le nombre de fichiers n'indique pas à une équipe produit si les données correspondent à la tâche ciblée, couvrent les conditions critiques, contiennent des informations indépendantes, comportent des étiquettes et des métadonnées fiables, ou soutiennent un ensemble d'évaluation digne de confiance.

La qualité d'un jeu de données pour l'IA dépend donc de la tâche. La question pratique est de savoir si le jeu de données satisfait aux exigences définies et si les éléments de preuve étayant cette conclusion peuvent être examinés. Pour les systèmes créatifs, ces exigences vont souvent au-delà de l'intégrité des fichiers pour inclure la couverture visuelle, la structure du design, les relations entre les sources, les informations temporelles, les métadonnées, la provenance, les droits et le comportement des modèles en aval.

Ce guide explique comment évaluer ces propriétés avant l'acquisition ou l'entraînement, comment séparer un premier examen de l'acceptation formelle du jeu de données, et comment tester si une modification des données améliore réellement le système visé.

Table of contents:

Qualité d'un jeu de données d'IA en une phrase

Jeu de données d'entraînement pour l'IA La qualité est le degré auquel un jeu de données satisfait aux exigences d'une tâche définie pour les jeux de données IA et leur environnement de déploiement, étayée par des preuves que ces exigences sont effectivement satisfaites.

Les six questions à poser en premier

Question
Ce que cela établit
Preuves typiques
Adéquation
Les données représentent-elles la tâche cible et les conditions de déploiement ?
Matrice des exigences, revue d'échantillons spécifiques à la tâche, vérifications des catégories et des formats
Couverture
Les conditions requises sont-elles représentées au niveau de détail nécessaire ?
Couverture par sous-ensemble, fréquences des catégories, présence de cas limites, concentration des sources
Intégrité
Les fichiers, étiquettes, métadonnées et relations sont-ils utilisables ?
Contrôles d'intégrité, QA des annotations, validation des métadonnées, conformité technique
Indépendance
Quelle quantité d'information réellement indépendante existe-t-il ? Les partitions d'évaluation sont-elles indépendantes ?
Groupes de sources, familles de templates, lignée des dérivés, chevauchement entre partitions
Traçabilité
Peut-on retracer la provenance, les versions, les droits et l'historique de traitement ?
Registres de provenance, registres de droits, historique des versions, documentation
Impact sur le modèle
La modification des données améliore-t-elle le modèle visé ?
Intervention contrôlée, métriques en aval, résultats sur des tranches critiques, coûts et effets secondaires

1. Séparer la sélection, l'acceptation du jeu de données et la validation du modèle

Il s'agit de trois décisions différentes. Un examen rapide peut inciter un acheteur à approfondir ses investigations. L'acceptation d'un jeu de données détermine si le corpus livré répond aux exigences convenues. La validation du modèle consiste à déterminer si un jeu de données spécifique ou une intervention sur les données améliore le système.

Étape
Question
Preuves
Examen initial
Y a-t-il suffisamment de preuves pour justifier une évaluation plus approfondie ?
Revue de la documentation, inspection d'échantillons, vérifications structurelles de base, obstacles évidents
Acceptation du jeu de données
Le jeu de données livré satisfait-il aux exigences définies ?
Validation de l'ensemble du jeu de données ou d'un échantillon convenu : seuils, preuves de provenance et de droits, vérifications des partitions
Validation du modèle
Les données ou l'intervention sur les données améliorent-elles le système cible ?
Expérience d'entraînement/évaluation contrôlée : métriques globales et par tranche, analyse des coûts et des effets secondaires

Un jeu de données peut obtenir l'acceptation technique sans démontrer qu'il apporte de la valeur au modèle. Une amélioration du modèle peut valider une intervention particulière sur les données sans prouver que tous les fichiers, étiquettes, champs de métadonnées ou enregistrements de droits sont corrects.

2. Définir les exigences du jeu de données avant d'inspecter les données

Trois professionnels passent en revue une présentation sur la création d'un jeu de données d'IA créative de haute qualité, abordant les objectifs du produit, les exigences du jeu de données, les preuves et les normes de qualité.

Commencez par l'objectif du produit ou du modèle, puis traduisez-le en exigences observables pour le jeu de données. Cela évite l'échec courant dans les achats où un fournisseur présente un nombre impressionnant d'actifs avant que l'acheteur n'ait défini ce que le système doit apprendre.

Objectif du produit
Exigences du jeu de données
Preuves à demander
Génération de gabarits
Relations de mise en page, composants, typographie, variantes de rapport d'aspect, segmentations par famille
Métadonnées structurées des gabarits, relations entre variantes, identifiants de famille, échantillons représentatifs
Recherche visuelle
Couverture sémantique, distinctions visuelles utiles
Légendes ou balises, taxonomie, couverture des catégories, analyse de similarité
Légendage d'images / entraînement de VLM
Alignement fiable image-texte, couverture linguistique
Enregistrements appariés, méthode d'annotation, segments linguistiques, preuves d'arbitrage
Automatisation de la conception
Composition, hiérarchie, style, intention créative, structure des composants
Analyse des familles de design, métadonnées des composants, couverture représentative
Compréhension vidéo
Intégrité temporelle, contexte de la séquence, variation des activités
Métadonnées au niveau du clip, identifiants de séquence, vérifications de l'intégrité des images
Génération d'images
Couverture visuelle et sémantique, diversité des sources, contrôle des œuvres dérivées
Groupes de sources, légendes, analyse de similarité, preuves de droits

L'exigence doit être testable. “Visuels de haute qualité” est trop vague pour un cahier des charges. “Les formats requis sont présents, le taux de fichiers corrompus est inférieur au seuil convenu, et la répartition des évaluations est indépendante pour chaque famille de modèles” donne à l'acheteur quelque chose de mesurable.

3. Mesurer la couverture par rapport à l'utilisation cible

Un professionnel examine le tableau de bord de couverture d’un jeu de données pour l’IA créative, qui montre les catégories, les types de contenu, les cas limites, les variations de mise en page et les métriques de santé.

La couverture concerne la présence des conditions dont le système a besoin. Elle se distingue de l'équilibre, qui porte sur les fréquences, et du biais, qui renvoie aux propriétés systématiques d'un jeu de données susceptibles de favoriser des comportements inappropriés ou nuisibles.

Type de couverture
Question
Exemple
Couverture de fréquence
À quelle fréquence une condition se produit-elle, et comment cela se compare-t-il à l'environnement cible ?
Répartition des plateformes, fréquences par catégorie, répartition linguistique
Couverture des exigences
Les conditions critiques sont-elles présentes ?
Catégories commerciales requises, formats, types de mise en page
Couverture des cas limites
Les cas rares mais importants peuvent-ils être évalués ?
Occlusion, mises en page inhabituelles, éclairage difficile, scénarios peu courants

Lorsque la distribution en production est connue, comparez les fréquences du jeu de données à cette distribution. Si elle n'est pas connue, définissez les sous-ensembles requis et la couverture minimale plutôt que d'inventer des pourcentages. Les distributions d'entraînement, de validation et d'évaluation peuvent légitimement différer car elles répondent à des questions différentes.

4. Maintenez la couverture, la représentation et le biais distincts

La couverture décrit ce qui est présent. La représentation décrit comment des populations, contextes ou catégories pertinents apparaissent par rapport à l'utilisation prévue. Le biais fait référence aux propriétés systémiques d'un jeu de données qui peuvent contribuer à un comportement inapproprié ou nuisible du modèle. Les termes se chevauchent, mais ils ne sont pas interchangeables.

Le déséquilibre des classes n'est pas automatiquement un biais du jeu de données. Des effectifs égaux ne sont pas nécessairement corrects non plus. La bonne répartition dépend de l'objectif du produit, du contexte de déploiement et des modes de défaillance que l'équipe doit contrôler.

Pour les données visuelles, n'inférez pas de caractéristiques démographiques sensibles à partir de l'apparence simplement pour remplir un tableau de bord. Lorsque des attributs démographiques ou contextuels sont nécessaires, utilisez une méthode de mesure légitime et documentée et expliquez pourquoi cet attribut importe pour la tâche.

5. Mesurer les variations significatives et l'indépendance des sources

Un designer examine les supports créatifs imprimés, en comparant les créations originales, dérivées, localisées et indépendantes afin d'évaluer la qualité et la cohérence du jeu de données.

« diversité » est trop vague pour servir d'indicateur unique de qualité. Précisez quelles dimensions de variation importent et mesurez-les séparément. Les jeux de données créatifs peuvent nécessiter une analyse des familles de gabarits, des familles de mise en page, des rapports d'aspect, de la typographie, de la langue, des clusters visuels, du contenu statique vs contenu en mouvement, du mélange de catégories, de la concentration des sources et de la structure des composants.

L'unicité des fichiers diffère également de l'indépendance des sources. Cinq cents images extraites d'une même vidéo sont des fichiers distincts. Il en va de même pour plusieurs recadrages d'une image source, pour plusieurs versions localisées d'un même design, ou pour de nombreuses photos issues d'une même séance. Ces éléments peuvent apporter de l'information, mais ils ne constituent pas automatiquement des exemples indépendants.

Relation
Interprétation typique                                                
Doublon exact
Redondant
Enregistrement dupliqué dans la base de données
Redondant
Copie recompressée
Généralement redondant
Rogner ou redimensionner à partir d'une source
Dérivé associé
Variante d'une famille de modèles
Conception associée
Version localisée
Conception associée
Images extraites d'une même séquence
Observations corrélées
Actif source partagé
Dépendance à suivre
Actif similaire créé indépendamment
Pas automatiquement un doublon

Un million de fichiers ne correspond pas nécessairement à un million d'exemples indépendants. Les groupes sources pertinents peuvent inclure : tournage, séquence, vidéo source, lot de contributeurs, campagne, famille de modèles, asset d'origine, graine synthétique ou lignée dérivée.

6. La qualité technique signifie la conformité à la tâche, pas la perfection visuelle

La qualité technique doit être définie par la tâche. Le flou, la compression, un cadrage inhabituel, le bruit ou une faible résolution peuvent constituer un défaut pour une génération à haute fidélité, être une condition de déploiement attendue pour un classificateur, ou au contraire représenter un cas utile pour évaluer la robustesse.


• Images: résolution, rapport d'aspect, format de fichier, corruption, artefacts de compression, flou, bruit, exposition, intégrité des couleurs, orientation et fichiers manquants.

• Vidéo: durée, fréquence d'images, codec, images corrompues, corruption temporelle, synchronisation audio/vidéo, délimitations de scène, images répétées et regroupements au niveau du clip.

• Vérifications du pipeline: lisibilité des fichiers, conformité des dimensions, tailles de fichiers anormales, métadonnées manquantes, formats non pris en charge et autres anomalies détectables par machine.


La validation automatisée est précieuse à grande échelle, mais l'examen humain reste nécessaire pour des jugements contextuels tels que déterminer si un design est réellement pertinent, si une légende capture la sémantique voulue, ou si un dérivé visuel représente une variation utile.

7. Qualité des annotations : accord inter-annotateurs, exactitude, ambiguïté et impact

Une équipe d'annotateurs passe en revue des échantillons d'images pour évaluer la qualité d'un jeu de données d'IA, en discutant des catégories, des exemples ambigus, du contexte, de la cohérence et des désaccords sur les annotations.

La qualité des annotations ne se résume pas à un seul nombre. Quatre questions doivent être évaluées séparément :

Propriété
Question
Accord
Les annotateurs appliquent-ils les consignes de manière cohérente ?
Précision
Les étiquettes correspondent-elles à une référence validée, à un arbitrage par des experts ou à une autre vérité de référence acceptée ?
Ambiguïté
Des annotateurs qualifiés peuvent-ils raisonnablement être en désaccord parce que la définition de la tâche est floue ?
Impact sur la tâche
Les erreurs sont-elles concentrées dans des classes ou des sous-ensembles critiques pour le modèle ?

Un fort niveau d'accord ne prouve pas la validité. Un groupe peut appliquer de manière cohérente une directive défectueuse. Un faible niveau d'accord peut aussi révéler une tâche véritablement ambiguë plutôt qu'une annotation négligente.

Des éléments de preuve utiles peuvent inclure le taux d'erreur arbitré, l'accord inter-annotateurs, le taux d'erreurs critiques, la précision par classe, le taux de reprise, le taux de rejet lors de la revue et la cohérence d'un lot à l'autre. Un taux d'exactitude global peut masquer des échecs concentrés dans une classe minoritaire, lesquels ont un impact disproportionné sur le produit.

8. Auditer les métadonnées pour vérifier leur origine et leur complétude.

Les métadonnées doivent être vérifiées pour leur exhaustivité, leur exactitude, leur cohérence, leur lisibilité par machine, leur pertinence par rapport à la tâche et leur traçabilité. Il doit aussi être possible de déterminer comment un champ a été produit.

• Saisies par le créateur ou le contributeur.

• Fournies par un éditeur ou un fournisseur de médias de stock.

• Importées depuis un autre système source.

• Inférées ou extraites automatiquement.

• Générées par un système d'IA.

• Modifiées ultérieurement par un humain ou par des processus.

Deux légendes peuvent avoir un texte identique tout en apportant des preuves différentes quant à la manière dont elles ont été créées. Les mots-clés de médias de stock peuvent aussi constituer des métadonnées utiles pour la découverte sans être des étiquettes de vérité du terrain. Le bon test est de vérifier si les métadonnées soutiennent réellement le modèle ou le flux de travail.


9. Conception des partitions d'évaluation autour de l'affirmation de généralisation

L'unité de partition doit correspondre à ce que l'évaluation est censée démontrer. Si l'affirmation concerne des vidéos non vues, regroupez par vidéo. Si elle concerne des tournages non vus, regroupez par tournage. Si elle concerne des concepts de templates non vus, regroupez par famille de templates. Si elle concerne des campagnes non vues, regroupez par campagne ou par projet source.

Cela importe, car un nouveau fichier n'est pas nécessairement une nouvelle situation d'apprentissage. Un fichier de template peut être non vu alors qu'un fichier apparenté de la même famille a déjà été utilisé pour l'entraînement. De même, des découpages au niveau des images peuvent provoquer des fuites d'information lorsque des images adjacentes d'une même séquence se retrouvent de part et d'autre de la frontière.

Objectif de partition
Unité de regroupement préférée                                    
Vidéos non vues
Vidéo ou séquence
Prises de vue non vues
Séance de prise de vue / session de capture
Sujets non vus
Sujet, lorsqu'il est correctement identifié
Concepts de modèles non vus
Famille de modèles
Campagnes non vues
Campagne ou projet source

Vérifiez les doublons exacts, les quasi-doublons, les sources partagées, les familles de modèles, les dérivés synthétiques, les séquences communes et autres dépendances qui réduisent l'indépendance de l'évaluation.

10. Traitez le temps comme un changement de distribution, pas comme un score de fraîcheur générique

La récence n'a d'importance que lorsque l'environnement cible change de façon à affecter la tâche. Les styles de design historiques peuvent être utiles pour un système destiné à modéliser des périodes antérieures. Un système de recommandation actuel peut nécessiter des formats de plateforme récents et la distribution correspondante des catégories.

Un jeu de données statique ne « dérive » pas en soi. L'environnement cible peut évoluer, ou une nouvelle version du jeu de données peut présenter une distribution différente. Surveillez les changements mesurables tels que les fréquences par catégorie, la composition des sources, la répartition des formats, la langue et d'autres variables importantes pour le déploiement.

11. Rendre la provenance, les droits et les versions traçables

Un photographe examine des images et des documents d'archives relatifs aux captures originales, au traitement, à l'annotation, aux licences, aux droits et à l'historique des versions du jeu de données.

La documentation du jeu de données doit permettre de retracer l'origine des données, la façon dont elles ont été transformées, comment elles ont été annotées et la version de chaque enregistrement. Les éléments justificatifs relatifs aux droits doivent être rattachés, dans la mesure du possible, aux enregistrements concernés ou aux groupes de sources pertinents.

• Source d'origine et méthode de collecte.

• Informations sur le créateur ou les contributeurs, le cas échéant.

• Historique d'acquisition et de traitement.

• Historique des annotations ou des enrichissements.

• Version du jeu de données et date de publication.

• Conditions de licence et autorisations d'utilisation prévues.

• Restrictions concernant l'utilisation commerciale, le développement de modèles, la redistribution, le territoire géographique, les contributeurs, les marques ou les contraintes contractuelles, le cas échéant.

Utilisez une terminologie précise concernant les preuves. Provenance : la couverture des enregistrements indique quelle part du corpus pertinent est couverte par les enregistrements de provenance requis. Droits : la couverture des enregistrements indique quelle part est couverte par les preuves de droits requises. Une couverture documentaire complète ne prouve pas que chaque conclusion juridique soit correcte. Elle montre que les preuves pertinentes peuvent être localisées.

Pour les équipes qui standardisent la documentation des jeux de données, MLCommons Croissant 1.1 est un format lisible par machine qui prend en charge des métadonnées structurées des jeux de données, la provenance, les politiques d'utilisation, les liens de vocabulaire et des descriptions de données plus complexes. La spécification a été publiée le 29 janvier 2026. Elle peut améliorer l'interopérabilité et l'auditabilité, mais l'adoption d'une norme de métadonnées ne garantit pas la qualité du jeu de données.



12. Évaluer les données réelles et synthétiques selon les mêmes exigences de la tâche

« réel » et « synthétique » décrivent comment les exemples ont été obtenus. Ils ne vous indiquent pas si une distribution est appropriée.

Source de données
Contribution potentielle
Questions à tester
Données créées ou collectées par des humains
Variation naturelle, contexte spécifique à la source, artefacts réels de production
Dans quelle mesure est‑elle représentative du déploiement ? Quelles populations ou conditions manquent‑elles ?
Données synthétiques
Couverture contrôlée, cas rares, variation paramétrée
Apporte‑t‑elle une valeur de transfert ? Introduit‑elle des artefacts du générateur ou des combinaisons irréalistes ?
Données hybrides
Combinaison ciblée de couverture réelle et synthétique
Quelles portions synthétiques ajoutent une valeur mesurée, et quels effets secondaires apparaissent ?

Un jeu de données hybride se justifie lorsque la composante synthétique apporte une valeur mesurable aux régions sélectionnées du problème. Ce n'est pas nécessairement la meilleure configuration.

13. Traitez le filtrage comme une intervention sur les données

Le filtrage modifie la distribution des données d'entraînement. Supprimer des exemples à faible score, inhabituels, difficiles ou rares peut améliorer une métrique de qualité ciblée tout en réduisant la couverture utile dans d'autres domaines.

Avant d'appliquer une règle de filtrage importante, comparez les sous-ensembles retirés et conservés. Dans la mesure du possible, testez le corpus résultant selon un protocole fixe d'entraînement et d'évaluation. La bonne question n'est pas seulement de savoir à quel point les données restantes semblent propres, mais quelles informations la règle de filtrage supprime.

14. Ce que la recherche actuelle en IA centrée sur les données change en ce qui concerne la qualité des jeux de données

DataComp a établi un modèle expérimental utile pour la curation de jeux de données : maintenir le modèle et le dispositif d'entraînement suffisamment constants, changer les données d'entraînement et mesurer les résultats en aval. Son benchmark visuel original utilisait un bassin de candidats image-texte de 12,8 milliards et évaluait des sous-ensembles sélectionnés via un entraînement standardisé et plusieurs jeux de test en aval.

Un préprint DataComp-VLM de juin 2026 étend cette approche de curation contrôlée à l'entraînement vision-langage. Il rapporte des expériences menées sur un corpus multimodal de 6 billions de tokens multimodal datasets et teste le filtrage, le mélange, la mise en forme et l'échantillonnage. Dans le cadre décrit, le mélange des données a eu un impact plus important que le filtrage sur la qualité du jeu de données d'entraînement. La leçon plus large est méthodologique : la curation de données est un ensemble d'interventions qui doivent être évaluées pour leur impact sur le modèle, et non un concours de nettoyage.

Les recherches et les recommandations de Google, du NIST et d'autres praticiens renforcent également la nécessité de relier le choix des jeux de données à l'usage prévu, au contexte de déploiement, à la conception de l'évaluation et aux preuves documentées. Le résultat est un flux de travail plus défendable : définir l'exigence, la mesurer, conserver les preuves et tester si l'intervention modifie la capacité qui importe.

15. Utilisez des indicateurs qui permettent de répondre à une question décisionnelle

Question
Exemples de preuves
Les fichiers sont-ils structurellement utilisables ?
Taux de corruption, conformité au format, taux de fichiers manquants, conformité des dimensions
Les labels sont-ils fiables ?
Taux d'erreurs arbitrées, taux d'accord, taux d'erreurs critiques, révision de la taxonomie
Les métadonnées sont-elles exploitables ?
Couverture des champs obligatoires, Taux d'erreurs validées, traçabilité de l'origine des métadonnées
Le contenu est-il redondant ?
Taux de doublons exacts, concentration par famille dérivée ou source, clusters de similarité
La couverture correspond-elle aux exigences ?
Couverture par tranche, fréquences par catégorie, concentration des sources, présence de cas limites
Les splits sont-ils indépendants ?
Recoupement de doublons entre splits, entre familles et entre groupes de sources
Les preuves peuvent-elles être tracées ?
Couverture des enregistrements de provenance, couverture des enregistrements de droits, enregistrements de version
Le jeu de données aide-t-il le système ?
Indicateurs en aval selon un protocole fixe, métriques des slices critiques, coût de calcul et de remédiation

Ne transformez pas ces mesures en un score universel. Une métrique est utile lorsqu'elle soutient une décision concernant une exigence définie. Les données d'évaluation peuvent nécessiter un niveau de qualité supérieur à celui des données d'entraînement, car des erreurs dans l'ensemble d'évaluation peuvent modifier la performance apparente du système.

16. Un flux de travail pratique pour l'évaluation des jeux de données d'IA

Un centre créatif de traitement des données montre des employés qui gèrent le flux de travail d’un jeu de données destiné à l’IA, depuis l’ingestion et l’annotation des données jusqu’aux contrôles qualité, à la révision, à l’approbation et aux tests du modèle.

1. Définissez l'objectif du modèle ou du produit et rédigez les conditions cibles en termes observables.

2. Convertissez ces exigences en tests d'acceptation, y compris des tranches critiques et des blocages majeurs.

3. Passez en revue la documentation, la méthodologie source, l'historique des versions, les preuves de droits et les limitations connues.

4. Choisissez des méthodes d'échantillonnage adaptées aux questions : aléatoires, stratifiées, basées sur le risque ou multi-lots, selon les besoins.

5. Effectuez des contrôles structurels automatisés des fichiers, formats, dimensions, métadonnées, corruptions et doublons évidents.

6. Auditez les annotations pour évaluer l'accord, la précision, l'ambiguïté et l'impact sur la tâche.

7. Mesurez la couverture, la représentativité, la concentration des sources et les variations significatives.

8. Cartographiez les relations entre dérivés et sources, puis concevez des répartitions d'évaluation pour tester l'affirmation de généralisation.

9. Vérifiez la provenance, les preuves de droits et les versions du jeu de données.

10. Si la décision est suffisamment importante, effectuez une intervention de données contrôlée au niveau du modèle et comparez les résultats agrégés et ceux des tranches critiques.

11. Documentez la décision, les exigences de remédiation, les limitations et les preuves conservées pour la version du jeu de données approuvée.


L'acceptation d'un jeu de données implique plusieurs fonctions lorsque l'adéquation technique, les performances du modèle, les conditions commerciales et les preuves de droits sont toutes importantes. Attribuez des responsables explicites à chaque test plutôt que de supposer qu'une seule équipe peut certifier l'ensemble du corpus.

17. Utilisez un dépistage initial rapide pour le triage

Un contrôle initial peut identifier des raisons évidentes d'arrêter ou d'investiguer. Il ne doit pas être présenté comme une certification universelle de 30 minutes, car la taille du jeu de données, la modalité, la documentation et le risque varient considérablement.

1. Examinez la source, l'utilisation prévue, la méthode de collecte, la version, les limitations connues, la provenance et les preuves de droits.

2. Inspectez un sous-ensemble véritablement échantillonné plutôt que de vous fier uniquement à des exemples sélectionnés par le fournisseur.

3. Effectuez des vérifications de base de l'intégrité des fichiers, des formats, des dimensions, des métadonnées manquantes et des contenus manifestement dupliqués.

4. Examinez les distributions et les relations entre sources qui sont pertinentes pour le cas d'utilisation.

5. Consignez les blocages non résolus et décidez s'il faut procéder à des tests d'acceptation formels.

Un échantillon peut valider l'échantillonnage. Il ne peut pas, à lui seul, établir les propriétés de l'ensemble du jeu de données.


18. Que devraient demander les acheteurs à un fournisseur de jeux de données ?

Pour un jeu de données commercial, concentrez le processus de diligence raisonnable sur des éléments de preuve mesurables et sur les modalités de livraison. Les acheteurs peuvent aussi utiliser le catalogue public d'un fournisseur pour examiner les modalités et la couverture disponibles avant de demander un échantillon représentatif. Par exemple, la bibliothèque de jeux de données IA sous licence de Wavebreak Media regroupe les collections par modalité et cas d'utilisation :

Wavebreak Media AI dataset library

• Quels critères d'acceptation sont définis avant la livraison ?
• Quelles statistiques de qualité sont calculées sur l'ensemble du jeu de données plutôt que sur un échantillon sélectionné ?
• Comment les doublons exacts, les dérivés et les groupes de sources apparentés sont-ils identifiés ?
• Comment la qualité des annotations est-elle mesurée et arbitrée ?
• Comment les erreurs de métadonnées sont-elles validées et quelle est l'origine des métadonnées ?
• Quels rapports de couverture et de distribution accompagnent le jeu de données ?
• Comment sont gérées les relations d'entraînement, de validation et de test ?
• Quelles preuves de provenance et de droits sont incluses avec les enregistrements pertinents ou les groupes de sources ?
• Que se passe-t-il lorsqu'on trouve des défauts après la livraison ?
• L'acheteur peut-il évaluer un échantillon représentatif ou un lot pilote avant la livraison complète ?


Le coût d'un jeu de données doit être évalué en tenant compte du travail nécessaire pour que les données livrées satisfassent les exigences de l'acheteur. Un faible prix d'acquisition peut être compensé par la déduplication, le réétiquetage, la correction des métadonnées, la vérification des droits, la révision manuelle, le stockage et le travail d'ingénierie. Pour les comparaisons économiques, distinguez les unités livrées, les unités acceptées et les unités prêtes pour le modèle.

Jen Togonon

Jen Togonon