Un jeu de données créatif peut contenir des millions d'images, de vidéos, de modèles ou d'enregistrements multimodaux, et pourtant faire échouer un projet d'IA. Le nombre de fichiers n'indique pas à une équipe produit si les données correspondent à la tâche ciblée, couvrent les conditions critiques, contiennent des informations indépendantes, comportent des étiquettes et des métadonnées fiables, ou soutiennent un ensemble d'évaluation digne de confiance.
La qualité d'un jeu de données pour l'IA dépend donc de la tâche. La question pratique est de savoir si le jeu de données satisfait aux exigences définies et si les éléments de preuve étayant cette conclusion peuvent être examinés. Pour les systèmes créatifs, ces exigences vont souvent au-delà de l'intégrité des fichiers pour inclure la couverture visuelle, la structure du design, les relations entre les sources, les informations temporelles, les métadonnées, la provenance, les droits et le comportement des modèles en aval.
Ce guide explique comment évaluer ces propriétés avant l'acquisition ou l'entraînement, comment séparer un premier examen de l'acceptation formelle du jeu de données, et comment tester si une modification des données améliore réellement le système visé.
Table of contents:
- ● Qualité d'un jeu de données d'IA en une phrase
- ● Les six questions à poser en premier
- 1. Séparer la sélection, l'acceptation du jeu de données et la validation du modèle
- 2. Définir les exigences du jeu de données avant d'inspecter les données
- 3. Mesurer la couverture par rapport à l'utilisation cible
- 4. Maintenez la couverture, la représentation et le biais distincts
- 5. Mesurer les variations significatives et l'indépendance des sources
- 6. La qualité technique signifie la conformité à la tâche, pas la perfection visuelle
- 7. Qualité des annotations : accord inter-annotateurs, exactitude, ambiguïté et impact
- 8. Auditer les métadonnées pour vérifier leur origine et leur complétude.
- 9. Conception des partitions d'évaluation autour de l'affirmation de généralisation
- 10. Traitez le temps comme un changement de distribution, pas comme un score de fraîcheur générique
- 11. Rendre la provenance, les droits et les versions traçables
- 12. Évaluer les données réelles et synthétiques selon les mêmes exigences de la tâche
- 13. Traitez le filtrage comme une intervention sur les données
- 14. Ce que la recherche actuelle en IA centrée sur les données change en ce qui concerne la qualité des jeux de données
- 15. Utilisez des indicateurs qui permettent de répondre à une question décisionnelle
- 16. Un flux de travail pratique pour l'évaluation des jeux de données d'IA
- 17. Utilisez un dépistage initial rapide pour le triage
- 18. Que devraient demander les acheteurs à un fournisseur de jeux de données ?
Qualité d'un jeu de données d'IA en une phrase
Jeu de données d'entraînement pour l'IA La qualité est le degré auquel un jeu de données satisfait aux exigences d'une tâche définie pour les jeux de données IA et leur environnement de déploiement, étayée par des preuves que ces exigences sont effectivement satisfaites.
Les six questions à poser en premier
Question | Ce que cela établit | Preuves typiques |
|---|---|---|
Adéquation | Les données représentent-elles la tâche cible et les conditions de déploiement ? | Matrice des exigences, revue d'échantillons spécifiques à la tâche, vérifications des catégories et des formats |
Couverture | Les conditions requises sont-elles représentées au niveau de détail nécessaire ? | Couverture par sous-ensemble, fréquences des catégories, présence de cas limites, concentration des sources |
Intégrité | Les fichiers, étiquettes, métadonnées et relations sont-ils utilisables ? | Contrôles d'intégrité, QA des annotations, validation des métadonnées, conformité technique |
Indépendance | Quelle quantité d'information réellement indépendante existe-t-il ? Les partitions d'évaluation sont-elles indépendantes ? | Groupes de sources, familles de templates, lignée des dérivés, chevauchement entre partitions |
Traçabilité | Peut-on retracer la provenance, les versions, les droits et l'historique de traitement ? | Registres de provenance, registres de droits, historique des versions, documentation |
Impact sur le modèle | La modification des données améliore-t-elle le modèle visé ? | Intervention contrôlée, métriques en aval, résultats sur des tranches critiques, coûts et effets secondaires |
1. Séparer la sélection, l'acceptation du jeu de données et la validation du modèle
Il s'agit de trois décisions différentes. Un examen rapide peut inciter un acheteur à approfondir ses investigations. L'acceptation d'un jeu de données détermine si le corpus livré répond aux exigences convenues. La validation du modèle consiste à déterminer si un jeu de données spécifique ou une intervention sur les données améliore le système.
Étape | Question | Preuves |
|---|---|---|
Examen initial | Y a-t-il suffisamment de preuves pour justifier une évaluation plus approfondie ? | Revue de la documentation, inspection d'échantillons, vérifications structurelles de base, obstacles évidents |
Acceptation du jeu de données | Le jeu de données livré satisfait-il aux exigences définies ? | Validation de l'ensemble du jeu de données ou d'un échantillon convenu : seuils, preuves de provenance et de droits, vérifications des partitions |
Validation du modèle | Les données ou l'intervention sur les données améliorent-elles le système cible ? | Expérience d'entraînement/évaluation contrôlée : métriques globales et par tranche, analyse des coûts et des effets secondaires |
Un jeu de données peut obtenir l'acceptation technique sans démontrer qu'il apporte de la valeur au modèle. Une amélioration du modèle peut valider une intervention particulière sur les données sans prouver que tous les fichiers, étiquettes, champs de métadonnées ou enregistrements de droits sont corrects.
2. Définir les exigences du jeu de données avant d'inspecter les données

Commencez par l'objectif du produit ou du modèle, puis traduisez-le en exigences observables pour le jeu de données. Cela évite l'échec courant dans les achats où un fournisseur présente un nombre impressionnant d'actifs avant que l'acheteur n'ait défini ce que le système doit apprendre.
Objectif du produit | Exigences du jeu de données | Preuves à demander |
|---|---|---|
Génération de gabarits | Relations de mise en page, composants, typographie, variantes de rapport d'aspect, segmentations par famille | Métadonnées structurées des gabarits, relations entre variantes, identifiants de famille, échantillons représentatifs |
Recherche visuelle | Couverture sémantique, distinctions visuelles utiles | Légendes ou balises, taxonomie, couverture des catégories, analyse de similarité |
Légendage d'images / entraînement de VLM | Alignement fiable image-texte, couverture linguistique | Enregistrements appariés, méthode d'annotation, segments linguistiques, preuves d'arbitrage |
Automatisation de la conception | Composition, hiérarchie, style, intention créative, structure des composants | Analyse des familles de design, métadonnées des composants, couverture représentative |
Compréhension vidéo | Intégrité temporelle, contexte de la séquence, variation des activités | Métadonnées au niveau du clip, identifiants de séquence, vérifications de l'intégrité des images |
Génération d'images | Couverture visuelle et sémantique, diversité des sources, contrôle des œuvres dérivées | Groupes de sources, légendes, analyse de similarité, preuves de droits |
L'exigence doit être testable. “Visuels de haute qualité” est trop vague pour un cahier des charges. “Les formats requis sont présents, le taux de fichiers corrompus est inférieur au seuil convenu, et la répartition des évaluations est indépendante pour chaque famille de modèles” donne à l'acheteur quelque chose de mesurable.
3. Mesurer la couverture par rapport à l'utilisation cible

La couverture concerne la présence des conditions dont le système a besoin. Elle se distingue de l'équilibre, qui porte sur les fréquences, et du biais, qui renvoie aux propriétés systématiques d'un jeu de données susceptibles de favoriser des comportements inappropriés ou nuisibles.
Type de couverture | Question | Exemple |
|---|---|---|
Couverture de fréquence | À quelle fréquence une condition se produit-elle, et comment cela se compare-t-il à l'environnement cible ? | Répartition des plateformes, fréquences par catégorie, répartition linguistique |
Couverture des exigences | Les conditions critiques sont-elles présentes ? | Catégories commerciales requises, formats, types de mise en page |
Couverture des cas limites | Les cas rares mais importants peuvent-ils être évalués ? | Occlusion, mises en page inhabituelles, éclairage difficile, scénarios peu courants |
Lorsque la distribution en production est connue, comparez les fréquences du jeu de données à cette distribution. Si elle n'est pas connue, définissez les sous-ensembles requis et la couverture minimale plutôt que d'inventer des pourcentages. Les distributions d'entraînement, de validation et d'évaluation peuvent légitimement différer car elles répondent à des questions différentes.
4. Maintenez la couverture, la représentation et le biais distincts
La couverture décrit ce qui est présent. La représentation décrit comment des populations, contextes ou catégories pertinents apparaissent par rapport à l'utilisation prévue. Le biais fait référence aux propriétés systémiques d'un jeu de données qui peuvent contribuer à un comportement inapproprié ou nuisible du modèle. Les termes se chevauchent, mais ils ne sont pas interchangeables.
Le déséquilibre des classes n'est pas automatiquement un biais du jeu de données. Des effectifs égaux ne sont pas nécessairement corrects non plus. La bonne répartition dépend de l'objectif du produit, du contexte de déploiement et des modes de défaillance que l'équipe doit contrôler.
Pour les données visuelles, n'inférez pas de caractéristiques démographiques sensibles à partir de l'apparence simplement pour remplir un tableau de bord. Lorsque des attributs démographiques ou contextuels sont nécessaires, utilisez une méthode de mesure légitime et documentée et expliquez pourquoi cet attribut importe pour la tâche.
5. Mesurer les variations significatives et l'indépendance des sources

« diversité » est trop vague pour servir d'indicateur unique de qualité. Précisez quelles dimensions de variation importent et mesurez-les séparément. Les jeux de données créatifs peuvent nécessiter une analyse des familles de gabarits, des familles de mise en page, des rapports d'aspect, de la typographie, de la langue, des clusters visuels, du contenu statique vs contenu en mouvement, du mélange de catégories, de la concentration des sources et de la structure des composants.
L'unicité des fichiers diffère également de l'indépendance des sources. Cinq cents images extraites d'une même vidéo sont des fichiers distincts. Il en va de même pour plusieurs recadrages d'une image source, pour plusieurs versions localisées d'un même design, ou pour de nombreuses photos issues d'une même séance. Ces éléments peuvent apporter de l'information, mais ils ne constituent pas automatiquement des exemples indépendants.
Relation | Interprétation typique |
|---|---|
Doublon exact | Redondant |
Enregistrement dupliqué dans la base de données | Redondant |
Copie recompressée | Généralement redondant |
Rogner ou redimensionner à partir d'une source | Dérivé associé |
Variante d'une famille de modèles | Conception associée |
Version localisée | Conception associée |
Images extraites d'une même séquence | Observations corrélées |
Actif source partagé | Dépendance à suivre |
Actif similaire créé indépendamment | Pas automatiquement un doublon |
Un million de fichiers ne correspond pas nécessairement à un million d'exemples indépendants. Les groupes sources pertinents peuvent inclure : tournage, séquence, vidéo source, lot de contributeurs, campagne, famille de modèles, asset d'origine, graine synthétique ou lignée dérivée.
6. La qualité technique signifie la conformité à la tâche, pas la perfection visuelle
La qualité technique doit être définie par la tâche. Le flou, la compression, un cadrage inhabituel, le bruit ou une faible résolution peuvent constituer un défaut pour une génération à haute fidélité, être une condition de déploiement attendue pour un classificateur, ou au contraire représenter un cas utile pour évaluer la robustesse.
• Images: résolution, rapport d'aspect, format de fichier, corruption, artefacts de compression, flou, bruit, exposition, intégrité des couleurs, orientation et fichiers manquants.
• Vidéo: durée, fréquence d'images, codec, images corrompues, corruption temporelle, synchronisation audio/vidéo, délimitations de scène, images répétées et regroupements au niveau du clip.
• Vérifications du pipeline: lisibilité des fichiers, conformité des dimensions, tailles de fichiers anormales, métadonnées manquantes, formats non pris en charge et autres anomalies détectables par machine.
La validation automatisée est précieuse à grande échelle, mais l'examen humain reste nécessaire pour des jugements contextuels tels que déterminer si un design est réellement pertinent, si une légende capture la sémantique voulue, ou si un dérivé visuel représente une variation utile.
7. Qualité des annotations : accord inter-annotateurs, exactitude, ambiguïté et impact

La qualité des annotations ne se résume pas à un seul nombre. Quatre questions doivent être évaluées séparément :
Propriété | Question |
|---|---|
Accord | Les annotateurs appliquent-ils les consignes de manière cohérente ? |
Précision | Les étiquettes correspondent-elles à une référence validée, à un arbitrage par des experts ou à une autre vérité de référence acceptée ? |
Ambiguïté | Des annotateurs qualifiés peuvent-ils raisonnablement être en désaccord parce que la définition de la tâche est floue ? |
Impact sur la tâche | Les erreurs sont-elles concentrées dans des classes ou des sous-ensembles critiques pour le modèle ? |
Un fort niveau d'accord ne prouve pas la validité. Un groupe peut appliquer de manière cohérente une directive défectueuse. Un faible niveau d'accord peut aussi révéler une tâche véritablement ambiguë plutôt qu'une annotation négligente.
Des éléments de preuve utiles peuvent inclure le taux d'erreur arbitré, l'accord inter-annotateurs, le taux d'erreurs critiques, la précision par classe, le taux de reprise, le taux de rejet lors de la revue et la cohérence d'un lot à l'autre. Un taux d'exactitude global peut masquer des échecs concentrés dans une classe minoritaire, lesquels ont un impact disproportionné sur le produit.
8. Auditer les métadonnées pour vérifier leur origine et leur complétude.
Les métadonnées doivent être vérifiées pour leur exhaustivité, leur exactitude, leur cohérence, leur lisibilité par machine, leur pertinence par rapport à la tâche et leur traçabilité. Il doit aussi être possible de déterminer comment un champ a été produit.
• Saisies par le créateur ou le contributeur.
• Fournies par un éditeur ou un fournisseur de médias de stock.
• Importées depuis un autre système source.
• Inférées ou extraites automatiquement.
• Générées par un système d'IA.
• Modifiées ultérieurement par un humain ou par des processus.
Deux légendes peuvent avoir un texte identique tout en apportant des preuves différentes quant à la manière dont elles ont été créées. Les mots-clés de médias de stock peuvent aussi constituer des métadonnées utiles pour la découverte sans être des étiquettes de vérité du terrain. Le bon test est de vérifier si les métadonnées soutiennent réellement le modèle ou le flux de travail.
9. Conception des partitions d'évaluation autour de l'affirmation de généralisation
L'unité de partition doit correspondre à ce que l'évaluation est censée démontrer. Si l'affirmation concerne des vidéos non vues, regroupez par vidéo. Si elle concerne des tournages non vus, regroupez par tournage. Si elle concerne des concepts de templates non vus, regroupez par famille de templates. Si elle concerne des campagnes non vues, regroupez par campagne ou par projet source.
Cela importe, car un nouveau fichier n'est pas nécessairement une nouvelle situation d'apprentissage. Un fichier de template peut être non vu alors qu'un fichier apparenté de la même famille a déjà été utilisé pour l'entraînement. De même, des découpages au niveau des images peuvent provoquer des fuites d'information lorsque des images adjacentes d'une même séquence se retrouvent de part et d'autre de la frontière.
Objectif de partition | Unité de regroupement préférée |
|---|---|
Vidéos non vues | Vidéo ou séquence |
Prises de vue non vues | Séance de prise de vue / session de capture |
Sujets non vus | Sujet, lorsqu'il est correctement identifié |
Concepts de modèles non vus | Famille de modèles |
Campagnes non vues | Campagne ou projet source |
Vérifiez les doublons exacts, les quasi-doublons, les sources partagées, les familles de modèles, les dérivés synthétiques, les séquences communes et autres dépendances qui réduisent l'indépendance de l'évaluation.
10. Traitez le temps comme un changement de distribution, pas comme un score de fraîcheur générique
La récence n'a d'importance que lorsque l'environnement cible change de façon à affecter la tâche. Les styles de design historiques peuvent être utiles pour un système destiné à modéliser des périodes antérieures. Un système de recommandation actuel peut nécessiter des formats de plateforme récents et la distribution correspondante des catégories.
Un jeu de données statique ne « dérive » pas en soi. L'environnement cible peut évoluer, ou une nouvelle version du jeu de données peut présenter une distribution différente. Surveillez les changements mesurables tels que les fréquences par catégorie, la composition des sources, la répartition des formats, la langue et d'autres variables importantes pour le déploiement.
11. Rendre la provenance, les droits et les versions traçables

La documentation du jeu de données doit permettre de retracer l'origine des données, la façon dont elles ont été transformées, comment elles ont été annotées et la version de chaque enregistrement. Les éléments justificatifs relatifs aux droits doivent être rattachés, dans la mesure du possible, aux enregistrements concernés ou aux groupes de sources pertinents.
• Source d'origine et méthode de collecte.
• Informations sur le créateur ou les contributeurs, le cas échéant.
• Historique d'acquisition et de traitement.
• Historique des annotations ou des enrichissements.
• Version du jeu de données et date de publication.
• Conditions de licence et autorisations d'utilisation prévues.
• Restrictions concernant l'utilisation commerciale, le développement de modèles, la redistribution, le territoire géographique, les contributeurs, les marques ou les contraintes contractuelles, le cas échéant.
Utilisez une terminologie précise concernant les preuves. Provenance : la couverture des enregistrements indique quelle part du corpus pertinent est couverte par les enregistrements de provenance requis. Droits : la couverture des enregistrements indique quelle part est couverte par les preuves de droits requises. Une couverture documentaire complète ne prouve pas que chaque conclusion juridique soit correcte. Elle montre que les preuves pertinentes peuvent être localisées.
Pour les équipes qui standardisent la documentation des jeux de données, MLCommons Croissant 1.1 est un format lisible par machine qui prend en charge des métadonnées structurées des jeux de données, la provenance, les politiques d'utilisation, les liens de vocabulaire et des descriptions de données plus complexes. La spécification a été publiée le 29 janvier 2026. Elle peut améliorer l'interopérabilité et l'auditabilité, mais l'adoption d'une norme de métadonnées ne garantit pas la qualité du jeu de données.
12. Évaluer les données réelles et synthétiques selon les mêmes exigences de la tâche
« réel » et « synthétique » décrivent comment les exemples ont été obtenus. Ils ne vous indiquent pas si une distribution est appropriée.
Source de données | Contribution potentielle | Questions à tester |
|---|---|---|
Données créées ou collectées par des humains | Variation naturelle, contexte spécifique à la source, artefacts réels de production | Dans quelle mesure est‑elle représentative du déploiement ? Quelles populations ou conditions manquent‑elles ? |
Données synthétiques | Couverture contrôlée, cas rares, variation paramétrée | Apporte‑t‑elle une valeur de transfert ? Introduit‑elle des artefacts du générateur ou des combinaisons irréalistes ? |
Données hybrides | Combinaison ciblée de couverture réelle et synthétique | Quelles portions synthétiques ajoutent une valeur mesurée, et quels effets secondaires apparaissent ? |
Un jeu de données hybride se justifie lorsque la composante synthétique apporte une valeur mesurable aux régions sélectionnées du problème. Ce n'est pas nécessairement la meilleure configuration.
13. Traitez le filtrage comme une intervention sur les données
Le filtrage modifie la distribution des données d'entraînement. Supprimer des exemples à faible score, inhabituels, difficiles ou rares peut améliorer une métrique de qualité ciblée tout en réduisant la couverture utile dans d'autres domaines.
Avant d'appliquer une règle de filtrage importante, comparez les sous-ensembles retirés et conservés. Dans la mesure du possible, testez le corpus résultant selon un protocole fixe d'entraînement et d'évaluation. La bonne question n'est pas seulement de savoir à quel point les données restantes semblent propres, mais quelles informations la règle de filtrage supprime.
14. Ce que la recherche actuelle en IA centrée sur les données change en ce qui concerne la qualité des jeux de données
DataComp a établi un modèle expérimental utile pour la curation de jeux de données : maintenir le modèle et le dispositif d'entraînement suffisamment constants, changer les données d'entraînement et mesurer les résultats en aval. Son benchmark visuel original utilisait un bassin de candidats image-texte de 12,8 milliards et évaluait des sous-ensembles sélectionnés via un entraînement standardisé et plusieurs jeux de test en aval.
Un préprint DataComp-VLM de juin 2026 étend cette approche de curation contrôlée à l'entraînement vision-langage. Il rapporte des expériences menées sur un corpus multimodal de 6 billions de tokens multimodal datasets et teste le filtrage, le mélange, la mise en forme et l'échantillonnage. Dans le cadre décrit, le mélange des données a eu un impact plus important que le filtrage sur la qualité du jeu de données d'entraînement. La leçon plus large est méthodologique : la curation de données est un ensemble d'interventions qui doivent être évaluées pour leur impact sur le modèle, et non un concours de nettoyage.
Les recherches et les recommandations de Google, du NIST et d'autres praticiens renforcent également la nécessité de relier le choix des jeux de données à l'usage prévu, au contexte de déploiement, à la conception de l'évaluation et aux preuves documentées. Le résultat est un flux de travail plus défendable : définir l'exigence, la mesurer, conserver les preuves et tester si l'intervention modifie la capacité qui importe.
15. Utilisez des indicateurs qui permettent de répondre à une question décisionnelle
Question | Exemples de preuves |
|---|---|
Les fichiers sont-ils structurellement utilisables ? | Taux de corruption, conformité au format, taux de fichiers manquants, conformité des dimensions |
Les labels sont-ils fiables ? | Taux d'erreurs arbitrées, taux d'accord, taux d'erreurs critiques, révision de la taxonomie |
Les métadonnées sont-elles exploitables ? | Couverture des champs obligatoires, Taux d'erreurs validées, traçabilité de l'origine des métadonnées |
Le contenu est-il redondant ? | Taux de doublons exacts, concentration par famille dérivée ou source, clusters de similarité |
La couverture correspond-elle aux exigences ? | Couverture par tranche, fréquences par catégorie, concentration des sources, présence de cas limites |
Les splits sont-ils indépendants ? | Recoupement de doublons entre splits, entre familles et entre groupes de sources |
Les preuves peuvent-elles être tracées ? | Couverture des enregistrements de provenance, couverture des enregistrements de droits, enregistrements de version |
Le jeu de données aide-t-il le système ? | Indicateurs en aval selon un protocole fixe, métriques des slices critiques, coût de calcul et de remédiation |
Ne transformez pas ces mesures en un score universel. Une métrique est utile lorsqu'elle soutient une décision concernant une exigence définie. Les données d'évaluation peuvent nécessiter un niveau de qualité supérieur à celui des données d'entraînement, car des erreurs dans l'ensemble d'évaluation peuvent modifier la performance apparente du système.
16. Un flux de travail pratique pour l'évaluation des jeux de données d'IA

1. Définissez l'objectif du modèle ou du produit et rédigez les conditions cibles en termes observables.
2. Convertissez ces exigences en tests d'acceptation, y compris des tranches critiques et des blocages majeurs.
3. Passez en revue la documentation, la méthodologie source, l'historique des versions, les preuves de droits et les limitations connues.
4. Choisissez des méthodes d'échantillonnage adaptées aux questions : aléatoires, stratifiées, basées sur le risque ou multi-lots, selon les besoins.
5. Effectuez des contrôles structurels automatisés des fichiers, formats, dimensions, métadonnées, corruptions et doublons évidents.
6. Auditez les annotations pour évaluer l'accord, la précision, l'ambiguïté et l'impact sur la tâche.
7. Mesurez la couverture, la représentativité, la concentration des sources et les variations significatives.
8. Cartographiez les relations entre dérivés et sources, puis concevez des répartitions d'évaluation pour tester l'affirmation de généralisation.
9. Vérifiez la provenance, les preuves de droits et les versions du jeu de données.
10. Si la décision est suffisamment importante, effectuez une intervention de données contrôlée au niveau du modèle et comparez les résultats agrégés et ceux des tranches critiques.
11. Documentez la décision, les exigences de remédiation, les limitations et les preuves conservées pour la version du jeu de données approuvée.
L'acceptation d'un jeu de données implique plusieurs fonctions lorsque l'adéquation technique, les performances du modèle, les conditions commerciales et les preuves de droits sont toutes importantes. Attribuez des responsables explicites à chaque test plutôt que de supposer qu'une seule équipe peut certifier l'ensemble du corpus.
17. Utilisez un dépistage initial rapide pour le triage
Un contrôle initial peut identifier des raisons évidentes d'arrêter ou d'investiguer. Il ne doit pas être présenté comme une certification universelle de 30 minutes, car la taille du jeu de données, la modalité, la documentation et le risque varient considérablement.
1. Examinez la source, l'utilisation prévue, la méthode de collecte, la version, les limitations connues, la provenance et les preuves de droits.
2. Inspectez un sous-ensemble véritablement échantillonné plutôt que de vous fier uniquement à des exemples sélectionnés par le fournisseur.
3. Effectuez des vérifications de base de l'intégrité des fichiers, des formats, des dimensions, des métadonnées manquantes et des contenus manifestement dupliqués.
4. Examinez les distributions et les relations entre sources qui sont pertinentes pour le cas d'utilisation.
5. Consignez les blocages non résolus et décidez s'il faut procéder à des tests d'acceptation formels.
Un échantillon peut valider l'échantillonnage. Il ne peut pas, à lui seul, établir les propriétés de l'ensemble du jeu de données.
18. Que devraient demander les acheteurs à un fournisseur de jeux de données ?
Pour un jeu de données commercial, concentrez le processus de diligence raisonnable sur des éléments de preuve mesurables et sur les modalités de livraison. Les acheteurs peuvent aussi utiliser le catalogue public d'un fournisseur pour examiner les modalités et la couverture disponibles avant de demander un échantillon représentatif. Par exemple, la bibliothèque de jeux de données IA sous licence de Wavebreak Media regroupe les collections par modalité et cas d'utilisation :
Wavebreak Media AI dataset library
Le coût d'un jeu de données doit être évalué en tenant compte du travail nécessaire pour que les données livrées satisfassent les exigences de l'acheteur. Un faible prix d'acquisition peut être compensé par la déduplication, le réétiquetage, la correction des métadonnées, la vérification des droits, la révision manuelle, le stockage et le travail d'ingénierie. Pour les comparaisons économiques, distinguez les unités livrées, les unités acceptées et les unités prêtes pour le modèle.

Jen Togonon
