Un jeu de données créatif peut contenir des millions d'images, de vidéos, de templates ou d'enregistrements multimodaux et pourtant faire échouer un projet d'IA. Le nombre de fichiers n'indique pas à une équipe produit si les données correspondent à la tâche cible, couvrent les conditions critiques, contiennent des informations indépendantes, comportent des étiquettes et des métadonnées fiables, ou soutiennent un ensemble d'évaluation digne de confiance.
La qualité d'un jeu de données pour l'IA dépend donc de la tâche. La question pratique est de savoir si le jeu de données satisfait aux exigences définies et si les preuves étayant cette conclusion peuvent être examinées. Pour les systèmes créatifs, ces exigences vont souvent au-delà de l'intégrité des fichiers pour inclure la couverture visuelle, la structure du design, les relations entre les sources, les informations temporelles, les métadonnées, la provenance, les droits et le comportement des modèles en aval.
Ce guide explique comment évaluer ces propriétés avant l'acquisition ou l'entraînement, comment séparer un examen initial de l'acceptation formelle du jeu de données, et comment tester si une modification des données améliore réellement le système visé.
Table of contents:
- ● Qualité des jeux de données pour l'IA en une phrase
- ● Les six questions à poser en premier
- 1. Filtrage séparé, acceptation du jeu de données et validation du modèle
- 2. Définir les exigences du jeu de données avant d'inspecter les données
- 3. Mesurer la couverture par rapport à l'utilisation cible
- 4. Gardez la couverture, la représentation et le biais distincts les uns des autres
- 5. Mesurer la variation significative et l'indépendance des sources
- 6. La qualité technique signifie conformité à la tâche, pas perfection visuelle
- 7. Qualité des annotations : accord, précision, ambiguïté et impact distinct
- 8. Auditer les métadonnées pour en vérifier l'origine et l'exhaustivité
- 9. Concevoir des partitions d'évaluation en lien avec la revendication de généralisation
- 10. Traitez le temps comme un changement de distribution, et non comme un score de fraîcheur générique.
- 11. Rendre traçables la provenance, les droits et les versions
- 12. Évaluer les données réelles et synthétiques selon les mêmes exigences de la tâche
- 13. Traitez le filtrage comme une intervention sur les données
- 14. Ce que la recherche actuelle en IA axée sur les données change en matière de qualité des jeux de données
- 15. Utilisez des indicateurs qui répondent à une question de décision
- 16. Un flux de travail pratique pour l'évaluation des jeux de données d'IA
- 17. Utilisez un dépistage initial rapide pour le triage
- 18. Que devraient demander les acheteurs à un fournisseur de jeux de données ?
Qualité des jeux de données pour l'IA en une phrase
jeu de données d'entraînement pour l'IA : la qualité est le degré auquel un jeu de données satisfait aux exigences d'une tâche définie et à celles de l'environnement de déploiement des jeux de données IA, étayée par des preuves que ces exigences sont effectivement satisfaites.
Les six questions à poser en premier
Question | Ce que cela établit | Preuves typiques |
|---|---|---|
Adéquation | Les données représentent-elles la tâche cible et les conditions de déploiement ? | Matrice d'exigences, revue d'échantillons spécifiques à la tâche, vérifications des catégories et des formats |
Couverture | Les conditions requises sont-elles représentées avec la profondeur nécessaire ? | Couverture par tranche, fréquences des catégories, présence de cas limites, concentration des sources |
Intégrité | Les fichiers, étiquettes, métadonnées et relations sont-ils exploitables ? | Contrôles de corruption, assurance qualité des annotations, validation des métadonnées, conformité technique |
Indépendance | Quelle quantité d'information véritablement indépendante existe-t-elle ? Les partitions d'évaluation sont-elles indépendantes ? | Groupes de sources, familles de modèles (templates), linéage des dérivés, chevauchement entre partitions |
Preuves | La provenance, les versions, les droits et l'historique de traitement peuvent-ils être retracés ? | Enregistrements de provenance, registres de droits, historique des versions, documentation |
Impact sur le modèle | Le changement de données améliore-t-il le système visé ? | Intervention contrôlée, métriques en aval, résultats sur les tranches critiques, coût et effets secondaires |
1. Filtrage séparé, acceptation du jeu de données et validation du modèle
Il s'agit de trois décisions distinctes. Un contrôle rapide peut inciter un acheteur à creuser davantage. L'acceptation d'un jeu de données détermine si un corpus livré satisfait aux exigences convenues. La validation du modèle vise à déterminer si un jeu de données spécifique ou une intervention sur les données améliore le système.
Phase | Question | Preuves |
|---|---|---|
Examen initial | Y a-t-il suffisamment de preuves pour justifier une évaluation approfondie ? | Revue de la documentation, inspection d'échantillons, vérifications structurelles de base, obstacles évidents |
Acceptation du jeu de données | Le jeu de données livré satisfait-il aux exigences définies ? | Validation de l'ensemble du jeu de données ou d'un échantillon convenu, seuils, preuves de provenance et de droits, vérifications des partitions |
Validation du modèle | Les données ou l'intervention sur les données améliorent-elles le système cible ? | Expérience d'entraînement/évaluation contrôlée, métriques agrégées et par tranche, analyse des coûts et des effets secondaires |
Un jeu de données peut être accepté sur le plan technique sans démontrer la valeur du modèle. Une amélioration du modèle peut valider une intervention particulière sur les données sans prouver que tous les fichiers, les étiquettes, les champs de métadonnées ou les enregistrements des droits sont corrects.
2. Définir les exigences du jeu de données avant d'inspecter les données

Commencez par l'objectif du produit ou du modèle, puis traduisez-le en exigences observables pour le jeu de données. Cela évite l'échec fréquent lors des achats où un fournisseur présente un nombre impressionnant d'actifs avant que l'acheteur n'ait défini ce que le système doit apprendre.
Objectif du produit | Exigences du jeu de données | Preuves à demander |
|---|---|---|
Génération de modèles | Relations de mise en page, composants, typographie, variantes de rapport d'aspect, séparations prenant en compte les familles | Métadonnées structurées de modèles, relations entre variantes, identifiants de famille, échantillons représentatifs |
Recherche visuelle | Couverture sémantique et distinctions visuelles pertinentes | Légendes ou balises, taxonomie, couverture des catégories, analyse de similarité |
Génération de légendes d'images / entraînement VLM | Alignement fiable image‑texte et couverture linguistique | Enregistrements appariés, méthode d'annotation, tranches linguistiques, preuves d'arbitrage |
Automatisation de la conception | Composition, hiérarchie, style, intention créative, structure des composants | Analyse des familles de design, métadonnées des composants, couverture représentative |
Compréhension vidéo | Intégrité temporelle, contexte de séquence, variation d'activité | Métadonnées au niveau du clip, identifiants de séquence, vérifications de l'intégrité des images |
Génération d'images | Couverture visuelle et sémantique, diversité des sources, contrôle des dérivés | Groupes de sources, légendes, analyse de similarité, preuves de droits |
L'exigence doit être vérifiable. « Des visuels de haute qualité » est trop vague pour une spécification d'appel d'offres. « Au minimum : les formats requis sont fournis, la proportion de fichiers corrompus est inférieure au seuil convenu, et les répartitions d'évaluation sont indépendantes pour chaque famille de modèles » donne à l'acheteur quelque chose de mesurable.
3. Mesurer la couverture par rapport à l'utilisation cible

La couverture vérifie si les conditions dont le système a besoin sont présentes. Elle se distingue de l'équilibre, qui concerne les fréquences, et du biais, qui concerne les propriétés systématiques des ensembles de données pouvant contribuer à des comportements inappropriés ou nocifs.
Type de couverture | Question | Exemple |
|---|---|---|
Couverture de fréquence | À quelle fréquence une condition se produit‑elle, et comment cela se compare‑t‑il à l'environnement cible ? | Répartition des plateformes, fréquences des catégories, distribution des langues |
Couverture des exigences | Les conditions critiques sont‑elles présentes ? | Catégories d'activité requises, formats, types de mise en page |
Couverture des cas limites | Peut‑on évaluer des cas rares importants ? | Occlusion, mises en page inhabituelles, éclairage difficile, scénarios peu courants |
Lorsque la distribution en production est connue, comparez les fréquences du jeu de données avec cette distribution. Lorsqu'elle n'est pas connue, définissez les sous-ensembles requis et la couverture minimale plutôt que d'inventer des pourcentages. Les distributions d'entraînement, de validation et d'évaluation peuvent légitimement différer parce qu'elles répondent à des questions différentes.
4. Gardez la couverture, la représentation et le biais distincts les uns des autres
La couverture décrit ce qui est présent. La représentation décrit comment les populations, contextes ou catégories pertinents apparaissent par rapport à l'usage prévu. Le biais renvoie aux propriétés systématiques d'un jeu de données qui peuvent contribuer à un comportement inapproprié ou nuisible du modèle. Les termes se chevauchent, mais ils ne sont pas interchangeables.
Le déséquilibre entre les classes n'implique pas automatiquement un biais dans le jeu de données. Des effectifs égaux ne sont pas automatiquement corrects non plus. La bonne distribution dépend de l'objectif du produit, du contexte de déploiement et des modes de défaillance que l'équipe doit maîtriser.
Pour les données visuelles, n'inférez pas de caractéristiques démographiques sensibles à partir de l'apparence simplement pour alimenter un tableau de bord. Lorsque des attributs démographiques ou contextuels sont nécessaires, utilisez une méthode de mesure légitime et documentée et expliquez pourquoi cet attribut est pertinent pour la tâche.
5. Mesurer la variation significative et l'indépendance des sources

“Diversité” est trop vaste pour servir de métrique unique de qualité. Précisez quelles dimensions de variation importent et mesurez-les séparément. Les ensembles de données créatifs peuvent nécessiter une analyse des familles de gabarits, de mises en page, des rapports d'aspect, de la typographie, de la langue, des groupes visuels, du contenu statique par opposition au contenu en mouvement, du mélange de catégories, de la concentration des sources et de la structure des composants.
L'unicité des fichiers diffère également de l'indépendance des sources. Cinq cents images extraites d'une même vidéo sont des fichiers distincts. Il en va de même pour plusieurs recadrages d'une image source, plusieurs versions localisées d'un même design ou de nombreuses photos de la même séance. Ces fichiers peuvent apporter de l'information, mais ne constituent pas automatiquement des exemples indépendants.
Relation | Interprétation typique |
|---|---|
Doublon exact | Redondant |
Enregistrement de base de données dupliqué | Redondant |
Copie recompressée | Généralement redondant |
Recadrage ou redimensionnement d'une source | Dérivé associé |
Variante d'une famille de modèles | Design associé |
Version localisée | Design associé |
Images d'une même séquence | Observations corrélées |
Actif source partagé | Dépendance à surveiller |
Actif similaire créé indépendamment | Pas nécessairement un doublon |
Un million de fichiers ne correspond pas nécessairement à un million d'exemples indépendants. Les groupes sources importants peuvent inclure le tournage (shoot), la séquence, la vidéo source, le lot de contributeurs, la campagne, la famille de modèles, l'actif source d'origine, la graine synthétique ou la lignée dérivée.
6. La qualité technique signifie conformité à la tâche, pas perfection visuelle
La qualité technique doit être définie en fonction de la tâche. Le flou, la compression, un cadrage inhabituel, le bruit ou une faible résolution peuvent être considérés comme des défauts pour une génération haute fidélité, comme des conditions de déploiement attendues pour un classifieur, ou comme des cas utiles pour la robustesse.
• Images : résolution, rapport d'aspect, format de fichier, corruption, artefacts de compression, flou, bruit, exposition, intégrité des couleurs, orientation, et fichiers manquants.
• Vidéo : durée, fréquence d'images, codec, images endommagées, corruption temporelle, synchronisation audio/vidéo, limites de scène, images répétées, et regroupement au niveau du clip.
• Vérifications du pipeline : lisibilité des fichiers, conformité des dimensions, tailles de fichier anormales, métadonnées manquantes, formats non pris en charge, et autres anomalies détectables par machine.
La validation automatisée est précieuse à grande échelle, mais la revue humaine reste nécessaire pour des jugements contextuels tels que déterminer si un design est réellement pertinent, si une légende capture la sémantique voulue, ou si un dérivé visuel représente une variation utile.
7. Qualité des annotations : accord, précision, ambiguïté et impact distinct

La qualité des annotations ne se résume pas à un seul chiffre. Quatre questions doivent être évaluées séparément :
Propriété | Question |
|---|---|
Accord | Les annotateurs appliquent-ils la consigne de manière cohérente ? |
Exactitude | Les étiquettes correspondent-elles à une référence validée, à un arbitrage d'experts ou à une autre vérité de référence acceptée ? |
Ambiguïté | Des annotateurs qualifiés peuvent-ils raisonnablement être en désaccord parce que la définition de la tâche est floue ? |
Impact sur la tâche | Les erreurs sont-elles concentrées dans des classes ou des sous-ensembles critiques pour le modèle ? |
Un taux d'accord élevé ne prouve pas la justesse. Un groupe peut appliquer de manière cohérente une directive erronée. Un faible taux d'accord peut aussi révéler une tâche réellement ambiguë plutôt que des annotations négligentes.
Des preuves utiles peuvent inclure le taux d'erreurs arbitrées, l'accord inter-annotateurs, le taux d'erreurs critiques, la précision par classe, le taux de reprise, le taux de rejet lors des revues et la cohérence d'un lot à l'autre. Un chiffre d'exactitude global peut masquer des échecs concentrés dans une classe minoritaire, qui ont une importance disproportionnée pour le produit.
8. Auditer les métadonnées pour en vérifier l'origine et l'exhaustivité
Les métadonnées doivent être vérifiées pour leur exhaustivité, leur exactitude, leur cohérence, leur lisibilité par machine, leur pertinence pour la tâche et leur traçabilité. Il doit également être possible de déterminer comment un champ a été produit.
• Saisi par le créateur ou le contributeur.
• Fourni par un éditeur ou un fournisseur de médias de stock.
• Importé depuis un autre système source.
• Inféré ou extrait automatiquement.
• Généré par un système d'IA.
• Modifié ultérieurement par un humain ou par un processus en aval.
Deux légendes peuvent avoir un texte identique tout en fournissant des éléments de preuve différents quant à la façon dont elles ont été créées. Les mots-clés de stock peuvent aussi constituer des métadonnées utiles pour la découverte sans être des étiquettes de référence. Le test pertinent est de savoir si les métadonnées soutiennent le modèle ou le flux de travail réel.
9. Concevoir des partitions d'évaluation en lien avec la revendication de généralisation
L'unité de découpage doit correspondre à ce que l'évaluation est censée démontrer. Si l'affirmation concerne des vidéos non vues, regroupez par vidéo. Si elle concerne des tournages non vus, regroupez par tournage. Si elle concerne des concepts de template non vus, regroupez par famille de templates. Si elle concerne des campagnes non vues, regroupez par campagne ou par projet source.
Cela importe, car un nouveau fichier n'est pas nécessairement une nouvelle situation d'apprentissage. Un fichier de template peut être non vu alors qu'un fichier appartenant à la même famille était déjà inclus dans l'entraînement. De même, les découpages au niveau des images peuvent laisser fuiter des informations lorsque des images adjacentes d'une même séquence franchissent la frontière.
Objectif de répartition | Unité de regroupement préférée |
|---|---|
Vidéos non vues | Vidéo ou séquence |
Séances non vues | Séance ou session de capture |
Sujets non vus | Sujet, lorsqu'il est correctement identifié |
Concepts de modèles non vus | Famille de modèles |
Campagnes non vues | Campagne ou projet source |
Vérifiez les doublons exacts, les quasi-doublons, les ressources sources partagées, les familles de modèles, les dérivés synthétiques, les séquences communes et autres dépendances qui réduisent l'indépendance de l'évaluation.
10. Traitez le temps comme un changement de distribution, et non comme un score de fraîcheur générique.
La récence n'a d'importance que lorsque l'environnement cible évolue de manière à affecter la tâche. Les styles de conception historiques peuvent être précieux pour un système destiné à modéliser des périodes antérieures. Un système de recommandation actuel peut nécessiter des formats de plateforme récents et des distributions de catégories récentes.
Un jeu de données statique ne « dérive » pas en soi. L'environnement cible peut évoluer, ou une nouvelle version du jeu de données peut présenter une distribution différente. Surveillez des changements mesurables tels que les fréquences des catégories, la composition des sources, la répartition des formats, la langue et d'autres variables qui importent pour le déploiement.
11. Rendre traçables la provenance, les droits et les versions

La documentation d'un jeu de données doit permettre de retracer l'origine des données, la manière dont elles ont été transformées, comment elles ont été annotées, et la version contenant l'enregistrement. Les preuves de droits doivent être reliées aux enregistrements ou aux groupes sources pertinents lorsque cela est possible.
• Source d'origine et méthode de collecte.
• Informations sur le créateur ou les contributeurs, le cas échéant.
• Historique d'acquisition et de traitement.
• Historique des annotations ou des enrichissements.
• Version du jeu de données et date de publication.
• Conditions de licence et permissions d'utilisation prévues.
• Restrictions concernant l'utilisation commerciale, le développement de modèles, la redistribution, les contraintes géographiques, les contributeurs, les marques déposées ou contractuelles, le cas échéant.
Utilisez une terminologie précise pour les preuves. Par « Provenance - record coverage », on entend la part du corpus pertinent qui est liée aux enregistrements de provenance requis. Par « Rights - record coverage », on entend la part qui est liée aux preuves de droits requises. Une couverture documentaire complète ne prouve pas que chaque conclusion juridique est correcte. Elle montre que les preuves pertinentes peuvent être localisées.
Pour les équipes qui standardisent la documentation des jeux de données, MLCommons Croissant 1.1 est un format lisible par machine actuel qui prend en charge des métadonnées structurées pour les jeux de données, la provenance, les politiques d'utilisation, les liens vers des vocabulaires et des descriptions de données plus complexes. La spécification a été publiée le 29 janvier 2026. Elle peut améliorer l'interopérabilité et l'auditabilité, mais l'adoption d'une norme de métadonnées ne garantit pas la qualité du jeu de données.
12. Évaluer les données réelles et synthétiques selon les mêmes exigences de la tâche
“Real” et “synthetic” décrivent comment les exemples ont été obtenus. Ils ne vous indiquent pas si une distribution est appropriée.
Source de données | Contribution potentielle | Questions à tester |
|---|---|---|
Données créées / collectées par des humains | Variation naturelle, contexte spécifique à la source, artefacts réels de production | Dans quelle mesure est‑elle représentative du déploiement ? Quelles populations ou conditions manquent‑elles ? |
Données synthétiques | Couverture contrôlée, cas rares, variation paramétrée | Apporte‑t‑elle une valeur de transfert ? Introduit‑elle des artefacts du générateur ou des combinaisons irréalistes ? |
Données hybrides | Combinaison ciblée de couverture réelle et synthétique | Quels sous‑ensembles synthétiques apportent une valeur mesurée, et quels effets secondaires apparaissent ? |
Un jeu de données hybride se justifie lorsque le composant synthétique apporte une valeur mesurable à des régions sélectionnées du problème. Ce n'est pas automatiquement la meilleure configuration.
13. Traitez le filtrage comme une intervention sur les données
Le filtrage modifie la distribution d'entraînement. Supprimer des exemples à faible score, inhabituels, difficiles ou rares peut améliorer une métrique de qualité étroite tout en réduisant la couverture utile ailleurs.
Avant d'appliquer une règle de filtrage importante, comparez les tranches supprimées et conservées. Lorsque cela est possible, testez le corpus obtenu selon un protocole fixe d'entraînement et d'évaluation. La bonne question n'est pas seulement de savoir à quel point les données restantes semblent propres, mais plutôt quelles informations la règle de filtrage supprime.
14. Ce que la recherche actuelle en IA axée sur les données change en matière de qualité des jeux de données
DataComp a établi un modèle expérimental utile pour la curation de jeux de données : maintenir le modèle et la configuration d'entraînement suffisamment constants, changer les données d'entraînement et mesurer les résultats en aval. Son benchmark visuel original utilisait un pool de candidats image-texte de 12,8 milliards et évaluait des sous-ensembles sélectionnés avec un entraînement standardisé et plusieurs jeux de test en aval.
Un préprint DataComp - VLM de juin 2026 étend cette approche de curation contrôlée à l'entraînement vision-langage. Il rapporte des expériences menées sur un corpus de 6 billions de tokens provenant de jeux de données multimodales et teste le filtrage, le mélange, le formatage et l'échantillonnage. Dans le cadre rapporté, le mélange des données a eu davantage d'impact que le filtrage sur la qualité du jeu de données d'entraînement résultant. La leçon plus large est méthodologique : la curation des données est un ensemble d'interventions qui doivent être évaluées en fonction de leur impact sur le modèle, et non un concours de nettoyage.
Les recherches et recommandations de Google, NIST et d'autres praticiens renforcent également la nécessité de relier le choix des jeux de données à l'usage prévu, au contexte de déploiement, à la conception de l'évaluation et aux éléments de preuve documentés. Le résultat est un flux de travail plus défendable : définir l'exigence, la mesurer, conserver les preuves et tester si l'intervention modifie la capacité qui vous importe.
15. Utilisez des indicateurs qui répondent à une question de décision
Question | Exemples de preuves |
|---|---|
Les fichiers sont-ils utilisables structurellement ? | Taux de corruption, conformité au format, taux de fichiers manquants, conformité des dimensions |
Les labels sont-ils fiables ? | Taux d'erreur après arbitrage, taux d'accord, taux d'erreurs critiques, révision de la taxonomie |
Les métadonnées sont-elles exploitables ? | Couverture des champs obligatoires, taux d'erreurs validées, traçabilité de l'origine des métadonnées |
Le contenu est-il redondant ? | Taux de duplicatas exacts, concentration dérivée/famille-source, clusters de similarité |
La couverture correspond-elle aux exigences ? | Couverture par tranche (slice), fréquences par catégorie, concentration par source, présence de cas limites |
Les splits sont-ils indépendants ? | Recouvrement de doublons entre splits, recouvrement de familles, recouvrement de groupes par source |
Les preuves peuvent-elles être tracées ? | Couverture des enregistrements de provenance, couverture des enregistrements de droits, couverture des enregistrements de versions |
Le jeu de données aide-t-il le système ? | Métriques en aval à protocole fixe, métriques de slices critiques, coût de calcul et de remédiation |
Ne transformez pas ces mesures en un score universel. Une métrique est utile lorsqu'elle soutient une décision concernant une exigence définie. Le jeu d'évaluation peut nécessiter un niveau de qualité supérieur à celui du jeu d'entraînement, car des erreurs dans le jeu d'évaluation peuvent modifier la performance apparente du système.
16. Un flux de travail pratique pour l'évaluation des jeux de données d'IA

1. Définissez l'objectif du modèle ou du produit et rédigez les conditions cibles en termes observables.
2. Convertissez ces exigences en tests d'acceptation, en incluant les tranches critiques et les blocages majeurs.
3. Examinez la documentation, la méthodologie d'origine, l'historique des versions, les preuves de droits et les limites connues.
4. Choisissez des méthodes d'échantillonnage adaptées aux questions : aléatoire, stratifiée, basée sur le risque, ou multi-lots selon les besoins.
5. Effectuez des contrôles structurels automatisés des fichiers, formats, dimensions, métadonnées, corruptions de fichiers et duplicatas évidents.
6. Auditez les annotations pour l'accord inter‑annotateurs, la précision, l'ambiguïté et l'impact sur la tâche.
7. Mesurez la couverture, la représentation, la concentration des sources et la variabilité significative.
8. Cartographiez les relations entre dérivés et sources, puis concevez des découpages d'évaluation en fonction des revendications de généralisation.
9. Vérifiez la provenance, les preuves de droits et les versions du jeu de données.
10. Si la décision est suffisamment importante, effectuez une intervention de données contrôlée au niveau du modèle et comparez les résultats agrégés et ceux des tranches critiques.
11. Documentez la décision, les exigences de remédiation, les limites et les preuves conservées pour la version approuvée du jeu de données.
L'acceptation du jeu de données est transversale lorsque l'adéquation technique, les performances du modèle, les conditions commerciales et les preuves de droits sont toutes importantes. Attribuez des responsables explicites à chaque test au lieu de supposer qu'une seule équipe peut certifier l'ensemble du corpus.
17. Utilisez un dépistage initial rapide pour le triage
Un contrôle initial peut identifier des raisons évidentes d'arrêter ou d'enquêter. Il ne doit pas être présenté comme une certification universelle de 30 minutes, car la taille du jeu de données, la modalité, la documentation et le niveau de risque varient considérablement.
1. Examinez la source, l'utilisation prévue, la méthode de collecte, la version, les limites connues, la provenance et les preuves de droits.
2. Inspectez un sous-ensemble réellement échantillonné plutôt que de vous fier uniquement à des exemples choisis par le fournisseur.
3. Effectuez des vérifications de base de l'intégrité des fichiers, des formats, des dimensions, des métadonnées manquantes et des contenus manifestement dupliqués.
4. Examinez les distributions et les relations entre les sources qui sont pertinentes pour le cas d'utilisation.
5. Enregistrez les blocages non résolus et décidez s'il faut procéder à des tests d'acceptation formels.
Un échantillon peut valider l'échantillonnage. Il ne peut pas, à lui seul, établir les propriétés de l'ensemble du jeu de données.
18. Que devraient demander les acheteurs à un fournisseur de jeux de données ?
Pour un jeu de données commercial, concentrez le processus de diligence raisonnable sur des preuves mesurables et les modalités de livraison. Les acheteurs peuvent également utiliser le catalogue public d'un fournisseur pour examiner les modalités disponibles et la couverture avant de demander un échantillon représentatif. Par exemple, la bibliothèque de jeux de données IA sous licence de Wavebreak Media regroupe les collections par modalité et par cas d'utilisation :
Bibliothèque de jeux de données IA de Wavebreak Media
Le coût du jeu de données doit être évalué en tenant compte du travail nécessaire pour que les données livrées répondent aux exigences de l'acheteur. Un faible prix d'acquisition peut être compensé par la déduplication, le réétiquetage, la correction des métadonnées, la vérification des droits, la revue manuelle, le stockage et le travail d'ingénierie. Pour les comparaisons économiques, distinguez les unités livrées, les unités acceptées et les unités prêtes pour le modèle.

Jen Togonon
