Ein kreativer Datensatz kann Millionen von Bildern, Videos, Vorlagen oder multimodalen Aufzeichnungen enthalten und trotzdem ein KI‑Projekt scheitern lassen. Die Anzahl der Dateien sagt einem Produktteam nicht, ob die Daten zur Zielaufgabe passen, kritische Bedingungen abdecken, unabhängige Informationen enthalten, verlässliche Labels und Metadaten aufweisen oder ein vertrauenswürdiges Evaluationsset unterstützen.

Die Qualität von KI‑Datensätzen ist daher aufgabenspezifisch. Die praktische Frage ist, ob der Datensatz definierte Anforderungen erfüllt und ob die Belege für diese Schlussfolgerung überprüfbar sind. Bei kreativen Systemen gehen diese Anforderungen häufig über die Dateiintegrität hinaus und betreffen die visuelle Abdeckung, die Struktur des Designs, Quellenbeziehungen, zeitliche Informationen, Metadaten, Provenienz, Rechte und das Verhalten nachgelagerter Modelle.

Dieser Leitfaden erklärt, wie man diese Eigenschaften vor der Beschaffung oder dem Training bewertet, wie man ein erstes Screening von der formalen Datensatzannahme trennt und wie man prüft, ob eine Datenänderung das beabsichtigte System tatsächlich verbessert.

KI-Datensatzqualität in einem Satz

AI training dataset: Qualität ist der Grad, in dem ein Datensatz (siehe AI datasets) die Anforderungen einer definierten Aufgabe und einer definierten Einsatzumgebung erfüllt, was durch Nachweise belegt wird.

Die sechs Fragen, die man zuerst stellen sollte

Frage
Was es feststellt
Typische Belege
Passung
Stellen die Daten die Zielaufgabe und die Einsatzbedingungen dar?
Anforderungsmatrix, aufgabenspezifische Stichprobenprüfungen, Kategorien- und Formatprüfungen
Abdeckung
Werden die erforderlichen Bedingungen in der notwendigen Tiefe abgebildet?
Abdeckung von Slices, Kategorienhäufigkeiten, Vorhandensein von Randfällen, Quellenkonzentration
Integrität
Sind Dateien, Labels, Metadaten und Beziehungen nutzbar?
Prüfung auf Datenkorruption, Qualitätskontrolle der Annotationen, Validierung der Metadaten, technische Compliance
Unabhängigkeit
Wie viel wirklich unabhängige Information existiert? Sind Evaluationssplits unabhängig?
Quellgruppen, Template-Familien, Abstammungslinien von Derivaten, Überschneidungen zwischen Splits
Nachweise
Können Herkunft, Versionen, Rechte und Verarbeitungsverlauf zurückverfolgt werden?
Herkunftsaufzeichnungen, Lizenz-/Rechteaufzeichnungen, Versionsverlauf, Dokumentation
Auswirkung auf das Modell
Verbessert die Änderung der Daten das beabsichtigte System?
Kontrollierte Intervention, nachgelagerte Metriken, Ergebnisse kritischer Slices, Kosten und Nebenwirkungen

1. Getrennte Überprüfung, Annahme von Datensätzen und Modellvalidierung

Dies sind drei verschiedene Entscheidungen. Eine kurze Vorprüfung kann einen Käufer dazu veranlassen, weiter nachzuforschen. Die Akzeptanz eines Datensatzes bestimmt, ob das gelieferte Korpus die vereinbarten Anforderungen erfüllt. Die Modellvalidierung prüft, ob ein bestimmter Datensatz oder eine Datenintervention das System verbessert.

Phase
Frage
Nachweise
Erstprüfung
Gibt es genügend Nachweise, um eine vertiefte Bewertung zu rechtfertigen?
Dokumentationsprüfungen, stichprobenartige Inspektionen, grundlegende Strukturprüfungen, offensichtliche Hindernisse
Annahme des Datensatzes
Erfüllt der gelieferte Datensatz die definierten Anforderungen?
Validierung des vollständigen Datensatzes oder vereinbarter Stichproben, Schwellenwerte, Nachweise zur Herkunft und zu den Rechten, Split-Prüfungen
Modellvalidierung
Führen die Daten oder die Datenintervention zu einer Verbesserung des Zielsystems?
Kontrolliertes Trainings-/Evaluierungsexperiment, aggregierte und segmentierte Metriken, Kosten- und Nebenwirkungsanalyse

Ein Datensatz kann die technische Abnahme bestehen, ohne den Wert eines Modells nachzuweisen. Eine Verbesserung des Modells kann eine bestimmte Datenmaßnahme validieren, ohne zu beweisen, dass jede Datei, jedes Label, jedes Metadatenfeld oder jeder Rechteeintrag korrekt ist.

2. Definieren Sie die Anforderungen an den Datensatz, bevor Sie die Daten prüfen

Drei Fachleute prüfen eine Präsentation über den Aufbau eines hochwertigen kreativen KI-Datensatzes, die Produktziele, Datensatzanforderungen, Nachweise und Qualitätsstandards umfasst.

Beginnen Sie mit dem Produkt- oder Modellziel und leiten Sie daraus beobachtbare Anforderungen an den Datensatz ab. So vermeiden Sie das häufige Versagen bei der Beschaffung, bei dem ein Anbieter eine beeindruckende Anzahl von Assets präsentiert, bevor der Käufer festgelegt hat, was das System lernen soll.

Produktziel
Anforderungen an den Datensatz
Anzufordernde Nachweise
Vorlagenerstellung
Layout-Beziehungen, Komponenten, Typografie, Seitenverhältnis-Varianten, familienbezogene Aufteilungen
Strukturierte Vorlagenmetadaten, Variantenbeziehungen, Familienkennungen, repräsentative Stichproben
Visuelle Suche
Semantische Abdeckung und nützliche visuelle Unterscheidungen
Beschriftungen oder Tags, Taxonomie, Kategorienabdeckung, Ähnlichkeitsanalyse
Bildbeschriftung / VLM-Training
Zuverlässige Bild-Text-Ausrichtung und Sprachabdeckung
Gepaarte Datensätze, Annotationsmethode, Sprachaufteilungen, Adjudikationsnachweise
Design-Automatisierung
Komposition, Hierarchie, Stil, kreative Absicht, Komponentenstruktur
Analyse von Design-Familien, Komponentenmetadaten, repräsentative Abdeckung
Videoverständnis
Temporale Integrität, Sequenzkontext, Aktivitätsvariationen
Clip-Level-Metadaten, Sequenzkennungen, Frame-Integritätsprüfungen
Bildgenerierung
Visuelle und semantische Abdeckung, Quellendiversität, Kontrolle von Derivaten
Quellengruppen, Bildunterschriften, Ähnlichkeitsanalyse, Rechtsnachweise

Die Anforderung sollte testbar sein. „High-quality visuals“ ist für eine Ausschreibung zu vage. „Mindestens sind die erforderlichen Formate vertreten, beschädigte Dateien liegen unter dem vereinbarten Schwellenwert und die Aufteilungen für die Auswertung sind unabhängig von der Vorlagenfamilie.“ Das gibt dem Käufer etwas, das gemessen werden kann.

3. Abdeckung in Bezug auf die angestrebte Nutzung messen

Ein Profi prüft ein Dashboard zur Abdeckung kreativer KI‑Datensätze, das Datensatzkategorien, Inhaltstypen, Randfälle, Layoutvariationen und Kennzahlen zur Datensatzgesundheit anzeigt.

Die Abdeckung gibt an, ob die vom System benötigten Bedingungen vorhanden sind. Sie unterscheidet sich von Ausgewogenheit, die sich auf Häufigkeiten bezieht, und von Verzerrungen, die systematische Eigenschaften eines Datensatzes betreffen und zu unangemessenem oder schädlichem Verhalten beitragen können.

Art der Abdeckung
Frage
Beispiele
Häufigkeitsabdeckung
Wie oft tritt ein Zustand auf, und wie verhält sich das im Vergleich zur Zielumgebung?
Plattform-Mix, Kategoriefrequenzen, Sprachverteilung
Anforderungsabdeckung
Sind kritische Zustände überhaupt vorhanden?
Erforderliche Geschäftskategorien, Formate, Layout-Typen
Randfallabdeckung
Können wichtige seltene Fälle bewertet werden?
Okklusion, ungewöhnliche Layouts, schwierige Beleuchtung, seltene Szenarien

Wenn die Produktionsverteilung bekannt ist, vergleichen Sie die Häufigkeiten im Datensatz mit dieser Verteilung. Ist sie nicht bekannt, definieren Sie die erforderlichen Slices und die Mindestabdeckung, anstatt Prozentsätze zu erfinden. Trainings-, Validierungs- und Evaluierungsverteilungen können zu Recht voneinander abweichen, da sie unterschiedliche Fragen beantworten.

4. Halten Sie Coverage, Representation und Bias voneinander getrennt.

Abdeckung beschreibt, was vorhanden ist. Repräsentation beschreibt, wie relevante Bevölkerungsgruppen, Kontexte oder Kategorien in Bezug auf die beabsichtigte Verwendung dargestellt werden. Verzerrung bezieht sich auf systematische Eigenschaften eines Datensatzes, die zu unangemessenem oder schädlichem Modellverhalten beitragen können. Die Begriffe überschneiden sich, sind aber nicht austauschbar.

Ein Klassenungleichgewicht ist nicht automatisch eine Verzerrung im Datensatz. Gleiche Anzahlen sind ebenfalls nicht automatisch korrekt. Die richtige Verteilung hängt vom Produktziel, vom Einsatzkontext und von den Fehlermodi ab, die das Team kontrollieren muss.

Bei visuellen Daten sollten sensible demografische Merkmale nicht allein anhand des Aussehens abgeleitet werden, nur um ein Dashboard zu füllen. Wenn demografische oder kontextuelle Attribute benötigt werden, verwenden Sie eine legitime, dokumentierte Messmethode und erklären Sie, warum die Attribute für die Aufgabe relevant sind.

5. Messen Sie aussagekräftige Variation und Quellenunabhängigkeit

Ein Designer prüft gedruckte kreative Materialien und vergleicht originale, abgeleitete, lokalisierte und eigenständige Designs zur Bewertung der Qualität und Konsistenz des Datensatzes.

„Diversität“ ist zu allgemein, um als einzelnes Qualitätsmaß zu dienen. Geben Sie an, welche Variationsdimensionen relevant sind, und messen Sie diese getrennt. Kreative Datensätze benötigen möglicherweise eine Analyse von Vorlagenfamilien, Layoutfamilien, Seitenverhältnissen, Typografie, Sprache, visuellen Clustern, statischen versus bewegten Inhalten, Kategorienmix, Quellenkonzentration und Komponentenstruktur.

Die Einzigartigkeit von Dateien unterscheidet sich außerdem von der Unabhängigkeit der Quelle. Fünfhundert Frames aus einem Video sind unterschiedliche Dateien. Gleiches gilt für mehrere Ausschnitte aus einem Quellbild, mehrere lokalisierte Versionen eines Designs oder viele Fotos derselben Aufnahme. Diese können zwar zusätzliche Informationen liefern, stellen aber nicht automatisch unabhängige Beispiele dar.

Beziehung
Typische Interpretation                                                
Exaktes Duplikat
Überflüssig
Doppelter Datenbankeintrag
Überflüssig
Neu komprimierte Kopie
In der Regel überflüssig
Zuschneiden oder Größenänderung einer Quelle
Verwandtes Derivat
Variante einer Vorlagenfamilie
Verwandtes Design
Lokalisierte Version
Verwandtes Design
Frames aus einer Sequenz
Korrelierte Beobachtungen
Gemeinsame Quellressource
Nachverfolgbare Abhängigkeit
Unabhängig erstelltes ähnliches Asset
Nicht automatisch ein Duplikat

Eine Million Dateien sind nicht zwangsläufig eine Million unabhängiger Beispiele. Relevante Quellgruppen können ein Shooting, eine Sequenz, ein Quellvideo, einen Batch von Beitragenden, eine Kampagne, eine Vorlagenfamilie, das ursprüngliche Quell-Asset, einen synthetischen Seed oder die Abstammung der Derivate umfassen.

6. Technische Qualität bedeutet Aufgabenerfüllung, nicht visuelle Perfektion

Technische Qualität sollte durch die Aufgabe definiert werden. Unschärfe, Kompression, ungewöhnliche Bildausschnitte, Rauschen oder niedrige Auflösung können ein Mangel bei der hochqualitativen Generierung, eine erwartete Einsatzbedingung für einen Klassifikator oder ein nützlicher Robustheitsfall sein.


• Bilder: Auflösung, Seitenverhältnis, Dateiformat, Beschädigung, Kompressionsartefakte, Unschärfe, Rauschen, Belichtung, Farbintegrität, Orientierung und fehlende Dateien.

• Videos: Dauer, Bildrate, Codec, beschädigte Frames, zeitliche Beschädigung, Audio-/Video-Synchronisation, Szenengrenzen, wiederholte Frames und Clip-Level-Gruppierung.

• Pipeline-Checks: Lesbarkeit der Dateien, Einhaltung der Dimensionen, abnorme Dateigrößen, fehlende Metadaten, nicht unterstützte Formate und andere maschinell erkennbare Anomalien.


Automatisierte Validierung ist für die Skalierung wertvoll, aber menschliche Überprüfung bleibt notwendig, um kontextuelle Urteile zu fällen, wie etwa, ob ein Design tatsächlich relevant ist, ob eine Bildunterschrift die beabsichtigte Semantik erfasst oder ob ein visuelles Derivat eine nützliche Variation darstellt.

7. Qualität der Annotationen: Interannotator-Übereinstimmung, Genauigkeit, Mehrdeutigkeit und Auswirkungen

Ein Team von Annotatoren überprüft Bildbeispiele hinsichtlich der Qualität eines KI-Datensatzes und diskutiert Kategorien, mehrdeutige Fälle, Kontext, Konsistenz sowie Meinungsverschiedenheiten in den Annotationen.

Die Qualität der Annotationen lässt sich nicht in einer einzigen Zahl ausdrücken. Vier Fragen sollten separat bewertet werden:

Eigenschaft
Frage
Übereinstimmung
Wenden die Annotatoren die Richtlinie konsequent an?
Genauigkeit
Entsprechen die Labels einer validierten Referenz, einer Expertenentscheidung oder einer anderen anerkannten Ground Truth?
Mehrdeutigkeit
Können qualifizierte Annotatoren vernünftigerweise unterschiedlicher Meinung sein, weil die Aufgabenbeschreibung unklar ist?
Auswirkung auf die Aufgabe
Sind Fehler in für das Modell kritischen Klassen oder Bereichen konzentriert?

Hohe Übereinstimmung ist kein Beweis für die Korrektheit. Eine Gruppe kann konsequent eine fehlerhafte Richtlinie anwenden. Geringe Übereinstimmung kann ebenso auf eine tatsächlich mehrdeutige Aufgabe hinweisen und muss nicht auf nachlässige Annotationen zurückzuführen sein.

Nützliche Nachweise können die adjudizierte Fehlerrate, das Inter‑Annotator‑Agreement, die kritische Fehlerquote, die Genauigkeit auf Klassenebene, die Nachbearbeitungsrate, die Review‑Ablehnungsrate und die Konstanz von Charge zu Charge umfassen. Eine Gesamtgenauigkeitszahl kann Fehler verbergen, die sich auf eine Minderheitsklasse konzentrieren, welche für das Produkt unverhältnismäßig wichtig ist.

8. Metadaten zur Herkunft sowie zur Vollständigkeit prüfen

Metadaten sollten auf Vollständigkeit, Genauigkeit, Konsistenz, Maschinenlesbarkeit, Aufgabenrelevanz und Rückverfolgbarkeit überprüft werden. Es sollte außerdem möglich sein, nachzuvollziehen, wie ein Feld erzeugt wurde.

• Vom Ersteller oder Beitragenden eingegeben.

• Von einem Stock-Media-Redakteur oder -Anbieter bereitgestellt.

• Aus einem anderen Quellsystem importiert.

• Automatisch abgeleitet oder extrahiert.

• Von einem KI-System erzeugt.

• Später von einem Menschen oder einem nachgelagerten Prozess bearbeitet.

Zwei Bildunterschriften können identischen Text haben und dennoch unterschiedliche Hinweise darauf enthalten, wie sie erstellt wurden. Stock-Schlüsselwörter können ebenfalls nützliche Entdeckungsmetadaten sein, ohne als Ground-Truth-Labels zu gelten. Der richtige Test ist, ob die Metadaten das tatsächliche Modell oder den tatsächlichen Workflow unterstützen.


9. Gestaltung von Evaluation-Splits in Bezug auf die Generalisierungsbehauptung

Die Aufteilungseinheit sollte sich danach richten, was die Evaluation nachweisen soll. Bezieht sich die Aussage auf ungesehene Videos, sollte pro Video gruppiert werden. Betrifft sie ungesehene Aufnahmen, sollte pro Aufnahme gruppiert werden. Betrifft sie ungesehene Template-Konzepte, sollte nach Vorlagenfamilie gruppiert werden. Betrifft sie ungesehene Kampagnen, sollte nach Kampagne oder Quellprojekt gruppiert werden.

Das ist wichtig, weil eine neue Datei nicht unbedingt eine neue Lernsituation bedeutet. Eine Vorlagendatei kann ungesehen sein, während eine verwandte Datei aus derselben Familie bereits im Training verwendet wurde. Ebenso können Aufteilungen auf Frame-Ebene Informationen durchsickern lassen, wenn benachbarte Frames einer Sequenz an der Grenze getrennt werden.

Ziel der Aufteilung
Bevorzugte Gruppierungseinheit                                    
Unbekannte Videos
Video oder Sequenz
Unbekannte Aufnahmen
Shooting / Aufnahmesitzung
Unbekannte Subjekte
Subjekt, sofern entsprechend identifiziert
Unbekannte Vorlagenkonzepte
Vorlagenfamilie
Unbekannte Kampagnen
Kampagne oder Quellprojekt

Prüfen Sie exakte Duplikate, nahe Duplikate, gemeinsame Quellassets, Vorlagenfamilien, synthetische Derivate, gemeinsame Sequenzen und andere Abhängigkeiten, die die Unabhängigkeit der Bewertung beeinträchtigen.

10. Behandle Zeit als Änderung der Verteilung, nicht als einen generischen Aktualitätswert.

Aktualität spielt nur dann eine Rolle, wenn sich die Zielumgebung auf eine Weise verändert, die die Aufgabe beeinflusst. Historische Designstile können für ein System wertvoll sein, das frühere Zeiträume modellieren soll. Ein aktuelles Empfehlungssystem benötigt möglicherweise die aktuellen Plattformformate und Kategorienverteilungen.

Ein statischer Datensatz „driftet“ nicht von selbst. Die Zielumgebung kann sich verschieben oder eine neue Version des Datensatzes kann eine andere Verteilung aufweisen. Verfolgen Sie messbare Veränderungen wie Kategoriefrequenzen, Quellenmix, Formatmix, Sprache und andere Variablen, die für die Bereitstellung wichtig sind.

11. Herkunft, Rechte und Versionen nachvollziehbar machen

Ein Fotograf überprüft archivierte Bilder und Dokumente hinsichtlich der ursprünglichen Aufnahmen, der Verarbeitung, der Annotation, der Lizenzierung, der Rechte und des Versionsverlaufs des Datensatzes.

Die Dokumentation von Datensätzen sollte es ermöglichen, nachzuvollziehen, woher die Daten stammen, wie sie transformiert wurden, wie sie annotiert wurden und in welcher Version der Datensatz vorliegt. Nachweise zu Rechten sollten, wo praktikabel, mit den relevanten Datensätzen oder Quellgruppen verknüpft werden.

• Originalquelle und Erhebungsmethode.

• Angaben zu Erstellerinnen/Erstellern oder Beitragenden, sofern zutreffend.

• Erwerbs- und Verarbeitungshistorie.

• Annotierungs- oder Anreicherungshistorie.

• Datensatzversion und Veröffentlichungsdatum.

• Lizenzbedingungen und beabsichtigte Nutzungsberechtigungen.

• Beschränkungen für kommerzielle Nutzung, Modellentwicklung, Weiterverbreitung, geografische Einschränkungen, Einschränkungen durch Beitragende, Marken- oder vertragliche Beschränkungen, sofern relevant.

Verwenden Sie präzise Terminologie für Nachweise. Provenance - record coverage beschreibt, wie viel des relevanten Korpus mit den erforderlichen Provenance-Aufzeichnungen verknüpft ist. Rights - record coverage beschreibt, wie viel mit den erforderlichen Rechtsnachweisen verknüpft ist. Eine vollständige Dokumentationsabdeckung beweist nicht, dass jede rechtliche Schlussfolgerung korrekt ist. Sie zeigt, dass die relevanten Nachweise auffindbar sind.

Für Teams, die die Dokumentation von Datensätzen standardisieren, ist MLCommons Croissant 1.1 ein aktuelles maschinenlesbares Format, das strukturierte Datensatzmetadaten, Provenance, Nutzungsrichtlinien, Vokabularverknüpfungen und komplexere Datenbeschreibungen unterstützt. Die Spezifikation wurde am 29. Januar 2026 veröffentlicht. Sie kann die Interoperabilität und Nachprüfbarkeit verbessern, aber die Einführung eines Metadatenstandards schafft keine Datensatzqualität.



12. Bewerten Sie reale und synthetische Daten anhand derselben Aufgabenanforderungen

“Real” und “synthetic” beschreiben, wie Beispiele gewonnen wurden. Sie sagen nichts darüber aus, ob eine Verteilung angemessen ist.

Datenquelle
Möglicher Beitrag
Zu prüfende Fragen
Von Menschen erstellte/gesammelte Daten
Natürliche Variationen, quellenspezifischer Kontext, echte Produktionsartefakte
Wie repräsentativ ist es für den Einsatz? Welche Populationen oder Bedingungen fehlen?
Synthetische Daten
Kontrollierte Abdeckung, seltene Fälle, parametrisierte Variation
Fügt es einen Transferwert hinzu? Führt es zu Generatorartefakten oder unrealistischen Kombinationen?
Hybride Daten
Gezielte Kombination aus realer und synthetischer Abdeckung
Welche synthetischen Segmente bringen messbaren Mehrwert und welche Nebenwirkungen treten auf?

Ein hybrider Datensatz ist gerechtfertigt, wenn die synthetische Komponente in ausgewählten Bereichen des Problems einen messbaren Mehrwert bringt. Er ist nicht automatisch die beste Konfiguration.

13. Behandle Filterung als Datenintervention

Filtern verändert die Trainingsverteilung. Das Entfernen von gering bewerteten, ungewöhnlichen, schwierigen oder seltenen Beispielen kann eine enge Qualitätsmetrik verbessern, während es andernorts die nützliche Abdeckung reduziert.

Bevor Sie eine umfangreiche Filterregel anwenden, vergleichen Sie die entfernten und die verbliebenen Ausschnitte. Wo möglich, testen Sie den resultierenden Korpus mit einem festen Trainings- und Evaluationsprotokoll. Die richtige Frage ist nicht nur, wie sauber die verbleibenden Daten aussehen, sondern welche Informationen die Filterregel entfernt.

14. Was die aktuelle datenzentrierte KI-Forschung an der Qualität von Datensätzen verändert hat

DataComp etablierte ein nützliches experimentelles Modell für die Erstellung von Datensätzen: Modell und Trainings‑Setup weitgehend konstant halten, die Trainingsdaten ändern und die Auswirkungen auf nachgelagerte Aufgaben messen. Sein ursprünglicher visueller Benchmark nutzte einen Kandidatenpool von 12,8 Milliarden Bild‑Text‑Paaren und bewertete kuratierte Teilmengen mit standardisiertem Training und mehreren nachgelagerten Testsätzen.

Ein DataComp‑VLM‑Preprint vom Juni 2026 überträgt diesen kontrollierten Kurationsansatz auf das Vision‑Language‑Training, berichtet über Experimente an einem 6‑Billionen‑Token‑Korpus multimodaler Datensätze (multimodale Datensätze) und untersucht Filterung, Mischung, Formatierung und Sampling. In dem berichteten Setting hatte das Datenmischen größeren Einfluss auf die Qualität des resultierenden Trainingsdatensatzes als das Filtern. Die übergeordnete Lehre ist methodisch: Datenkuratierung ist eine Reihe von Interventionen, die hinsichtlich ihrer Auswirkungen auf das Modell bewertet werden sollten, nicht ein Wettbewerb ums Aufräumen.

Forschung und Leitlinien von Google, NIST und anderen Praktikern unterstreichen ebenfalls die Notwendigkeit, die Auswahl von Datensätzen mit dem beabsichtigten Einsatz, dem Einsatzkontext, dem Evaluationsdesign und der dokumentierten Evidenz zu verknüpfen. Das Ergebnis ist ein besser begründeter Workflow: Anforderungen definieren, diese messen, Belege sichern und testen, ob die Intervention die Fähigkeit verändert, die Ihnen wichtig ist.

15. Verwenden Sie Kennzahlen, die eine Entscheidungsfrage beantworten

Frage
Beispielbelege
Sind Dateien strukturell verwendbar?
Korruptionsrate, Formatkonformität, Anteil fehlender Dateien, Übereinstimmung mit den Abmessungen
Sind Labels zuverlässig?
Adjudizierte Fehlerquote, Übereinstimmung, Anteil kritischer Fehler, Taxonomieüberprüfung
Sind Metadaten nutzbar?
Abdeckung erforderlicher Felder, validierte Fehlerquote, Nachverfolgbarkeit der Metadatenquelle
Ist der Inhalt redundant?
Anteil exakter Duplikate, Konzentration von Derivaten/Quellenfamilien, Ähnlichkeitscluster
Entspricht die Abdeckung den Anforderungen?
Abdeckung von Slices, Häufigkeiten der Kategorien, Quellenkonzentration, Vorhandensein von Randfällen
Sind die Splits unabhängig?
Duplikatüberschneidung zwischen Splits, Familienüberschneidung, Quellengruppenüberschneidung
Sind Belege nachverfolgbar?
Abdeckung von Provenienz-, Rechte- und Versionsaufzeichnungen
Hilft der Datensatz dem System?
Downstream-Metriken unter festgelegtem Protokoll, Metriken für kritische Slices, Rechen- und Korrekturkosten

Wandeln Sie diese Metriken nicht in eine universelle Punktzahl um. Eine Metrik ist dann nützlich, wenn sie eine Entscheidung über eine konkrete Anforderung unterstützt. Evaluierungsdaten können einen höheren Qualitätsstandard erfordern als Trainingsdaten, da Fehler im Evaluierungsdatensatz die scheinbare Leistung des Systems verfälschen können.

16. Ein praktischer Workflow zur Bewertung von KI-Datensätzen

Eine kreative Datenverarbeitungsanlage zeigt Mitarbeitende, die den Arbeitsablauf eines KI-Datensatzes verwalten – von der Datenerfassung und Annotation über Qualitätsprüfungen und Durchsicht bis hin zur Freigabe und zu Modelltests.

1. Definieren Sie das Modell- oder Produktziel und formulieren Sie die Zielbedingungen in beobachtbaren Begriffen.

2. Übersetzen Sie diese Anforderungen in Abnahmetests, einschließlich kritischer Ausschnitte und harter Blocker.

3. Überprüfen Sie die Dokumentation, die Quellenmethodik, die Versionshistorie, Nachweise zu Rechten und bekannte Einschränkungen.

4. Wählen Sie Stichprobenmethoden, die zu den Fragestellungen passen: zufällig, geschichtet, risikobasiert oder mehrere Chargen nach Bedarf.

5. Führen Sie automatisierte Strukturprüfungen für Dateien, Formate, Abmessungen, Metadaten, Korruption und offensichtliche Duplikate durch.

6. Prüfen Sie Annotationen auf Übereinstimmung, Genauigkeit, Mehrdeutigkeit und Auswirkungen auf die Aufgabe.

7. Messen Sie Abdeckung, Repräsentation, Quellenkonzentration und sinnvolle Variation.

8. Kartieren Sie abgeleitete und Quellbeziehungen und entwerfen Sie dann Evaluationsaufteilungen rund um die Generalisierungsbehauptung.

9. Verifizieren Sie die Herkunft, Nachweise zu Rechten und Datensatzversionen.

10. Wenn die Entscheidung wichtig genug ist, führen Sie eine kontrollierte datenbezogene Intervention auf Modellebene durch und vergleichen Sie aggregierte Ergebnisse mit denen für kritische Ausschnitte.

11. Dokumentieren Sie die Entscheidung, erforderliche Abhilfemaßnahmen, Einschränkungen und die für die genehmigte Datensatzversion aufbewahrten Nachweise.


Die Akzeptanz eines Datensatzes ist funktionsübergreifend, wenn technische Eignung, Modellleistung, kommerzielle Bedingungen und Nachweise zu Rechten alle eine Rolle spielen. Weisen Sie jedem Test explizite Verantwortliche zu, anstatt davon auszugehen, dass ein einziges Team den gesamten Korpus zertifizieren kann.

17. Verwenden Sie ein schnelles Erst-Screening zur Triage

Eine erste Prüfung kann offensichtliche Gründe für einen Abbruch oder für eine weitergehende Untersuchung erkennen. Sie sollte nicht als universelle 30-Minuten-Zertifizierung dargestellt werden, da Datensatzgröße, Modalität, Dokumentation und Risiko stark variieren.

1. Überprüfen Sie die Quelle, den beabsichtigten Gebrauch, die Erhebungsmethode, die Version, bekannte Beschränkungen, die Herkunft und Rechts- bzw. Lizenznachweise.

2. Untersuchen Sie eine tatsächlich zufällig gezogene Teilmenge, anstatt sich nur auf vom Anbieter ausgewählte Beispiele zu verlassen.

3. Führen Sie grundlegende Prüfungen zur Dateiintegrität, zu Formaten, Abmessungen, fehlenden Metadaten und offensichtlichen doppelten Inhalten durch.

4. Betrachten Sie die Verteilungen und die Quellenbeziehungen, die für den Anwendungsfall relevant sind.

5. Dokumentieren Sie offene Blocker und entscheiden Sie, ob mit formalen Abnahmetests fortzufahren ist.

Eine Stichprobe kann Erkenntnisse liefern, kann aber für sich allein nicht die Eigenschaften des vollständigen Datensatzes feststellen.


18. Welche Fragen sollten Käufer einem Datensatzanbieter stellen?

Bei einem kommerziellen Datensatz sollte sich der Due-Diligence-Prozess auf messbare Nachweise und Lieferbedingungen konzentrieren. Käufer können außerdem den öffentlichen Katalog eines Anbieters nutzen, um verfügbare Modalitäten und die Abdeckung zu prüfen, bevor sie eine repräsentative Probe anfordern. Zum Beispiel gruppiert die lizenzierte AI-Dataset-Library von Wavebreak Media Sammlungen nach Modalität und Anwendungsfall:

Wavebreak Media AI-Dataset-Library

• Welche Abnahmekriterien sind vor der Lieferung definiert?

• Welche Qualitätsstatistiken werden am vollständigen Datensatz berechnet, anstatt an einer kuratierten Stichprobe?

• Wie werden exakte Duplikate, Derivate und zugehörige Quellgruppen identifiziert?

• Wie wird die Qualität von Annotationen gemessen und beurteilt?

• Wie werden Metadatenfehler validiert und was ist die Herkunft der Metadaten?

• Welche Abdeckungs- und Verteilungsberichte begleiten den Datensatz?

• Wie werden die Beziehungen zwischen Training, Validierung und Test gehandhabt?

• Welche Provenienz- und Rechte-Nachweise sind den relevanten Datensätzen oder Quellgruppen beigefügt?

• Was passiert, wenn nach der Lieferung Mängel festgestellt werden?

• Kann der Käufer eine repräsentative Probe oder eine Pilotcharge vor der vollständigen Lieferung prüfen?


Die Kosten für einen Datensatz sollten erst bewertet werden, nachdem der Aufwand berücksichtigt wurde, der nötig ist, damit die gelieferten Daten den Anforderungen des Käufers genügen. Ein niedriger Erwerbspreis kann durch Deduplicierung, Neuannotierung, Korrektur von Metadaten, Rechteüberprüfung, manuelle Überprüfung, Speicherung und Engineeringaufwand ausgeglichen werden. Für wirtschaftliche Vergleiche sollte zwischen gelieferten Einheiten, akzeptierten Einheiten und modellbereiten Einheiten unterschieden werden.

Jen Togonon

Jen Togonon