Un conjunto de datos creativos puede contener millones de imágenes, vídeos, plantillas o registros multimodales y aun así hacer fracasar un proyecto de IA. El recuento de archivos no indica al equipo de producto si los datos se ajustan a la tarea objetivo, si cubren condiciones críticas, si contienen información independiente, si disponen de etiquetas y metadatos fiables o si respaldan un conjunto de evaluación fiable.
La calidad de un conjunto de datos para IA depende, por tanto, de la tarea. La cuestión práctica es si el conjunto de datos satisface los requisitos definidos y si la evidencia que respalda esa conclusión puede ser inspeccionada. Para los sistemas creativos, esos requisitos a menudo se extienden más allá de la integridad de los archivos hasta la cobertura visual, la estructura del diseño, las relaciones entre fuentes, la información temporal, los metadatos, la procedencia, los derechos y el comportamiento del modelo aguas abajo.
Esta guía explica cómo evaluar esas propiedades antes de la adquisición o el entrenamiento, cómo separar una inspección inicial de la aceptación formal del conjunto de datos y cómo probar si un cambio en los datos mejora realmente el sistema previsto.
Table of contents:
- ● Calidad de los conjuntos de datos de IA en una frase
- ● Las seis preguntas que debes hacer primero
- 1. Filtrado por separado, aceptación del conjunto de datos y validación del modelo
- 2. Definir los requisitos del conjunto de datos antes de inspeccionarlo
- 3. Medir la cobertura respecto al uso previsto
- 4. Mantener la cobertura, la representación y el sesgo separados
- 5. Medir la variación significativa y la independencia de la fuente
- 6. La calidad técnica significa conformidad con la tarea, no perfección visual
- 7. Calidad de la anotación: acuerdo, exactitud, ambigüedad e impacto por separado
- 8. Auditoría de los metadatos, tanto de su origen como de su completitud
- 9. Diseñar particiones de evaluación en torno a la afirmación de generalización
- 10. Trata el tiempo como un cambio en la distribución, no como una puntuación genérica de frescura.
- 11. Hacer que la procedencia, los derechos y las versiones sean rastreables
- 12. Evaluar los datos reales y sintéticos según los mismos requisitos de la tarea
- 13. Trata el filtrado como una intervención en los datos
- 14. ¿Qué cambios introduce la investigación actual de IA centrada en los datos en la calidad de los conjuntos de datos?
- 15. Usa métricas que respondan a una pregunta de decisión
- 16. Un flujo de trabajo práctico para la evaluación de conjuntos de datos de IA
- 17. Utilice una evaluación inicial rápida para el triaje
- 18. ¿Qué deberían preguntar los compradores a un proveedor de conjuntos de datos?
Calidad de los conjuntos de datos de IA en una frase
Conjunto de datos de entrenamiento de IA La calidad es el grado en que un conjunto de datos de IA cumple los requisitos de una tarea definida y las exigencias del entorno de despliegue, respaldada por evidencia de que esos requisitos se cumplen realmente.
Las seis preguntas que debes hacer primero
Pregunta | Qué establece | Evidencia típica |
|---|---|---|
Adecuación | ¿Representan los datos la tarea objetivo y las condiciones de despliegue? | Matriz de requisitos, revisión de muestras específicas de la tarea, comprobaciones de categorías y formatos |
Cobertura | ¿Se representan las condiciones requeridas con la profundidad necesaria? | Cobertura por subconjuntos, frecuencias por categoría, presencia de casos límite, concentración de fuentes |
Integridad | ¿Son utilizables los archivos, las etiquetas, los metadatos y las relaciones? | Comprobaciones de corrupción, aseguramiento de la calidad de las anotaciones, validación de metadatos, cumplimiento técnico |
Independencia | ¿Cuánta información genuinamente independiente existe? ¿Son independientes las divisiones de evaluación? | Grupos de fuentes, familias de plantillas, linaje de datos derivados, solapamiento entre divisiones |
Evidencia | ¿Se puede rastrear la procedencia, las versiones, los derechos y el historial de procesamiento? | Registros de procedencia, registros de derechos, historial de versiones, documentación |
Impacto en el modelo | ¿El cambio en los datos mejora el sistema previsto? | Intervención controlada, métricas posteriores, resultados en subconjuntos críticos, costos y efectos secundarios |
1. Filtrado por separado, aceptación del conjunto de datos y validación del modelo
Estas son tres decisiones distintas. Una revisión rápida puede indicarle a un comprador que investigue más a fondo. La aceptación del conjunto de datos determina si un corpus entregado satisface los requisitos acordados. La validación del modelo plantea si un conjunto de datos específico o una intervención en los datos mejora el sistema.
Fase | Pregunta | Evidencia |
|---|---|---|
Evaluación inicial | ¿Hay suficiente evidencia para justificar una evaluación más profunda? | Revisión de documentación, inspección por muestreo, comprobaciones estructurales básicas, obstáculos evidentes |
Aceptación del conjunto de datos | ¿El conjunto de datos entregado cumple los requisitos definidos? | Validación del conjunto completo o de la muestra acordada, umbrales, evidencia de procedencia y de derechos, comprobaciones de particiones |
Validación del modelo | ¿Los datos o la intervención sobre los datos mejoran el sistema objetivo? | Experimento controlado de entrenamiento y evaluación, métricas agregadas y por subconjunto, análisis de costes y de efectos secundarios |
Un conjunto de datos puede pasar la aceptación técnica sin demostrar su valor para el modelo. Una mejora del modelo puede validar una intervención de datos concreta sin demostrar que todos los archivos, etiquetas, campos de metadatos o registros de derechos sean correctos.
2. Definir los requisitos del conjunto de datos antes de inspeccionarlo

Empiece por el objetivo del producto o del modelo y luego tradúzcalo en requisitos observables para el conjunto de datos. Esto evita un fallo común en las adquisiciones: que un proveedor presente un recuento impresionante de activos antes de que el comprador defina qué debe aprender el sistema.
Objetivo del producto | Requisitos del conjunto de datos | Evidencia a solicitar |
|---|---|---|
Generación de plantillas | Relaciones de diseño, componentes, tipografía, variantes de relación de aspecto, segmentaciones por familia | Metadatos de plantillas estructuradas, relaciones entre variantes, identificadores de familia, muestras representativas |
Búsqueda visual | Cobertura semántica y distinciones visuales útiles | Subtítulos o etiquetas, taxonomía, cobertura de categorías, análisis de similitud |
Generación de descripciones de imágenes / Entrenamiento VLM | Alineación confiable imagen‑texto y cobertura lingüística | Registros emparejados, método de anotación, segmentos por idioma, evidencia de adjudicación |
Automatización del diseño | Composición, jerarquía, estilo, intención creativa, estructura de componentes | Análisis por familia de diseño, metadatos de componentes, cobertura representativa |
Comprensión de video | Integridad temporal, contexto de la secuencia, variación de actividades | Metadatos a nivel de clip, identificadores de secuencia, comprobaciones de integridad de fotogramas |
Generación de imágenes | Cobertura visual y semántica, diversidad de fuentes, control de derivados | Grupos de fuentes, subtítulos, análisis de similitud, evidencia de derechos |
El requisito debe ser verificable. “Visuales de alta calidad” es demasiado vago para una especificación de contratación. “Al menos los formatos requeridos están representados, la proporción de archivos corruptos está por debajo del umbral acordado y las divisiones de evaluación son independientes para cada familia de plantillas” le da al comprador algo que se puede medir.
3. Medir la cobertura respecto al uso previsto

La cobertura evalúa si están presentes las condiciones que el sistema necesita. Es diferente del balance, que se refiere a las frecuencias, y del sesgo, que hace referencia a propiedades sistemáticas del conjunto de datos que pueden contribuir a comportamientos inapropiados o dañinos.
Tipo de cobertura | Pregunta | Ejemplo |
|---|---|---|
Cobertura de frecuencia | ¿Con qué frecuencia ocurre una condición y cómo se compara con el entorno objetivo? | Mezcla de plataformas, frecuencias por categoría, distribución de idiomas |
Cobertura de requisitos | ¿Están presentes las condiciones críticas? | Categorías comerciales requeridas, formatos, tipos de diseño |
Cobertura de casos límite | ¿Se pueden evaluar casos poco frecuentes y relevantes? | Oclusiones, diseños inusuales, condiciones de iluminación difíciles, escenarios poco comunes |
Cuando se conoce la distribución en producción, compare las frecuencias del conjunto de datos con esa distribución. Cuando no se conoce, defina los subconjuntos requeridos y la cobertura mínima en lugar de inventar porcentajes. Las distribuciones de entrenamiento, validación y evaluación pueden legítimamente diferir porque responden a preguntas distintas.
4. Mantener la cobertura, la representación y el sesgo separados
La cobertura describe lo que está presente. La representación describe cómo aparecen poblaciones, contextos o categorías relevantes respecto al uso previsto. El sesgo se refiere a propiedades sistemáticas de un conjunto de datos que pueden contribuir a un comportamiento inapropiado o dañino del modelo. Los términos se solapan, pero no son intercambiables.
El desequilibrio de clases no es automáticamente un sesgo del conjunto de datos. Los conteos iguales tampoco son automáticamente correctos. La distribución adecuada depende del objetivo del producto, del contexto de despliegue y de los modos de fallo que el equipo necesita controlar.
Para datos visuales, no infiera características demográficas sensibles a partir de la apariencia simplemente para rellenar un panel de control. Cuando se necesiten atributos demográficos o contextuales, utilice un método de medición legítimo y documentado y explique por qué el atributo es relevante para la tarea.
5. Medir la variación significativa y la independencia de la fuente

“Diversidad” es demasiado amplia para servir como una única métrica de calidad. Especifique qué dimensiones de variación importan y mídalas por separado. Los conjuntos de datos creativos pueden necesitar análisis de familias de plantillas, familias de maquetación, relaciones de aspecto, tipografía, idioma, grupos visuales, contenido estático frente a contenido en movimiento, mezcla de categorías, concentración de fuentes y estructura de componentes.
La unicidad de los archivos no es lo mismo que la independencia de la fuente. Quinientos fotogramas de un solo vídeo son archivos distintos. También lo son múltiples recortes de una misma imagen fuente, varias versiones localizadas de un mismo diseño o muchas fotos de la misma sesión. Pueden aportar información, pero no representan automáticamente ejemplos independientes.
Relación | Interpretación típica |
|---|---|
Duplicado exacto | Redundante |
Registro duplicado en la base de datos | Redundante |
Copia recomprimida | Generalmente redundante |
Recorte o cambio de tamaño de la fuente | Relacionado (derivado) |
Variante de la familia de plantillas | Diseño relacionado |
Versión localizada | Diseño relacionado |
Fotogramas de una secuencia | Observaciones correlacionadas |
Recurso fuente compartido | Dependencia que requiere seguimiento |
Recurso similar creado de forma independiente | No es automáticamente un duplicado |
Un millón de archivos no es necesariamente un millón de ejemplos independientes. Los grupos de origen que importan pueden incluir: sesión de rodaje, secuencia, vídeo fuente, lote de contribuidores, campaña, familia de plantillas, activo fuente original, semilla sintética o linaje derivado.
6. La calidad técnica significa conformidad con la tarea, no perfección visual
La calidad técnica debe definirse según la tarea. El desenfoque, la compresión, el encuadre inusual, el ruido o la baja resolución pueden ser un defecto para la generación de alta fidelidad, una condición de despliegue esperada para un clasificador o un caso útil de robustez.
• Imágenes: resolución, relación de aspecto, formato de archivo, corrupción, artefactos de compresión, desenfoque, ruido, exposición, integridad del color, orientación y archivos faltantes.
• Vídeo: duración, frecuencia de fotogramas, códec, fotogramas dañados, corrupción temporal, sincronización audio/vídeo, límites de escena, fotogramas repetidos y agrupamiento a nivel de clip.
• Comprobaciones del pipeline: lectura de archivos, cumplimiento de dimensiones, tamaños de archivo anómalos, metadatos faltantes, formatos no compatibles y otras anomalías detectables por máquina.
La validación automatizada es valiosa para la escala, pero la revisión humana sigue siendo necesaria para juicios contextuales, como si un diseño es realmente relevante, si un pie de foto captura la semántica prevista o si un derivado visual representa una variación útil.
7. Calidad de la anotación: acuerdo, exactitud, ambigüedad e impacto por separado

La calidad de la anotación no se reduce a un solo número. Cuatro preguntas deben evaluarse por separado:
Propiedad | Pregunta |
|---|---|
Acuerdo | ¿Los anotadores aplican la directriz de manera consistente? |
Precisión | ¿Las etiquetas coinciden con una referencia validada, el juicio de expertos u otra verdad de referencia aceptada? |
Ambigüedad | ¿Pueden los anotadores calificados discrepar razonablemente porque la definición de la tarea es poco clara? |
Impacto en la tarea | ¿Se concentran los errores en clases o subconjuntos críticos para el modelo? |
Un alto nivel de acuerdo no demuestra corrección. Un grupo puede aplicar de forma consistente una directriz defectuosa. Un bajo nivel de acuerdo también puede indicar una tarea genuinamente ambigua en lugar de una anotación descuidada.
La evidencia útil puede incluir la tasa de error adjudicada, el acuerdo entre anotadores, la tasa de errores críticos, la precisión por clase, la tasa de retrabajo, la tasa de rechazo en las revisiones y la consistencia entre lotes. Una cifra de precisión global puede ocultar fallos concentrados en una clase minoritaria que tienen un impacto desproporcionado en el producto.
8. Auditoría de los metadatos, tanto de su origen como de su completitud
Los metadatos deben verificarse para comprobar su integridad, exactitud, coherencia, legibilidad por máquina, relevancia para la tarea y trazabilidad. También debe ser posible determinar cómo se produjo un campo.
• Introducido por el creador o colaborador.
• Suministrado por un editor o proveedor de medios de stock.
• Importado desde otro sistema de origen.
• Inferido o extraído automáticamente.
• Generado por un sistema de IA.
• Editado más tarde por un humano o por un proceso aguas abajo.
Dos leyendas pueden tener texto idéntico al tiempo que aportan evidencias distintas sobre cómo fueron creadas. Las palabras clave de stock también pueden ser metadatos útiles para la búsqueda sin ser etiquetas de referencia. La prueba correcta es que los metadatos respalden el modelo o flujo de trabajo real.
9. Diseñar particiones de evaluación en torno a la afirmación de generalización
La unidad de partición debe reflejar lo que se supone que debe demostrar la evaluación. Si la afirmación se refiere a vídeos no vistos, agrupa por vídeo. Si se refiere a rodajes no vistos, agrupa por rodaje. Si se refiere a conceptos de plantilla no vistos, agrupa por familia de plantillas. Si se refiere a campañas no vistas, agrupa por campaña o por proyecto fuente.
Esto importa porque un archivo nuevo no es necesariamente una nueva situación de aprendizaje. Un archivo de plantilla puede no haber sido visto mientras que un archivo hermano de la misma familia ya se usó en el entrenamiento. Del mismo modo, las divisiones a nivel de fotograma pueden provocar fugas de información cuando fotogramas adyacentes de una misma secuencia cruzan el límite.
Objetivo de división | Unidad de agrupación preferida |
|---|---|
Vídeos no vistos | Vídeo o secuencia |
Sesiones de grabación no vistas | Sesión de grabación / captura |
Sujetos no vistos | Sujeto, cuando esté identificado de forma apropiada |
Conceptos de plantilla no vistos | Familia de plantillas |
Campañas no vistas | Campaña o proyecto de origen |
Verifique duplicados exactos, duplicados casi idénticos, activos de origen compartido, familias de plantillas, derivados sintéticos, secuencias comunes y otras dependencias que reducen la independencia de la evaluación.
10. Trata el tiempo como un cambio en la distribución, no como una puntuación genérica de frescura.
La recencia importa solo cuando el entorno objetivo cambia de maneras que afectan a la tarea. Los estilos de diseño históricos pueden ser valiosos para un sistema destinado a modelar períodos anteriores. Un sistema de recomendación actual puede necesitar formatos de plataforma recientes y distribuciones de categorías.
Un conjunto de datos estático no deriva por sí solo. El entorno objetivo puede desplazarse, o una nueva versión del conjunto de datos puede tener una distribución diferente. Realice un seguimiento de cambios mensurables, como las frecuencias por categoría, la combinación de fuentes y formatos, el idioma y otras variables que importan para el despliegue.
11. Hacer que la procedencia, los derechos y las versiones sean rastreables

La documentación del conjunto de datos debe permitir rastrear de dónde provienen los datos, cómo se transformaron, cómo se anotaron y qué versión contiene el registro. La evidencia de derechos debe estar vinculada a los registros pertinentes o a los grupos de origen cuando sea práctico.
• Fuente original y método de recopilación.
• Información del creador o de los colaboradores, cuando corresponda.
• Historial de adquisición y procesamiento.
• Historial de anotación o enriquecimiento.
• Versión del conjunto de datos y fecha de lanzamiento.
• Términos de la licencia y permisos de uso previstos.
• Restricciones relacionadas con uso comercial, desarrollo de modelos, redistribución, ámbito geográfico, colaboradores, marcas registradas o contractuales cuando sea relevante.
Utilice una terminología precisa para la evidencia. La cobertura de los registros de procedencia describe qué parte del corpus relevante está vinculada a los registros de procedencia exigidos. La cobertura de los registros de derechos describe qué parte está vinculada a la evidencia de derechos requerida. Una cobertura documental completa no demuestra que todas las conclusiones legales sean correctas; indica que se puede localizar la evidencia relevante.
Para los equipos que estandarizan la documentación de conjuntos de datos, MLCommons Croissant 1.1 es un formato legible por máquina vigente que admite metadatos estructurados del conjunto de datos, procedencia, políticas de uso, enlaces de vocabulario y descripciones de datos más complejas. La especificación se publicó el 29 de enero de 2026. Puede mejorar la interoperabilidad y la auditabilidad, pero adoptar un estándar de metadatos no garantiza la calidad del conjunto de datos.
12. Evaluar los datos reales y sintéticos según los mismos requisitos de la tarea
“real” y “sintético” describen cómo se obtuvieron los ejemplos. No indican si una distribución es apropiada.
Fuente de datos | Contribución potencial | Preguntas para evaluar |
|---|---|---|
Datos creados o recopilados por humanos | Variación natural, contexto específico de la fuente, artefactos reales de producción | ¿Qué tan representativo es del despliegue? ¿Qué poblaciones o condiciones faltan? |
Datos sintéticos | Cobertura controlada, casos raros, variación parametrizada | ¿Aporta valor de transferencia? ¿Introduce artefactos del generador o combinaciones poco realistas? |
Datos híbridos | Combinación dirigida de cobertura real y sintética | ¿Qué segmentos sintéticos aportan valor medible y qué efectos secundarios aparecen? |
Un conjunto de datos híbrido está justificado cuando el componente sintético aporta un valor medido a regiones seleccionadas del problema. No es automáticamente la mejor configuración.
13. Trata el filtrado como una intervención en los datos
El filtrado cambia la distribución del conjunto de entrenamiento. Eliminar ejemplos de baja puntuación, inusuales, difíciles o poco frecuentes puede mejorar una métrica de calidad estrecha a la vez que reduce la cobertura útil en otros ámbitos.
Antes de aplicar una regla de filtrado amplia, compare las porciones eliminadas y las retenidas. Cuando sea posible, pruebe el corpus resultante bajo un protocolo fijo de entrenamiento y evaluación. La pregunta correcta no es solo qué tan limpios parecen los datos restantes, sino qué información elimina la regla de filtrado.
14. ¿Qué cambios introduce la investigación actual de IA centrada en los datos en la calidad de los conjuntos de datos?
DataComp estableció un modelo experimental útil para la curación de conjuntos de datos: mantener el modelo y la configuración de entrenamiento suficientemente constantes, cambiar los datos de entrenamiento y medir los resultados posteriores. Su benchmark visual original usó un conjunto candidato de 12,8 mil millones de pares imagen-texto y evaluó subconjuntos curados con entrenamiento estandarizado y múltiples conjuntos de prueba posteriores.
Un preprint de DataComp-VLM de junio de 2026 extiende ese enfoque de curación controlada al entrenamiento visión‑lenguaje. Informa experimentos a lo largo de un corpus de seis billones de tokens de conjuntos de datos multimodales y prueba filtrado, mezcla, formateo y muestreo. En el escenario reportado, la mezcla de datos tuvo más impacto que el filtrado en la calidad del conjunto de entrenamiento resultante. La lección más amplia es metodológica: la curación de datos es un conjunto de intervenciones que debe evaluarse por su impacto en el modelo, no un concurso de limpieza.
Investigaciones y guías de Google, el NIST y otros profesionales también refuerzan la necesidad de conectar las decisiones sobre el conjunto de datos con el uso previsto, el contexto de despliegue, el diseño de evaluación y la evidencia documentada. El resultado es un flujo de trabajo más defendible: definir el requisito, medirlo, preservar la evidencia y probar si la intervención cambia la capacidad que le interesa.
15. Usa métricas que respondan a una pregunta de decisión
Pregunta | Ejemplo de evidencia |
|---|---|
¿Los archivos son estructuralmente utilizables? | Tasa de corrupción, cumplimiento del formato, tasa de archivos faltantes, cumplimiento de dimensiones |
¿Son fiables las etiquetas? | Tasa de errores adjudicados, grado de acuerdo, tasa de errores críticos, revisión de la taxonomía |
¿Los metadatos son utilizables? | Cobertura de campos obligatorios, tasa de errores validados, trazabilidad del origen de los metadatos |
¿El contenido es redundante? | Tasa de duplicados exactos, concentración de derivados/familia de origen, clústeres de similitud |
¿La cobertura coincide con los requisitos? | Cobertura por segmento, frecuencias por categoría, concentración por fuente, presencia de casos límite |
¿Son independientes las particiones? | Solapamiento de duplicados entre particiones, solapamientos entre familias, solapamientos entre grupos de fuentes |
¿Se puede rastrear la evidencia? | Cobertura de registros de procedencia, cobertura de registros de derechos, cobertura de registros de versiones |
¿El conjunto de datos ayuda al sistema? | Métricas posteriores al protocolo fijo, métricas de segmentos críticos, coste de cómputo y de remediación |
No convierta estas medidas en una puntuación universal. Una métrica es útil cuando respalda una decisión sobre un requisito definido. Los datos de evaluación pueden requerir un umbral de calidad más alto que el de los datos de entrenamiento porque los errores en el conjunto de evaluación pueden cambiar el rendimiento aparente del sistema.
16. Un flujo de trabajo práctico para la evaluación de conjuntos de datos de IA

1. Defina el objetivo del modelo o producto y escriba las condiciones objetivo en términos observables.
2. Convierta esos requisitos en pruebas de aceptación, incluyendo segmentos críticos y bloqueadores graves.
3. Revise la documentación, la metodología de origen, el historial de versiones, la evidencia de derechos y las limitaciones conocidas.
4. Elija métodos de muestreo que se ajusten a las preguntas: aleatorio, estratificado, basado en riesgo o multilote según sea necesario.
5. Ejecute comprobaciones estructurales automatizadas de archivos, formatos, dimensiones, metadatos, corrupción y duplicados evidentes.
6. Audite las anotaciones para verificar acuerdo, precisión, ambigüedad e impacto en la tarea.
7. Mida la cobertura, la representación, la concentración de fuentes y la variación significativa.
8. Mapee las relaciones derivadas y de origen, luego diseñe divisiones de evaluación en torno a la afirmación de generalización.
9. Verifique la procedencia, la evidencia de derechos y las versiones del conjunto de datos.
10. Si la decisión es lo suficientemente importante, realice una intervención de datos controlada a nivel de modelo y compare los resultados agregados y de segmentos críticos.
11. Documente la decisión, los requisitos de remediación, las limitaciones y la evidencia retenida para la versión aprobada del conjunto de datos.
La aceptación del conjunto de datos es interfuncional cuando la adecuación técnica, el rendimiento del modelo, los términos comerciales y la evidencia de derechos son igualmente importantes. Asigne responsables explícitos a cada prueba en lugar de asumir que un único equipo puede certificar todo el corpus.
17. Utilice una evaluación inicial rápida para el triaje
Una revisión inicial puede identificar razones evidentes para detenerse o investigar. No debe interpretarse como una certificación universal de 30 minutos porque el tamaño del conjunto de datos, la modalidad, la documentación y el riesgo varían ampliamente.
1. Revise la fuente, el uso previsto, el método de recopilación, la versión, las limitaciones conocidas, la procedencia y la evidencia de derechos.
2. Inspeccione un subconjunto muestreado de manera genuina en lugar de confiar solo en ejemplos seleccionados por el proveedor.
3. Realice comprobaciones básicas de integridad de archivos, formatos, dimensiones, metadatos faltantes y contenido duplicado obvio.
4. Observe las distribuciones y las relaciones entre las fuentes que sean relevantes para el caso de uso.
5. Registre los bloqueos sin resolver y decida si proceder con las pruebas formales de aceptación.
Una muestra puede validar la revisión. No puede, por sí sola, establecer las propiedades del conjunto de datos completo.
18. ¿Qué deberían preguntar los compradores a un proveedor de conjuntos de datos?
Para un conjunto de datos comercial, enfoque el proceso de debida diligencia en evidencia medible y en los términos de entrega. Los compradores también pueden usar el catálogo público de un proveedor para inspeccionar las modalidades disponibles y la cobertura antes de solicitar una muestra representativa. Por ejemplo, la biblioteca de conjuntos de datos con licencia de Wavebreak Media agrupa las colecciones por modalidad y caso de uso:
Wavebreak Media AI dataset library
• ¿Qué criterios de aceptación se definen antes de la entrega?
• ¿Qué estadísticas de calidad se calculan sobre el conjunto de datos completo en lugar de una muestra curada?
• ¿Cómo se identifican duplicados exactos, derivados y grupos de fuentes relacionados?
• ¿Cómo se mide y adjudica la calidad de las anotaciones?
• ¿Cómo se validan los errores de metadatos y cuál es el origen de los metadatos?
• ¿Qué informes de cobertura y distribución acompañan al conjunto de datos?
• ¿Cómo se gestionan las relaciones entre entrenamiento, validación y prueba?
• ¿Qué evidencia de procedencia y de derechos se incluye con los registros relevantes o los grupos de origen?
• ¿Qué sucede cuando se encuentran defectos posteriores a la entrega?
• ¿Puede el comprador evaluar una muestra representativa o un lote piloto antes de la entrega completa?
El costo del conjunto de datos debe evaluarse después de tener en cuenta el trabajo necesario para que los datos entregados cumplan con los requisitos del comprador. Un precio de adquisición bajo puede verse compensado por la desduplicación, el re-etiquetado, la corrección de metadatos, la verificación de derechos, la revisión manual, el almacenamiento y el trabajo de ingeniería. Para comparaciones económicas, distinga entre unidades entregadas, unidades aceptadas y unidades listas para el modelo.

Jen Togonon
