Cuando la UE investiga los conjuntos de datos de entrenamiento de la IA, la cuestión central es qué se puede averiguar sobre el material que hay detrás de un modelo sin exigir a su proveedor que publique todos los registros de entrenamiento. Para los proveedores de IA de propósito general, la respuesta empieza ahora con un resumen público del contenido de entrenamiento, una política de derechos de autor y documentación técnica en virtud del Reglamento de IA de la UE.
Estos requisitos son importantes para los desarrolladores, las empresas que utilizan IA, los titulares de derechos de autor y quienes evalúan si los modelos funcionan en las lenguas europeas. También tienen sus límites: un resumen puede dar más visibilidad a las fuentes generales de datos, pero no es una copia del conjunto de datos ni demuestra que se hayan resuelto todas las cuestiones relacionadas con los derechos, la calidad o los sesgos. La mejor manera de interpretar lo que puede determinar una investigación de la UE sobre los datos de entrenamiento de la IA es comprender las distintas normas.
¿Qué significa que la UE investigue los conjuntos de datos de entrenamiento de la IA?
La expresión puede dar a entender que los investigadores están examinando todo el archivo de datos de un modelo. El marco de la UE es más específico. El Reglamento (UE) 2024/1689, conocido como Reglamento de IA, establece obligaciones para los proveedores de modelos de IA de propósito general y requisitos independientes de gobernanza de datos para determinados sistemas de IA de alto riesgo. También ofrece a las autoridades vías para solicitar información relacionada con un modelo cuando no puedan completar una investigación por otros medios.
En resumen: la UE exige a los proveedores de IA de propósito general que publiquen un resumen del contenido de entrenamiento y mantengan la documentación justificativa, mientras que los sistemas de IA de alto riesgo están sujetos a obligaciones de gobernanza de conjuntos de datos. Estas herramientas permiten un mayor control de los datos de entrenamiento, pero no obligan a todos los proveedores a publicar sus conjuntos de datos completos.
Es importante distinguir entre la transparencia pública y el acceso regulatorio. Cualquier persona puede leer el resumen del contenido de entrenamiento de un proveedor. Un regulador que investigue el cumplimiento puede necesitar información que vaya más allá de ese resumen. En virtud del Reglamento de IA, si una autoridad de vigilancia del mercado no puede concluir una investigación porque carece de información sobre un modelo de IA de propósito general, puede solicitar a la Oficina de IA que haga cumplir el acceso a esa información. Esta vía no convierte todas las solicitudes regulatorias en divulgaciones públicas.
Para quienes siguen una controversia concreta, el primer paso es identificar qué está ocurriendo realmente. Preguntar si un proveedor ha publicado su resumen es distinto de plantear una controversia sobre derechos de autor relativa al material de entrenamiento. Ambas cosas también son distintas de examinar la gobernanza de los conjuntos de datos de un sistema de alto riesgo. Describir las tres situaciones como una investigación de la UE puede ocultar quién debe facilitar la información, qué obligación jurídica se aplica y qué pueden demostrar las pruebas disponibles.
- Un resumen público del contenido de entrenamiento explica qué tipos generales de material se utilizaron para entrenar un modelo de IA de propósito general.
- La documentación técnica respalda la supervisión del modelo, pero no es una versión descargable de su corpus de entrenamiento.
- Una política de derechos de autor explica cómo aborda un proveedor las obligaciones de derechos de autor relacionadas con el entrenamiento.
- Las normas aplicables a los sistemas de alto riesgo examinan la gobernanza y la idoneidad de los datos de entrenamiento, validación y prueba de esos sistemas.
Son enfoques relacionados, pero no pruebas intercambiables. El resumen público de un proveedor puede facilitar la formulación de preguntas, mientras que las facultades de acceso de los reguladores y las normas aplicables a cada sistema determinan cómo pueden investigarse esas cuestiones. El resultado práctico es una mayor rendición de cuentas sin una obligación general de publicar en línea los conjuntos de datos de entrenamiento completos.
¿Qué deben revelar los proveedores de IA de propósito general sobre el contenido de entrenamiento?
Los proveedores de modelos de IA de propósito general en la UE deben publicar un resumen público del contenido utilizado para el entrenamiento y mantener actualizada la documentación técnica. También deben aplicar una política de derechos de autor. Estas obligaciones empezaron a aplicarse el 2 de agosto de 2025. La Comisión ha publicado una plantilla para el resumen, con el objetivo de que las divulgaciones sean sencillas, uniformes y eficaces, en lugar de dejar que cada proveedor invente un formato distinto.
El resumen está concebido expresamente para el público. Por ello, resulta útil no solo para los reguladores, sino también para quienes necesitan un punto de partida para entender qué tipos de contenido han influido en un modelo. Por ejemplo, una editorial preocupada por sus obras, o una organización que evalúe un modelo para usuarios europeos, puede buscar información sobre el contenido de entrenamiento e identificar qué preguntas conviene plantear. No debe considerarse que el resumen es un inventario de cada elemento, salvo que el proveedor ofrezca por separado ese nivel de detalle.
Por qué importa la plantilla de la Comisión
Una plantilla común facilita encontrar, leer y comparar las divulgaciones. Sin una estructura compartida, un proveedor podría describir tipos generales de fuentes, otro podría ofrecer un relato sobre la recopilación de datos y un tercero podría presentar la información de una forma difícil de comparar con las demás. La normalización no hace que las divulgaciones sean idénticas en cuanto al contenido, pero ofrece a los lectores un lugar más previsible donde buscar respuestas.
La Comisión afirma que su plantilla complementa el Código de Buenas Prácticas para la IA de Propósito General y las directrices. También ha presentado la plantilla y las orientaciones como instrumentos para ayudar a los proveedores a comercializar modelos en la UE sin demora y, al mismo tiempo, cumplir sus obligaciones de transparencia. Se trata de una decisión de diseño importante: la UE intenta que la divulgación sea un requisito viable para acceder al mercado, no una respuesta puntual a una polémica.
Qué puede responder un resumen útil y qué no
Un resumen puede aclarar las categorías generales de contenido utilizadas en el entrenamiento y ofrecer a terceros una base para formular preguntas más precisas. Puede ayudar a distinguir entre una preocupación sobre una categoría de fuentes y otra sobre una obra o registro concretos. También crea una descripción pública que puede leerse junto con la explicación de la política de derechos de autor del proveedor.
Su límite se deriva de su finalidad. El Reglamento de IA exige un resumen del contenido de entrenamiento, no la publicación del conjunto de datos de entrenamiento completo. Por tanto, los lectores no deben deducir que un contenido que no aparece en una lista detallada estuvo necesariamente ausente del entrenamiento: el documento es un resumen, no necesariamente una relación de elementos individuales. A la inversa, la presencia de una categoría de fuentes no resuelve por sí sola si el uso de un material concreto cumplió las normas de derechos de autor. El resumen mejora la visibilidad, pero la solidez de cualquier conclusión sigue dependiendo de la pregunta planteada y de la información disponible.
¿Cómo funcionan la aplicación de las normas y las solicitudes de información en virtud del Reglamento de IA?
El calendario de aplicación da peso práctico a las normas de divulgación. Las obligaciones relativas a la IA de propósito general empezaron a aplicarse el 2 de agosto de 2025. A partir del 2 de agosto de 2026, la Comisión afirma que podrá exigir el pleno cumplimiento a los proveedores, incluso mediante multas si no respetan las normas de transparencia del Reglamento de IA. La Comisión también publicó orientaciones en 2026 en las que explica las obligaciones de transparencia vinculadas a la aplicación del Reglamento a partir del 2 de agosto de 2026.
Estas fechas distinguen la existencia de una obligación de la intensificación posterior de su aplicación. No demuestran que todos los proveedores hayan incumplido una obligación ni que se esté investigando un modelo concreto. Al leer una noticia sobre una investigación de la UE, conviene comprobar si se refiere al resumen publicado por un proveedor, a un regulador que solicita información adicional o a un debate más amplio sobre cómo deben funcionar las normas.
El Reglamento de IA ofrece una vía para las autoridades que carecen de la información necesaria para concluir una investigación relacionada con un modelo de IA de propósito general. En esa situación, una autoridad de vigilancia del mercado puede pedir a la Oficina de IA que haga cumplir el acceso a la información relacionada con el modelo. Este mecanismo es importante porque un resumen público puede revelar un problema sin aportar todo lo necesario para examinarlo. La existencia de una vía regulatoria para obtener más información es una de las razones por las que no debe confundirse el documento público con el alcance total de la supervisión.
- Identifique el objeto del examen: un modelo de propósito general, un sistema de IA concreto o una afirmación sobre material de entrenamiento específico.
- Relacione la pregunta con la obligación aplicable, como un resumen público, una política de derechos de autor, documentación técnica o la gobernanza de conjuntos de datos de alto riesgo.
- Distinga lo que puede leer el público de la información que una autoridad puede solicitar durante una investigación.
- Evalúe el resultado a partir de las pruebas realmente obtenidas, en lugar de suponer que un resumen público demuestra o refuta todas las preocupaciones subyacentes.
Esta secuencia resulta útil tanto para las empresas como para quienes leen noticias sobre regulación. Una empresa que esté eligiendo un modelo puede consultar un resumen público y plantear preguntas de seguimiento al proveedor. No debería presentar esa revisión como equivalente al acceso de una autoridad a la información durante una investigación. Del mismo modo, anunciar que la Comisión puede imponer multas describe una facultad de aplicación de las normas, no demuestra que una multa esté justificada en un caso concreto.
La tendencia general apunta a una divulgación normalizada y aplicable. Los materiales recientes de la Comisión y el Parlamento se centran en la aplicación, las plantillas, la coherencia de las políticas de derechos de autor y la vigilancia del cumplimiento, en lugar de proponer que la transparencia tenga que partir de cero. Para los proveedores, esto hace que sea cada vez más importante mantener la coherencia entre las descripciones públicas y técnicas del contenido de entrenamiento a medida que cambian los modelos y su documentación.
Por qué los derechos de autor siguen siendo una cuestión central sobre los datos de entrenamiento
Los derechos de autor son una de las razones más evidentes por las que la gente quiere saber qué contienen los conjuntos de datos de entrenamiento de la IA. Un proveedor puede entrenar con grandes cantidades de contenido, mientras que un creador o una editorial tienen poca visibilidad sobre si se han utilizado obras concretas. El Reglamento de IA vincula estas preocupaciones al exigir a los proveedores de IA de propósito general que apliquen una política de derechos de autor y publiquen un resumen del contenido de entrenamiento.
Estos dos requisitos cumplen funciones distintas. Una política describe cómo aborda el proveedor sus obligaciones en materia de derechos de autor. Un resumen describe, a un nivel dirigido al público, el contenido utilizado para el entrenamiento. Leerlos conjuntamente puede facilitar el análisis del enfoque del proveedor, pero ninguno de los dos documentos debe confundirse con una resolución sobre la legalidad de todos los usos de entrenamiento.
Los materiales del Parlamento Europeo de 2025 y 2026 señalan que las obras protegidas por derechos de autor incluidas en los conjuntos de datos de entrenamiento de IA de propósito general siguen siendo objeto de controversia y mencionan la labor de revisión en curso de la UE sobre las normas de derechos de autor en el contexto de la IA. Este debate en curso ayuda a explicar por qué importan el nivel de detalle y la comparabilidad de los resúmenes públicos. Si un resumen es tan general que no permite formular una pregunta de seguimiento significativa, puede existir transparencia formal, pero seguir ofreciendo poca información práctica.
Preguntas que la divulgación puede ayudar a precisar
- ¿Qué tipos generales de contenido afirma el proveedor que contribuyeron al entrenamiento?
- ¿Publica el proveedor su política de derechos de autor junto con la explicación del contenido de entrenamiento?
- ¿La preocupación se refiere a toda una categoría de contenido, a una colección concreta o a una obra identificable?
- ¿Qué información adicional sería necesaria antes de sacar una conclusión sobre esa preocupación?
Estas preguntas no presuponen que haya habido una infracción. Ayudan a distinguir una cuestión de transparencia de una controversia sobre derechos. Un creador puede necesitar información sobre una obra concreta, mientras que el resumen público puede referirse principalmente a categorías. Un proveedor puede tener una política de derechos de autor, mientras que un crítico puede cuestionar cómo se aplica a una fuente concreta. La brecha resultante no se resuelve automáticamente exigiendo que todos los archivos de entrenamiento sean públicos, ya que la divulgación completa puede plantear sus propias complicaciones prácticas y relacionadas con los derechos.
Por tanto, el enfoque actual de la UE concede gran importancia a la calidad de los resúmenes y a la disponibilidad de otros mecanismos de supervisión. Una divulgación más normalizada puede facilitar la comparación entre proveedores, y las solicitudes regulatorias de información pueden abordar algunas cuestiones que un documento público no puede resolver. Sin embargo, los lectores deben distinguir entre la posibilidad de investigar y una conclusión definitiva: que los derechos de autor sean centrales en la política sobre datos de entrenamiento no determina la situación de ninguna obra concreta dentro del material de entrenamiento de un modelo.
¿En qué se diferencia la gobernanza de los conjuntos de datos de IA de alto riesgo?
El resumen del contenido de entrenamiento de un modelo de propósito general no es la única norma del Reglamento de IA que se ocupa de los datos. El artículo 10 aborda la gobernanza de los conjuntos de datos de los sistemas de IA de alto riesgo. Se centra, entre otras cosas, en la calidad y la gobernanza de los conjuntos de datos de entrenamiento, validación y prueba utilizados para esos sistemas. Esta cuestión es distinta de ofrecer al público una descripción general del contenido utilizado para entrenar un modelo de propósito general.
Los datos de entrenamiento ayudan a un sistema a aprender; los datos de validación y prueba sirven para evaluar su rendimiento. Es importante tratar estos conjuntos de datos por separado, porque una gobernanza deficiente en cualquiera de las etapas puede afectar a la confianza con la que se evalúa el sistema. El marco del artículo 10 centra la atención en cómo se seleccionan, gestionan y documentan los datos para un uso de alto riesgo, en lugar de considerar que una lista de fuentes de datos basta para demostrar su calidad.
El Reglamento también aborda el caso delicado de los datos personales de categorías especiales utilizados para detectar o corregir sesgos. Las normas establecidas exigen conservar registros que justifiquen por qué esos datos eran estrictamente necesarios. Este requisito de registro ilustra la disyuntiva: detectar resultados desiguales puede requerir un examen cuidadoso de características sensibles, pero para hacerlo se necesita una justificación específica, no una suposición general de que es aceptable recopilar más datos sensibles.
Las distintas preguntas requieren pruebas distintas
En el caso de un sistema de alto riesgo, quizá haya que preguntar si los conjuntos de datos son adecuados para la finalidad del sistema y si el proveedor puede explicar sus decisiones de gobernanza. En el caso de un modelo de propósito general, la primera pregunta de cara al público puede ser si existe un resumen del contenido de entrenamiento y qué dice. Un modelo de propósito general también puede utilizarse en un producto de IA más amplio, por lo que es especialmente importante no suponer que un único documento de divulgación responde a todas las preguntas sobre el sistema.
- La transparencia sobre el contenido de entrenamiento pregunta qué tipos de contenido contribuyeron a un modelo de propósito general.
- La gobernanza de los conjuntos de datos de alto riesgo pregunta cómo se gestionan los datos pertinentes de entrenamiento, validación y prueba para un tipo concreto de sistema.
- Los registros sobre datos personales de categorías especiales explican por qué su uso para detectar o corregir sesgos era estrictamente necesario.
Esta distinción ayuda a las organizaciones a evitar un error habitual al evaluar a un proveedor de IA: aceptar un resumen pulido del modelo como sustituto de las pruebas sobre la gobernanza de los conjuntos de datos de un sistema de alto riesgo. También es posible cometer el error contrario. La documentación sobre los datos de validación de un sistema concreto no explica por sí sola el contenido general con el que se entrenó un modelo subyacente de propósito general. Una evaluación sólida empieza por identificar el tipo de IA que se proporciona y la pregunta precisa sobre los datos que necesita respuesta.
¿Por qué son importantes la cobertura lingüística y cultural al examinar los conjuntos de datos de la UE?
Saber de dónde procede el contenido de entrenamiento es solo una parte de la evaluación de un modelo de IA en Europa. Los usuarios también necesitan saber si el modelo se ha probado en las lenguas y los contextos pertinentes. Un modelo puede parecer competente si se evalúa principalmente con material en inglés y, aun así, funcionar de forma distinta cuando una tarea depende de otra lengua europea o de un concepto específico de una localidad.
La Dirección General de Traducción de la Comisión puso de relieve este problema al presentar EU MMLU en julio de 2026. Señaló que la mayoría de los conjuntos de datos de evaluación de IA se habían creado en inglés y a menudo no reflejaban los contextos educativos, culturales y sociales europeos. EU MMLU está disponible en 16 lenguas oficiales de la UE y tiene por objeto medir si los modelos ofrecen un rendimiento justo en distintos contextos lingüísticos y culturales.
Ese parámetro de referencia aborda la evaluación, no la relación pública de todos los elementos utilizados en el entrenamiento. Es importante distinguir ambas cosas. Un resumen del contenido de entrenamiento puede indicar que un proveedor utilizó material multilingüe, pero por sí solo no puede demostrar un rendimiento comparable en distintas lenguas. Una evaluación diseñada en torno a contextos europeos puede revelar problemas que una descripción general de las fuentes de entrenamiento no detectaría. A la inversa, los resultados de los parámetros de referencia no pueden reconstruir por sí solos el conjunto de datos subyacente de un modelo.
De los objetivos multilingües a mejores pruebas
La UE también respalda el desarrollo de modelos en sus lenguas oficiales. En 2026, la Comisión seleccionó al consorcio EUROPA para un proyecto de IA de vanguardia destinado a crear un modelo de código abierto que abarque las 24 lenguas de la UE. La iniciativa refleja una ambición más amplia que el alcance de 16 lenguas de EU MMLU: una consiste en crear un modelo que abarque todas las lenguas oficiales de la UE, mientras que la otra ofrece un parámetro de evaluación multilingüe.
Ninguna de las dos iniciativas significa que una sola puntuación de evaluación o una etiqueta lingüística resuelva las cuestiones de calidad. La cobertura puede variar según la tarea, la materia y el contexto cultural. A la hora de elegir un modelo de IA, resulta más útil combinar la transparencia sobre el contenido de entrenamiento con evaluaciones que se asemejen a las lenguas y situaciones en las que realmente se utilizará el modelo.
- Identifique las lenguas y los contextos relevantes para el uso previsto, en lugar de suponer que los resultados en inglés se trasladan sin cambios.
- Consulte la información disponible sobre el contenido de entrenamiento para entender cómo describe el proveedor sus fuentes de material.
- Busque evaluaciones que midan el rendimiento lingüístico y cultural pertinente, incluidos parámetros de referencia multilingües cuando corresponda.
- Mantenga separadas la transparencia sobre las fuentes y las pruebas de rendimiento: cada una responde a preguntas que la otra no puede resolver.
Por eso, las investigaciones de la UE sobre los conjuntos de datos de entrenamiento de la IA tienen una dimensión que va más allá de los derechos de autor y la documentación regulatoria. La composición de los datos puede determinar qué lenguas y experiencias refleja un modelo, mientras que la evaluación permite comprobar si esas preocupaciones se manifiestan en el rendimiento observado. Los resúmenes públicos y los parámetros de referencia multilingües son herramientas complementarias, no alternativas entre sí.
¿Puede la UE exigir transparencia y, al mismo tiempo, mejorar el acceso a los datos de entrenamiento?
Las normas de transparencia piden a los proveedores que rindan cuentas sobre el contenido utilizado en los modelos. La política de datos de la UE también se pregunta cómo pueden obtener los desarrolladores datos adecuados. Estos objetivos pueden entrar en conflicto si la divulgación se considera únicamente una carga, pero también pueden reforzarse mutuamente: un acceso fiable y unos registros más claros pueden facilitar la explicación de cómo se entrenó un modelo.
En su labor de 2025 sobre políticas de IA y datos, la Comisión señaló que el acceso limitado a conjuntos de datos esenciales era uno de los obstáculos más inmediatos de la UE para desarrollar IA a gran escala. Pidió mejorar el acceso a conjuntos de datos esenciales y a entornos de confianza, incluidos laboratorios de datos que conecten los espacios de datos con los desarrolladores de IA. Esta preocupación se refiere a las condiciones necesarias para crear y mejorar la IA, no a una relajación de las obligaciones sobre el contenido de entrenamiento.
El propio Reglamento de IA vincula la infraestructura de datos con la calidad de los modelos. El considerando 68 afirma que los espacios comunes europeos de datos y el intercambio de datos entre empresas y administraciones públicas serán fundamentales para ofrecer un acceso fiable, responsable y no discriminatorio a datos de alta calidad para entrenar, validar y probar sistemas de IA. Leído junto con las obligaciones de transparencia, esto apunta a un objetivo político con dos vertientes: facilitar el acceso a datos útiles mediante acuerdos creíbles y hacer que su uso en sistemas de IA sea más responsable.
La disyuntiva que plantea un mejor acceso
Crear más vías de acceso a los datos no significa que todos los conjuntos de datos deban poder copiarse o publicarse libremente. Los datos pueden estar sujetos a derechos, restricciones o contener material sensible, y un entorno de confianza no equivale a un acceso público sin restricciones. En el otro extremo, las barreras de acceso pueden limitar la capacidad de los desarrolladores para crear modelos y evaluaciones adecuados a las lenguas y los contextos europeos. El énfasis de la Comisión en los laboratorios y espacios de datos reconoce que la infraestructura para un acceso responsable importa tanto como el volumen de material disponible.
Para los proveedores, esto crea un vínculo práctico entre la adquisición de datos y la transparencia. Si resulta difícil rastrear internamente el origen de los datos y las condiciones de acceso, será más complicado elaborar un resumen público significativo y mantener la documentación. Si se tienen en cuenta desde el principio los acuerdos de acceso y la gobernanza de los datos, los proveedores estarán mejor preparados para explicar las decisiones generales sobre el contenido de entrenamiento sin suponer que deben exponer todos los registros subyacentes.
Para los responsables políticos y los usuarios, la lección es que no conviene presentar la divulgación y la innovación como una disyuntiva sencilla. Un resumen puede facilitar el control, mientras que una infraestructura de datos fiable puede fomentar el desarrollo. Ambos deben evaluarse en función de lo que ofrecen: acceso útil a datos de alta calidad, una gobernanza creíble e información que permita a otras personas formular preguntas bien fundamentadas sobre los modelos resultantes.
¿Qué deberían comprobar los lectores y compradores de IA en una divulgación sobre datos de entrenamiento?
Un resumen público resulta más útil cuando se lee como el inicio de una evaluación, no como su conclusión. El siguiente paso depende de su función. Un titular de derechos de autor puede centrarse en una categoría concreta de obras. Una empresa que compre un modelo puede interesarse por la documentación y por si se ha evaluado el rendimiento en las lenguas que utilizan sus clientes. Un equipo que implante un sistema de alto riesgo puede necesitar examinar la gobernanza de los conjuntos de datos más allá de la declaración pública del modelo subyacente.
Empiece por la descripción que ofrece el proveedor del contenido de entrenamiento y por el alcance del modelo al que se refiere. A continuación, compruebe si la pregunta que necesita responder corresponde al resumen público, a la política de derechos de autor del proveedor, a la documentación técnica, a la gobernanza del sistema o a la evaluación del rendimiento. La plantilla de la Comisión debería facilitar una primera lectura más coherente entre proveedores, pero la uniformidad del formato no sustituye al criterio necesario para valorar si la información es suficiente.
- Si necesita entender la procedencia general de los datos: lea el resumen público del contenido de entrenamiento y observe qué explica con claridad y qué sigue siendo demasiado general para responder a su pregunta.
- Si le preocupa una cuestión de derechos de autor: lea el resumen junto con la política de derechos de autor del proveedor y distinga las preguntas sobre una categoría de fuentes de las preguntas sobre una obra concreta.
- Si está evaluando un sistema de alto riesgo: pregunte por la gobernanza de los datos de entrenamiento, validación y prueba de ese sistema, en lugar de basarse únicamente en el resumen de un modelo de propósito general.
- Si importa el rendimiento multilingüe: solicite pruebas de evaluación pertinentes y compruebe si reflejan sus lenguas y contextos.
- Si sigue una noticia sobre la aplicación de las normas: distinga entre una obligación de divulgación pública, una solicitud de información adicional sobre el modelo por parte de una autoridad y una conclusión de incumplimiento.
También hay límites importantes en cuanto a lo que puede concluir un lector externo. Un resumen aparentemente detallado quizá no determine la situación de cada obra individual. Un resumen escueto puede justificar más preguntas sin demostrar que el entrenamiento fuera indebido. Una afirmación sobre un modelo multilingüe puede justificar que se realicen pruebas, pero no garantiza resultados igual de sólidos en todas las lenguas oficiales. Tener claros estos límites hace que el examen sea más riguroso.
Por tanto, la lectura más sólida combina varios tipos de pruebas: lo que el proveedor dice públicamente sobre el contenido de entrenamiento, cómo describe su enfoque de los derechos de autor, qué documentación se aplica al modelo o sistema y cómo se evalúa el rendimiento para el uso previsto. Cuando un regulador necesita más información para completar una investigación, el Reglamento de IA ofrece una vía que implica a la Oficina de IA. Para los demás, el resumen público sigue siendo un valioso punto de partida, siempre que no se confunda con el expediente completo.
El examen de los conjuntos de datos de entrenamiento de la IA por parte de la UE está pasando de una demanda general de apertura a preguntas concretas sobre resúmenes, documentación, políticas de derechos de autor, gobernanza de conjuntos de datos y acceso regulatorio. El Reglamento de IA hace más visible el contenido de entrenamiento y proporciona a las autoridades herramientas para solicitar información, pero no llega a exigir la divulgación pública de los conjuntos de datos completos.
La conclusión más útil es hacer corresponder las pruebas con la pregunta. Lea un resumen del contenido de entrenamiento para entender las entradas generales de un modelo, examine la gobernanza de los conjuntos de datos de alto riesgo cuando el sistema lo requiera y utilice evaluaciones pertinentes desde el punto de vista lingüístico para comprobar el rendimiento. Ninguna de estas herramientas responde por sí sola a todas las preguntas; en conjunto, ofrecen una base más sólida para evaluar en qué se basa un modelo de IA y dónde hace falta un examen más profundo.