Blog institucional

Datos públicos como materia prima para LLM: qué implica para quien los procesa

Datos públicos como materia prima para LLM: qué implica para quien los procesa

La conversación pública sobre inteligencia artificial gira mayoritariamente alrededor de la infraestructura de cómputo: centros de datos, chips, inversiones multimillonarias, alianzas entre grandes corporaciones. Esa narrativa es visible porque mueve mercados. Pero hay una capa anterior, menos espectacular y más determinante, que apenas aparece en los titulares: la calidad de los datos que alimentan esos modelos antes de que el hardware haga ningún cálculo.

Los grandes modelos de lenguaje (LLM) no nacen de la nada. Nacen de texto. Y ese texto, en su mayor parte, procede del universo público de Internet: foros, publicaciones institucionales, medios de comunicación, bases de datos abiertas, repositorios de documentos. La pregunta que importa no es cuánta potencia de cómputo se despliega para entrenarlos, sino qué calidad tiene ese texto cuando llega a la pipeline de entrenamiento.

Quien trabaja en el procesamiento sistemático de fuentes públicas lleva tiempo sabiendo que esta pregunta no tiene respuesta sencilla.

El problema que el cómputo no resuelve

Invertir miles de millones en infraestructura de cómputo no corrige un dataset mal construido. Un modelo entrenado sobre datos ruidosos, temporalmente inconsistentes o sesgados hacia determinadas fuentes no mejora por tener más GPUs disponibles. Mejora si el dato de entrada es preciso, está bien delimitado y ha pasado por un proceso riguroso de Text and Data Mining (TDM).

El TDM, en el sentido que recoge el Art. 4 de la Directiva (UE) 2019/790, no es solo una habilitación legal. Es también una descripción técnica de lo que debe ocurrir antes de que cualquier modelo vea los datos: acceso sistemático a fuentes públicas, extracción estructurada, normalización y análisis derivado. Cada uno de esos pasos introduce puntos de fallo que, si no se controlan, degradan la utilidad del resultado final.

La escala del problema se ve con claridad cuando se intenta construir un corpus de entrenamiento multilingüe, multidominio y temporalmente coherente a partir del universo público. No existe ningún atajo técnico que sustituya al trabajo de procesamiento bien hecho.

Qué significa "dato de calidad" en este contexto

El concepto de calidad aplicado a datos para LLM tiene dimensiones específicas que no siempre se articulan con precisión.

Cobertura real frente a cobertura aparente. Un corpus puede contener millones de documentos y seguir siendo estructuralmente pobre si sobre-representa ciertos dominios temáticos, ciertos idiomas o ciertos periodos temporales. La cobertura no se mide en volumen bruto; se mide en la distribución efectiva sobre el universo que se quiere representar.

Consistencia temporal. Los LLM son sensibles a la coherencia diacrónica del corpus. Un modelo entrenado sobre datos donde la misma entidad recibe denominaciones distintas en distintas épocas, o donde hay discontinuidades abruptas en la cobertura de ciertos temas, aprende esas inconsistencias y las proyecta en sus salidas. El procesamiento de fuentes públicas debe preservar la trazabilidad temporal del dato.

Limpieza sin pérdida de señal. La depuración de ruido es necesaria, pero agresiva puede ser contraproducente. Eliminar duplicados obvios está bien; eliminar variantes textuales que contienen información semántica diferenciada es un error que el modelo no puede corregir después.

Procedencia y legitimidad jurídica. En el marco del Art. 4 de la Directiva (UE) 2019/790 y el Art. 67 bis LPI, el acceso a fuentes públicas con fines de TDM está habilitado legalmente siempre que se cumplan los requisitos establecidos. Pero esa habilitación no es automática ni uniforme: depende de que el acceso sea legítimo, de que los publicadores no hayan ejercido su derecho de opt-out de forma válida, y de que el uso esté circunscrito al análisis derivado. Ignorar esta dimensión no es solo un riesgo legal; es un riesgo de calidad, porque los datos obtenidos fuera de ese marco tienden a ser menos fiables y menos reproducibles.

Por qué la fragmentación del universo público complica el entrenamiento

El universo público de Internet no es un repositorio homogéneo. Es un ecosistema fragmentado, dinámico y parcialmente opaco. Las fuentes cambian sus estructuras. Los contenidos se actualizan, se eliminan o se mueven sin aviso. Los idiomas, formatos y convenciones editoriales varían de forma radical entre dominios.

Para quien construye datos de entrenamiento a partir de ese universo, la fragmentación es el problema operativo central. No se resuelve con más almacenamiento ni con mejores modelos de lenguaje downstream. Se resuelve con infraestructura de procesamiento diseñada específicamente para absorber esa heterogeneidad sin degradar la coherencia del corpus resultante.

Esto implica, entre otras cosas: sistemas capaces de mantener la cobertura de fuentes en el tiempo sin interrupciones; procesos de normalización que respeten las particularidades de cada dominio; mecanismos de detección de cambios en las fuentes antes de que esos cambios contaminen el dataset.

TrawlingWeb opera sobre el universo público con esa lógica: el análisis derivado no comienza cuando el dato ya está limpio, sino mucho antes, en la fase de acceso y estructuración.

La pregunta que los equipos de IA deberían hacerse antes

Antes de decidir qué arquitectura de modelo usar, qué tamaño de contexto manejar o qué técnica de fine-tuning aplicar, hay una pregunta que debería responderse con precisión: ¿de dónde vienen exactamente los datos de entrenamiento y qué proceso han seguido?

Esa pregunta no es retórica. En la práctica, muchos equipos de IA trabajan con datasets cuya procedencia es opaca, cuya cobertura es desconocida y cuyo proceso de construcción no está documentado. El resultado es que el modelo se comporta de formas que no se entienden porque el problema está en una capa que nadie auditó.

El procesamiento riguroso del universo público —con cobertura trazable, consistencia temporal, legitimidad jurídica y análisis derivado documentado— no es un lujo metodológico. Es la condición de posibilidad de que los modelos entrenados sobre esos datos sean predecibles, evaluables y mejorables.

Quienes trabajan con datos públicos a escala, y lo hacen bien, están produciendo un insumo estratégico que el mercado todavía no ha aprendido a valorar correctamente. Eso cambiará cuando los modelos fallen por razones que se rastrean hasta el dato de origen —y eso, en muchos casos, ya está ocurriendo.

Si quieres entender mejor cómo TrawlingWeb aborda el procesamiento del universo público como fuente de análisis derivado, el punto de partida es siempre el mismo: la calidad no se añade al final del proceso, se construye desde el primer acceso a la fuente.

← Volver al blog Hablar con el equipo