Epovest
← Todas las guías

Guía

Cómo eligen los laboratorios de IA los sitios web que entran en sus corpus de entrenamiento

Por Simon Vasconcelos Lee

Fundador de Epovest

Haga a un asistente de IA una pregunta sobre su mercado: una parte de la respuesta viene de la memoria, es decir, de lo que el modelo absorbió durante su entrenamiento. Esa memoria se construyó sobre un corpus, el corpus se construyó sobre la web, y su sitio pasó la selección o no la pasó. Lo que está en juego es concreto: cuando su cobertura es escasa, el modelo responde con lo que su corpus sí contiene, incluido el historial de su homónimo.

La selección no es editorial. Nadie en un laboratorio de IA lee sitios web para decidir que el suyo merece un asiento. Es un pipeline: un rastreo, una pila de filtros, una pasada de deduplicación, un conjunto de contratos, una política de muestreo. Y está inusualmente bien documentado, porque los laboratorios publican cómo se construyen sus corpus incluso cuando mantienen privados los corpus mismos. Esta guía recorre ese pipeline etapa por etapa: qué conserva cada una, qué descarta, y qué implica eso para su manera de publicar.

El entrenamiento es una de las dos puertas de entrada a una respuesta. La otra es la lectura en vivo: páginas consultadas en el momento en que se hace la pregunta, con otras reglas y a un ritmo mucho más rápido. Medimos cuán distinto se comportan las dos puertas. Esta guía trata de la puerta de la memoria.

Un punto de partida compartido: el rastreo público

La mayoría de los corpus de entrenamiento documentados no empiezan con un rastreo propio del laboratorio. Empiezan con Common Crawl, una organización sin ánimo de lucro que rastrea la web desde 2008 y publica aproximadamente cada mes una instantánea fresca de varios miles de millones de páginas. C4, el corpus detrás de los modelos T5 de Google, es una instantánea de Common Crawl filtrada. La parte web descrita en el artículo de OpenAI de 2020, «Language Models are Few-Shot Learners», es Common Crawl filtrado. También lo son RefinedWeb (el corpus detrás de Falcon), Dolma (Allen Institute for AI) y FineWeb (Hugging Face), que filtra 96 instantáneas recogidas entre 2013 y 2024.

Tres propiedades de ese punto de partida merecen conocerse:

  • El robot de Common Crawl se llama CCBot y respeta robots.txt. Admitirlo es la puerta más ancha que usted controla; bloquearlo lo retira del origen de la mayoría de los corpus abiertos.
  • Las URL se eligen según cómo apunta la web hacia ellas. Common Crawl clasifica los dominios por centralidad armónica, una medida del grafo de enlaces: los dominios enlazados desde páginas de referencia se rastrean más ancho y más hondo. Un sitio al que nada enlaza queda en el borde del rastreo, así que cada referencia ganada compra también profundidad de rastreo.
  • El rastreo recupera el HTML y no ejecuta scripts. Un texto que solo aparece tras ejecutarse el JavaScript no existe para el corpus. El HTML renderizado en el servidor es el precio de entrada.

Los rastreadores propios de los laboratorios, y los interruptores que usted tiene

Sobre el rastreo compartido, los laboratorios operan sus propios robots con nombre. Cada uno está documentado y cada uno responde a su propia línea en robots.txt:

Operador User-agent Qué alimenta
OpenAI GPTBot Los corpus de entrenamiento
OpenAI OAI-SearchBot, ChatGPT-User El índice de búsqueda y la navegación en vivo, no el entrenamiento
Anthropic ClaudeBot Los corpus de entrenamiento
Anthropic Claude-SearchBot, Claude-User La búsqueda y las consultas pedidas por el usuario
Google Googlebot, gobernado por el token Google-Extended Google-Extended controla el uso para entrenamiento de IA; el rastreo sigue siendo Googlebot
Apple Applebot, con el token Applebot-Extended El token controla el uso para entrenamiento de IA
Meta meta-externalagent Los corpus de entrenamiento
Common Crawl CCBot Las instantáneas públicas que filtran la mayoría de los corpus abiertos

Dos detalles importan más que la lista. Primero, entrenar y responder son interruptores separados: bloquear GPTBot mantiene sus páginas futuras fuera de los corpus de entrenamiento y no toca lo que OAI-SearchBot puede leer al responder, y viceversa. Un sitio puede quedar fuera del entrenamiento y seguir plenamente legible en vivo, o lo contrario. La decisión se toma por uso, nunca por empresa. Segundo, robots.txt es declarativo: los robots de arriba documentan que lo respetan, y la gestión de bots en el CDN es la capa de aplicación para todo lo demás.

Esos interruptores viven ahora en un espacio común que se encoge. «Consent in Crisis» (Data Provenance Initiative, 2024) midió que, en un solo año, las restricciones de robots.txt llegaron a cubrir cerca de un cuarto de los tokens procedentes de los dominios más representados en los corpus de entrenamiento habituales. Cloudflare lanzó en 2024 un bloqueo de rastreadores de IA en un clic, y en julio de 2025 lo convirtió en el ajuste por defecto para sus nuevos clientes. Cada editor que se cierra aumenta el peso relativo de cada página que sigue legible: revisar qué bloquea por defecto su propia infraestructura ya no es una higiene opcional.

Qué descartan primero los filtros

Un rastreo bruto es sobre todo ruido, y las primeras etapas que lo adelgazan son mecánicas.

La extracción del contenido principal viene primero. Pipelines como RefinedWeb y FineWeb pasan un extractor (típicamente trafilatura) que conserva el bloque de texto principal de una página y descarta la navegación, las cabeceras, los pies de página, las columnas laterales, los avisos de cookies y las listas de enlaces. Lo que vive en esas zonas nunca llega a ningún juicio posterior. Una página cuya sustancia está en su cuerpo principal sobrevive a la extracción; una página que es sobre todo mobiliario alrededor de un párrafo delgado no deja nada detrás.

Después vienen las heurísticas de línea y de documento. C4, publicado con los trabajos T5 de Google en 2019, descartaba toda línea que no terminara en puntuación final, toda página con menos de tres frases, y toda página que contuviera «lorem ipsum» o una llave tipográfica. Las reglas de Gopher (DeepMind, 2021), retomadas por FineWeb, descartan los documentos de menos de 50 palabras o más de 100 000, aquellos cuya longitud media de palabra sale del rango de 3 a 10 caracteres, aquellos donde más del 90 % de las líneas empiezan con una viñeta, y aquellos donde faltan las palabras funcionales más comunes. Una etapa de identificación de idioma enruta cada documento, y un corpus retiene un conjunto definido de idiomas.

Nada de esto mide el sentido. Mide si una página contiene prosa de verdad: frases completas, puntuación, párrafos con sustancia. Un texto ensamblado en fragmentos alrededor de palabras clave falla estas pruebas por construcción.

Los clasificadores de calidad: qué significa «una buena página» para ellos

Las páginas que sobreviven a la mecánica se puntúan después con un clasificador, y los laboratorios dicen sobre qué se entrenaron sus clasificadores:

  • El artículo de OpenAI de 2020 filtraba el rastreo con un clasificador entrenado sobre WebText, páginas que usuarios de Reddit habían enlazado con un karma mínimo, como clase positiva.
  • El artículo LLaMA (Meta, 2023) conservaba las páginas parecidas a las usadas como referencias por los artículos de Wikipedia.
  • FineWeb-Edu (2024) puntúa las páginas de 0 a 5 por su valor educativo, con anotaciones producidas por un gran modelo de lenguaje, y conserva aproximadamente el décimo superior de un corpus ya filtrado.

Laboratorios distintos, un mismo patrón: la clase positiva es siempre alguna versión de «páginas que humanos consideraron dignas de citar». Un clasificador de calidad es un sustituto entrenado de la citabilidad. Las páginas que explican, definen, fechan y documentan sus afirmaciones puntúan como sus ejemplos de entrenamiento; las páginas ensambladas para los buscadores caen del lado equivocado de una frontera trazada con ejemplos de ambas. Aquí es donde su historial fuera del sitio vuelve a entrar en la selección del corpus: ser enlazado desde el tipo de páginas que los clasificadores tratan como verdad de referencia es exactamente lo que construyen las corroboraciones.

La deduplicación premia al original

Todo pipeline documentado deduplica, de forma exacta (documentos idénticos) y aproximada (casi idénticos, típicamente vía MinHash). El artículo de RefinedWeb reporta que la deduplicación por sí sola retira cerca de la mitad de lo que los filtros ya habían aceptado; filtrado y deduplicación juntos descartan la gran mayoría del rastreo bruto.

Cuando varias páginas llevan el mismo texto, sobrevive una. Para un editor la consecuencia es clara: el texto sindicado, copiado o plantillado no se acumula. Una descripción reproducida en veinte portales entra una vez en el corpus, y no necesariamente como su página. El texto que no existe en ningún otro lugar es el único que le pertenece de forma fiable dentro del corpus.

La puerta de los contratos: el contenido bajo licencia

Desde 2023 existe una segunda puerta que se salta el pipeline por completo: la licencia. Entre los acuerdos anunciados públicamente: Associated Press con OpenAI (julio de 2023), Axel Springer (diciembre de 2023), Reddit con Google (febrero de 2024), Le Monde y Prisa Media (marzo de 2024), el Financial Times (abril de 2024), News Corp, Reddit y Stack Overflow con OpenAI (mayo de 2024). Los archivos bajo licencia llegan completos, limpios y atribuidos, sin pasar un solo filtro.

Esa puerta es la de los grandes archivos, y su efecto alcanza a todos: texto editado profesionalmente entra ahora en masa en los corpus, de modo que la frontera que los clasificadores trazan para la web abierta se calibra contra un material cada vez más editado. La web abierta que permanece dentro es la que se lee como si hubiera sido editada.

Estar dentro no es el final: peso, repetición, fecha de corte

Un corpus no se lee de manera uniforme durante el entrenamiento. El artículo de OpenAI de 2020 detalla sus pesos de muestreo: los conjuntos más curados se vieron más de tres veces a lo largo del entrenamiento, mientras el rastreo filtrado se muestreaba menos de una vez. Los corpus abarcan además años de instantáneas (FineWeb filtra once años), de modo que una página que ha existido en una URL estable a través de muchos rastreos mensuales simplemente aparece más veces que una página publicada el trimestre pasado. Y cada modelo tiene su fecha de corte: lo que usted publica después espera al corpus siguiente. Ese desfase es una razón más por la que la puerta de la lectura en vivo importa tanto como la de la memoria: las páginas que un motor consulta al responder llevan lo que su historial todavía no ha enseñado al modelo.

Qué cambia esto en su manera de publicar

Cada hábito de abajo es una etapa del pipeline convertida en práctica:

  1. Sirva su texto como HTML renderizado en el servidor. Los rastreos no ejecutan sus scripts.
  2. Decida robots.txt por rastreador y por uso, entrenamiento frente a respuesta en vivo, y audite qué bloquea por defecto su CDN o su cortafuegos: desde 2025, lo ilegible es el estado por defecto de una parte creciente de la web.
  3. Escriba prosa. Frases completas, puntuación final, párrafos sustanciales: los filtros heurísticos cuentan exactamente eso, línea a línea.
  4. Ponga la sustancia en el bloque de contenido principal. La extracción descarta menús, pies y columnas laterales antes de cualquier juicio de calidad.
  5. Sea el original. La deduplicación conserva una sola copia de un texto dado; las páginas que no existen en otro lugar son las únicas que se le acreditan de forma fiable.
  6. Gane referencias. Los clasificadores de calidad se entrenaron sobre páginas que humanos habían enlazado; las menciones ganadas en las páginas en las que asistentes y corpus ya confían son la mitad fuera del sitio de la selección.
  7. Publique pronto y mantenga URL estables. La presencia a través de las instantáneas se acumula; un historial joven o escaso deja al modelo respondiendo con el de otro.

Lo que el corpus retuvo sobre usted se observa desde fuera: es lo que dicen los asistentes cuando responden de memoria. Tracking mide exactamente eso, pregunta a pregunta, motor a motor, y nuestra guía del GEO sitúa la puerta de la memoria dentro de la disciplina completa.

Fuentes