Epovest
← Tutte le guide

Guida

Come i laboratori di IA scelgono i siti web che entrano nei loro corpora di addestramento

Di Simon Vasconcelos Lee

Fondatore di Epovest

Fate a un assistente IA una domanda sul vostro mercato: una parte della risposta viene dalla memoria, cioè da ciò che il modello ha assorbito durante l'addestramento. Quella memoria è stata costruita su un corpus, il corpus è stato costruito sul web, e il vostro sito ha superato la selezione oppure no. La posta in gioco è concreta: quando la vostra copertura è scarsa, il modello risponde con ciò che il suo corpus contiene, compreso il dossier del vostro omonimo.

La selezione non è editoriale. Nessuno, in un laboratorio di IA, legge siti web per decidere che il vostro merita un posto. È una pipeline: un crawl, una pila di filtri, una passata di deduplicazione, una serie di contratti, una politica di campionamento. Ed è insolitamente ben documentata, perché i laboratori pubblicano il modo in cui i loro corpora vengono costruiti anche quando tengono privati i corpora stessi. Questa guida percorre la pipeline stadio per stadio: che cosa ciascuno conserva, che cosa scarta, e che cosa ciò implica per il vostro modo di pubblicare.

L'addestramento è una delle due porte d'ingresso di una risposta. L'altra è la lettura dal vivo: pagine consultate nel momento in cui la domanda viene posta, con altre regole e a un ritmo molto più rapido. Abbiamo misurato quanto diversamente si comportano le due porte. Questa guida riguarda la porta della memoria.

Un punto di partenza condiviso: il crawl pubblico

La maggior parte dei corpora di addestramento documentati non parte da un crawl del laboratorio. Parte da Common Crawl, un'organizzazione senza scopo di lucro che percorre il web dal 2008 e pubblica circa ogni mese un'istantanea fresca di svariati miliardi di pagine. C4, il corpus dietro i modelli T5 di Google, è un'istantanea di Common Crawl filtrata. La parte web descritta nell'articolo di OpenAI del 2020, «Language Models are Few-Shot Learners», è Common Crawl filtrato. Lo sono anche RefinedWeb (il corpus dietro Falcon), Dolma (Allen Institute for AI) e FineWeb (Hugging Face), che filtra 96 istantanee raccolte tra il 2013 e il 2024.

Tre proprietà di quel punto di partenza meritano di essere conosciute:

  • Il robot di Common Crawl si chiama CCBot e rispetta robots.txt. Ammetterlo è la porta più larga che controllate; bloccarlo vi toglie dal monte della maggior parte dei corpora aperti.
  • Le URL vengono scelte in base a come il web punta verso di esse. Common Crawl classifica i domini per centralità armonica, una misura del grafo dei link: i domini a cui puntano pagine di riferimento vengono percorsi più in largo e più in profondità. Un sito a cui nulla punta resta sul bordo sottile del crawl, quindi ogni riferimento guadagnato compra anche profondità di crawl.
  • Il crawl recupera l'HTML e non esegue script. Un testo che appare solo dopo l'esecuzione del JavaScript non esiste per il corpus. L'HTML renderizzato lato server è il prezzo d'ingresso.

I crawler propri dei laboratori, e gli interruttori che tenete in mano

Sopra il crawl condiviso, i laboratori fanno girare robot propri, con un nome. Ciascuno è documentato, e ciascuno risponde alla propria riga in robots.txt:

Operatore User-agent Che cosa alimenta
OpenAI GPTBot I corpora di addestramento
OpenAI OAI-SearchBot, ChatGPT-User L'indice di ricerca e la navigazione dal vivo, non l'addestramento
Anthropic ClaudeBot I corpora di addestramento
Anthropic Claude-SearchBot, Claude-User La ricerca e le consultazioni chieste dall'utente
Google Googlebot, governato dal token Google-Extended Google-Extended controlla l'uso per l'addestramento IA; il crawling resta Googlebot
Apple Applebot, con il token Applebot-Extended Il token controlla l'uso per l'addestramento IA
Meta meta-externalagent I corpora di addestramento
Common Crawl CCBot Le istantanee pubbliche che la maggior parte dei corpora aperti filtra

Due dettagli contano più della lista. Primo, addestrare e rispondere sono interruttori separati: bloccare GPTBot tiene le vostre pagine future fuori dai corpora di addestramento e non tocca ciò che OAI-SearchBot può leggere al momento di rispondere, e viceversa. Un sito può restare fuori dall'addestramento e rimanere pienamente leggibile dal vivo, o il contrario. La decisione si prende per uso, mai per azienda. Secondo, robots.txt è dichiarativo: i robot qui sopra documentano di rispettarlo, e la gestione dei bot a livello di CDN è lo strato di applicazione per tutto il resto.

Quegli interruttori vivono ormai in uno spazio comune che si restringe. «Consent in Crisis» (Data Provenance Initiative, 2024) ha misurato che, in un solo anno, le restrizioni di robots.txt sono arrivate a coprire circa un quarto dei token provenienti dai domini più rappresentati nei corpora di addestramento correnti. Cloudflare ha consegnato nel 2024 un blocco dei crawler IA in un clic, poi nel luglio 2025 ne ha fatto l'impostazione predefinita per i nuovi clienti. Ogni editore che si chiude aumenta il peso relativo di ogni pagina che resta leggibile: verificare che cosa la vostra infrastruttura blocca di default non è più un'igiene facoltativa.

Che cosa scartano per primi i filtri

Un crawl grezzo è soprattutto rumore, e i primi stadi che lo sfoltiscono sono meccanici.

Prima viene l'estrazione del contenuto principale. Pipeline come RefinedWeb e FineWeb passano un estrattore (tipicamente trafilatura) che conserva il blocco di testo principale di una pagina e scarta navigazione, intestazioni, piè di pagina, colonne laterali, banner dei cookie e liste di link. Ciò che vive in quelle zone non raggiunge mai alcun giudizio successivo. Una pagina la cui sostanza sta nel corpo principale sopravvive all'estrazione; una pagina che è soprattutto arredo attorno a un paragrafo magro non lascia nulla dietro di sé.

Poi vengono le euristiche di riga e di documento. C4, pubblicato con i lavori T5 di Google nel 2019, scartava ogni riga che non terminasse con una punteggiatura finale, ogni pagina con meno di tre frasi, e ogni pagina contenente «lorem ipsum» o una parentesi graffa. Le regole di Gopher (DeepMind, 2021), riprese da FineWeb, scartano i documenti sotto le 50 parole o sopra le 100 000, quelli la cui lunghezza media di parola esce dall'intervallo da 3 a 10 caratteri, quelli in cui più del 90 % delle righe comincia con un punto elenco, e quelli in cui mancano le parole funzionali più comuni. Un passo di identificazione della lingua instrada ciascun documento, e un corpus trattiene un insieme definito di lingue.

Nulla di tutto ciò misura il senso. Misura se una pagina contiene prosa vera: frasi complete, punteggiatura, paragrafi con sostanza. Un testo assemblato in frammenti attorno a parole chiave fallisce queste prove per costruzione.

I classificatori di qualità: che cosa significa per loro «una buona pagina»

Le pagine che sopravvivono alla meccanica vengono poi valutate da un classificatore, e i laboratori dichiarano su che cosa i loro classificatori sono stati addestrati:

  • L'articolo di OpenAI del 2020 filtrava il crawl con un classificatore addestrato su WebText, pagine che utenti di Reddit avevano linkato con un karma minimo, come classe positiva.
  • L'articolo LLaMA (Meta, 2023) conservava le pagine simili a quelle usate come riferimenti dagli articoli di Wikipedia.
  • FineWeb-Edu (2024) assegna alle pagine un punteggio da 0 a 5 per il valore educativo, con annotazioni prodotte da un grande modello linguistico, e conserva all'incirca il decimo superiore di un corpus già filtrato.

Laboratori diversi, uno stesso schema: la classe positiva è sempre una versione di «pagine che degli umani hanno giudicato degne di citazione». Un classificatore di qualità è un sostituto addestrato della citabilità. Le pagine che spiegano, definiscono, datano e documentano le proprie affermazioni ottengono il punteggio dei loro esempi di addestramento; le pagine assemblate per i motori di ricerca cadono dal lato sbagliato di un confine tracciato attraverso esempi di entrambe. È qui che il vostro dossier fuori dal sito rientra nella selezione del corpus: essere linkati dal genere di pagine che i classificatori trattano come verità di riferimento è esattamente ciò che costruiscono le corroborazioni.

La deduplicazione premia l'originale

Ogni pipeline documentata deduplica, in modo esatto (documenti identici) e approssimato (quasi identici, tipicamente via MinHash). L'articolo di RefinedWeb riferisce che la sola deduplicazione toglie circa la metà di ciò che i filtri avevano già accettato; filtraggio e deduplicazione insieme scartano la grande maggioranza del crawl grezzo.

Quando più pagine portano lo stesso testo, ne sopravvive una. Per un editore la conseguenza è netta: il testo sindacato, copiato o a modello non si accumula. Una descrizione riprodotta su venti portali entra una volta nel corpus, e non necessariamente come la vostra pagina. Il testo che non esiste in nessun altro luogo è l'unico che nel corpus vi appartiene in modo affidabile.

La porta dei contratti: i contenuti su licenza

Dal 2023 esiste una seconda porta che salta la pipeline per intero: la licenza. Tra gli accordi annunciati pubblicamente: Associated Press con OpenAI (luglio 2023), Axel Springer (dicembre 2023), Reddit con Google (febbraio 2024), Le Monde e Prisa Media (marzo 2024), il Financial Times (aprile 2024), News Corp, Reddit e Stack Overflow con OpenAI (maggio 2024). Gli archivi su licenza arrivano completi, puliti e attribuiti, senza passare un solo filtro.

Quella porta appartiene ai grandi archivi, e il suo effetto raggiunge tutti: testo curato professionalmente entra ormai in massa nei corpora, sicché il confine che i classificatori tracciano per il web aperto si calibra su un materiale sempre più curato. Il web aperto che resta dentro è quello che si legge come se fosse stato curato da una redazione.

Essere dentro non è la fine: peso, ripetizione, data di taglio

Un corpus non viene letto uniformemente durante l'addestramento. L'articolo di OpenAI del 2020 dettaglia i suoi pesi di campionamento: gli insiemi più curati sono stati visti più di tre volte nel corso dell'addestramento, mentre il crawl filtrato veniva campionato meno di una volta. I corpora si estendono inoltre su anni di istantanee (FineWeb ne filtra undici anni), sicché una pagina che è esistita a una URL stabile attraverso molti crawl mensili compare semplicemente più spesso di una pagina pubblicata il trimestre scorso. E ogni modello ha la sua data di taglio: ciò che pubblicate dopo aspetta il corpus successivo. Quello scarto è una ragione in più per cui la porta della lettura dal vivo conta quanto la porta della memoria: le pagine che un motore consulta al momento di rispondere portano ciò che il vostro dossier non ha ancora insegnato al modello.

Che cosa cambia nel vostro modo di pubblicare

Ogni abitudine qui sotto è uno stadio della pipeline, tradotto in pratica:

  1. Servite il vostro testo come HTML renderizzato lato server. I crawl non eseguono i vostri script.
  2. Decidete robots.txt per crawler e per uso, addestramento contro risposta dal vivo, e verificate che cosa il vostro CDN o il vostro firewall blocca di default: dal 2025, l'illeggibilità è lo stato predefinito di una parte crescente del web.
  3. Scrivete prosa. Frasi complete, punteggiatura finale, paragrafi sostanziosi: i filtri euristici contano esattamente questo, riga per riga.
  4. Mettete la sostanza nel blocco di contenuto principale. L'estrazione scarta menù, piè di pagina e colonne laterali prima di qualunque giudizio di qualità.
  5. Siate l'originale. La deduplicazione conserva una sola copia di un dato testo; le pagine che non esistono altrove sono le uniche che vi vengono attribuite in modo affidabile.
  6. Guadagnate riferimenti. I classificatori di qualità sono stati addestrati su pagine che degli umani avevano linkato; le menzioni ottenute sulle pagine di cui assistenti e corpora già si fidano sono la metà della selezione che avviene fuori dal vostro sito.
  7. Pubblicate presto e mantenete URL stabili. La presenza attraverso le istantanee si somma; un dossier giovane o scarso lascia il modello rispondere con quello di un altro.

Ciò che il corpus ha trattenuto di voi si osserva dall'esterno: è ciò che gli assistenti dicono quando rispondono a memoria. Tracking misura esattamente questo, domanda per domanda, motore per motore, e la nostra guida alla GEO colloca la porta della memoria dentro la disciplina intera.

Fonti