*(Nota editoriale: Questo articolo è stato ispirato da un'intervista rilasciata da Alessandro Curioni, esperto in cybersicurezza, apparsa sui social media.)*
Nel marzo 2023, a pochi giorni dal debutto pubblico di GPT-4, una lettera aperta promossa dal Future of Life Institute e firmata da oltre trentamila persone — tra cui Yoshua Bengio, Stuart Russell ed Elon Musk — chiedeva una moratoria di almeno sei mesi sull'addestramento di sistemi più potenti del modello di OpenAI. L'allarme indicava che i laboratori erano intrappolati in una corsa fuori controllo verso lo sviluppo di sistemi capaci di sfuggire alla comprensione e alla supervisione dei loro stessi costruttori.
Da allora, gli appelli alla cautela non si sono mai interrotti. Dario Amodei, alla guida di Anthropic, ha più volte teorizzato la necessità di legare la potenza dei modelli a protocolli di sicurezza scaglionati (Responsible Scaling Policies), mettendo in guardia dai rischi catastrofici della frontiera tecnologica. Sam Altman, dal canto suo, ha ripetutamente auspicato davanti al Congresso degli Stati Uniti un'agenzia internazionale di controllo sul modello dell'AIEA. Eppure, la dinamica sul campo racconta una storia diversa: la competizione industriale non si è fermata né rallentata. Gli interventi di finanziamento multimiliardari si susseguono a ritmi sostenuti e la corsa a eventuali quotazione in borsa impone scadenze di mercato incompatibili con le pause di riflessione. La distonia tra la retorica pubblica della cautela e le esigenze di cassa si è ampliata fino a diventare una contraddizione strutturale.
La reale portata di questo conflitto non emerge tanto dai comunicati delle aziende, quanto dalle defezioni interne. Nel maggio 2023 Geoffrey Hinton, considerato uno dei padri delle reti neurali contemporanee, ha rassegnato le dimissioni da Google. La sua motivazione non era una rottura con l'azienda — di cui riconobbe anzi la storica prudenza —, ma la consapevolezza che, per lanciare un allarme credibile sulla velocità con cui l'intelligenza artificiale rischiava di superare quella umana, doveva essere libero da qualsiasi vincolo di lealtà aziendale.
La frattura più traumatica si è consumata un anno dopo, nel maggio 2024, nel cuore di OpenAI. Ilya Sutskever, cofondatore e Chief Scientist dell'azienda, ha lasciato il gruppo dopo mesi di tensioni mai del tutto ricomposte sui rischi legati ai nuovi modelli, fondando poco dopo Safe Superintelligence (SSI), una startup esplicitamente votata alla ricerca teorica senza prodotti commerciali da vendere. Pochi giorni dopo, anche Jan Leike, co-responsabile del team di "Superalignment", ha sbattuto la porta affidando a una serie di post pubblici parole durissime: «Negli ultimi anni, la cultura e i processi di sicurezza sono passati in secondo piano rispetto ai prodotti luccicanti», aggiungendo che «costruire macchine più intelligenti dell'uomo è un'impresa intrinsecamente pericolosa e OpenAI si sta assumendo un'enorme responsabilità a nome dell'umanità intera». A loro si sono uniti altri ricercatori di primo piano, come William Saunders e Leopold Aschenbrenner, licenziati o dimessi dopo aver denunciato falle nei protocolli di riservatezza e di sicurezza.
E’ possibile interpretare queste dichiarazioni come una manovra di regulatory capture — il tentativo delle big tech di invocare norme restrittive per sbarrare la strada ai nuovi concorrenti —. L'ipotesi cinica potrà spiegare il comportamento dei lobbisti, ma non quello di scienziati all'apice della carriera che decidono di rinunciare a compensi straordinari e ruoli di potere pur di dissociarsi dalla rotta intrapresa dai propri laboratori. Dietro le dimissioni c'è un problema squisitamente epistemologico: chi costruisce questi sistemi ammette, con crescente disagio, di non avere gli strumenti teorici per prevederne a fondo il comportamento.
Questa opacità ha radici nel modo stesso in cui i modelli vengono addestrati. Esaurita la miniera dei testi umani di alta qualità disponibili sul web, l'industria fa un ricorso sempre più massiccio a dati sintetici generati da altre macchine e a cicli di auto-valutazione, in cui un modello produce problemi, elabora risposte e un secondo modello ne giudica la validità. È una scorciatoia necessaria per aggirare la scarsità di materiale umano, ma porta con sé un'insidia nota: l'autofagia dei dati, quel fenomeno di degradazione statistica noto come model collapse, in cui gli errori, le allucinazioni e le semplificazioni dei predecessori si amplificano a ogni passaggio generazionale.
Spesso si cita il precedente di AlphaGo Zero — il sistema di DeepMind capace di superare i maestri umani senza partire da partite giocate da esseri umani — come prova della superiorità dell'apprendimento sintetico. Il paragone è però fuorviante. Il Go è un dominio chiuso, retto da una grammatica formale infallibile e da un obiettivo binario: vittoria o sconfitta. Al contrario, i grandi modelli linguistici operano nel terreno ambiguo, fluido e contraddittorio del linguaggio naturale, privo di funzioni-obiettivo pulite e costantemente esposto a interpretazioni multiple.
Gli ingegneri delle AI sicuramente non brancolano nel buio assoluto: conoscono le equazioni dell'architettura, la matrice dei pesi, gli iperparametri e la pipeline dei dati. Ciò che manca è la mappa del percorso logico. La conoscenza di una rete neurale non risiede in un albero decisionale trasparente, ma è dispersa in centinaia di miliardi di parametri numerici, dove singoli neuroni partecipano contemporaneamente a concetti radicalmente diversi (un fenomeno noto come polisemicità). L'interpretabilità meccanicistica — la disciplina che prova a dissezionare questi circuiti interni — compie passi avanti importanti, ma resta drammaticamente in ritardo rispetto all'espansione dei modelli. Una rete può scrivere codice impeccabile o risolvere una complessa dimostrazione senza che alcuno dei suoi programmatori sia in grado di isolare con certezza quali attivazioni interne abbiano generato quel risultato.
È in questo divario che va cercato il senso dell'allarme dei ricercatori. Il rischio immediato non è l'autocoscienza improvvisa di una macchina, né una ribellione fantascientifica. È la discrepanza tra la nostra capacità empirica di far funzionare un sistema e la nostra incapacità teorica di comprenderne i meccanismi profondi. Finché il mercato premierà la velocità di rilascio rispetto al rigore della verifica, continueremo a delegare compiti critici a manufatti statistici sofisticati, la cui reale dinamica interna ci è, in larga parte, ancora sconosciuta.