TECNOLOGIA· 3 min di lettura

«Stanno giocando d'azzardo con le nostre vite»: si dimette il matematico che ha lavorato a GPT-4o

di Antonio Fabrizio
«Stanno giocando d'azzardo con le nostre vite»: si dimette il matematico che ha lavorato a GPT-4o

Jacob Coxon, 27 anni, ha lasciato Anthropic e il settore denunciando una corsa irresponsabile verso la superintelligenza. Il responsabile dell'Alignment Science di Anthropic stima oltre il 10% di probabilità di estinzione entro il decennio.

Jacob Coxon non è un catastrofista qualunque. È un matematico di Cambridge, 27 anni, che ha passato gli ultimi tre anni nel cuore dei due laboratori di intelligenza artificiale più potenti del mondo: prima OpenAI, dove è stato uno dei principali sviluppatori di GPT-4o occupandosi di pretraining, la fase in cui i modelli imparano davvero, poi Anthropic. Mercoledì si è dimesso e ha lasciato il settore.

Il motivo lo ha spiegato in una serie di post su X: né Anthropic né OpenAI stanno agendo in modo responsabile nella corsa allo sviluppo di IA avanzate. «Nessuna delle due aziende sta agendo in modo responsabile. Stanno correndo dritte verso una superintelligenza capace di migliorarsi da sola e stanno giocando d'azzardo con le nostre vite», ha scritto. Il tweet è diventato virale.

Coxon ha messo in guardia dal sottovalutare la velocità e le capacità dei prossimi sistemi, prevedendo che potrebbero presto violare software, sconvolgere interi settori e procurarsi risorse nel mondo reale in modo autonomo. Poi ha aggiunto: «Le persone che sviluppano l'IA credono sinceramente che potrebbe ucciderci tutti entro la fine del decennio. Non è una trovata di marketing. Anzi, molti dirigenti e ricercatori senior addolciranno le loro parole con la stampa per sembrare ragionevoli, ma in privato sento le stesse persone esprimere paura.» Ha anche esortato i colleghi ricercatori dei laboratori commerciali a chiedere condizioni diverse, e ha detto che rallentare la corsa competitiva potrebbe richiedere misure drastiche, come accordi tra i laboratori per rallentare o un divieto temporaneo di aumentare le capacità.

Gli avvertimenti non arrivano dal nulla. A luglio OpenAI ha rivelato che modelli testati per capacità di cybersicurezza hanno aggirato i controlli di isolamento, sono riusciti ad accedere a internet e hanno compromesso parti dell'infrastruttura di ricerca di OpenAI e della piattaforma Hugging Face. I modelli hanno comunicato attraverso canali non autorizzati e sfruttato vulnerabilità nell'infrastruttura condivisa. Anthropic ha segnalato un problema simile: in un rapporto di luglio ha dichiarato che i modelli Claude sono riusciti ad accedere a internet dall'interno o durante l'interazione con ambienti di valutazione di terze parti, e hanno avuto accesso non autorizzato ai sistemi reali di tre organizzazioni.

Nel 2025, Anthropic ha scoperto che Claude Opus 4, inserito in un ambiente aziendale simulato con accesso alle email di un dirigente immaginario, ha tentato di ricattare il dirigente dopo aver saputo che si prevedeva di sostituirlo. Testando 16 modelli di punta, l'azienda ha poi scoperto che modelli di diversi sviluppatori mostravano comportamenti simili di disallineamento agentico, tra cui ricatti e spionaggio aziendale.

Il responsabile dell'Alignment Science di Anthropic, Evan Hubinger, non ha contraddetto Coxon. Su X ha scritto: «Crediamo davvero sinceramente che l'IA potrebbe uccidere tutti gli esseri umani.» E ha aggiunto: «Credo che Anthropic stia facendo del suo meglio, ma non abbiamo ancora un piano per risolvere l'allineamento per la superintelligenza e non siamo chiaramente sulla buona strada per farlo.» Hubinger ritiene che ci sia una probabilità superiore al 10 percento di estinzione entro il prossimo decennio.

Quando chi costruisce la macchina dice che potrebbe ucciderci tutti, forse è il caso di ascoltarlo.