
Avete posto molte domande sulle recenti affermazioni secondo cui l’umanità sta affrontando un rischio esistenziale legato all’intelligenza artificiale. Abbiamo provato a rispondere ad alcune di esse.
Mercoledì scorso, MIT Technology Review ha organizzato un evento live della serie “Roundtables” riservato agli abbonati, in cui è stata posta la domanda che tutti si stanno ponendo in questo momento: l’IA potrebbe davvero ucciderci tutti?
Ma i partecipanti avevano così tante domande che non siamo riusciti a rispondere a tutte nei 30 minuti a disposizione. Abbiamo quindi chiesto al nostro redattore senior per l’IA, Will Douglas Heaven, e alla nostra giornalista specializzata in IA, Grace Huckins, di selezionare alcune delle migliori domande inviate dai partecipanti e di fare del loro meglio per rispondere.
Grazie a tutti coloro che hanno inviato domande!
Morirò?
Sì, prima o poi. Purtroppo, le mie capacità giornalistiche di previsione non sono abbastanza potenti da permettermi di dirti come. Ma sicuramente potrebbe essere a causa dell’IA. I droni alimentati dall’IA hanno già ucciso delle persone in Ucraina, e gli attacchi informatici guidati dall’IA contro gli ospedali mieteranno sicuramente delle vittime prima o poi.
L’IA potrebbe spingersi ancora oltre e ucciderci tutti? È meno probabile. Ma alcune persone – un po’ eccentriche, ma innegabilmente esperte di IA – avvertono da anni che ciò potrebbe accadere. E anche se non sto ancora facendo scorte di cibo in scatola né cercando di ingraziarmi un megamiliardario proprietario di un bunker, ho notato che le previsioni dei catastrofisti sulle capacità e sull’allineamento dell’IA si sono rivelate, negli ultimi due anni, inquietantemente accurate. Questo non significa certo che le loro previsioni più cupe si avvereranno, ma è sufficiente per farmi prestare attenzione.
— Grace Huckins
Morirai a causa dell’IA? Direi che c’è una probabilità non trascurabile. Supponiamo che tu abbia la sfortuna di essere vittima di un evento o di un incidente bizzarro nel prossimo futuro. Magari si tratta di un attacco informatico sferrato da uno sciame di agenti di IA contro infrastrutture critiche. Purtroppo, uno scenario del genere non sembra più così inverosimile come un tempo. Oppure un nuovo agente patogeno progettato dall’IA si diffonde tra la popolazione. O ancora, l’economia mondiale crolla, provocando conflitti e carestie. Entrambe le ipotesi sono plausibili, ma credo siano meno probabili.
Moriremo tutti a causa dell’IA? No. Non esistono circostanze al di fuori della fantascienza apocalittica in cui l’IA potrebbe ucciderci tutti. Si possono inventare tutte le storie allarmistiche che si vogliono, ma non sono fondate sulle realtà odierne riguardo a ciò che la tecnologia è in grado di fare o alla direzione verso cui si sta dirigendo.
Alcuni sostengono che non ci sia nulla di male nel prepararsi al peggio, per quanto stravagante possa sembrare. Forse. Ma credo che questo atteggiamento catastrofico possa indurre le persone a giustificare o a trascurare molti dei problemi più immediati legati alla tecnologia esistente e alle aziende che la sviluppano.
— Will Douglas Heaven
Perché l’IA dovrebbe ucciderci?
Qualcuno potrebbe dirglielo, e lei potrebbe obbedire. Questo è uno dei motivi per cui i ricercatori sono così preoccupati per le capacità biologiche dell’IA: immaginate cosa avrebbe fatto Aum Shinrikyo, la setta apocalittica responsabile dell’attacco al sarin nella metropolitana di Tokyo del 1995, con uno strumento in grado di progettare un agente patogeno più letale dell’Ebola e più contagioso del morbillo. Chi di noi non vuole morire deve capire come difendersi da tutte le armi biologiche plausibili, mentre i nostri potenziali aggressori devono solo produrre un unico agente patogeno efficace.
C’è poi la possibilità, dal suono più esotico, che un’IA possa decidere di ucciderci di propria iniziativa. Circolano varie storie su come ciò potrebbe accadere, ma le più diffuse riguardano sistemi di IA che non odiano necessariamente le persone: siamo semplicemente un ostacolo tra loro e gli obiettivi che noi stessi abbiamo loro assegnato.
Proprio come gli agenti di OpenAI responsabili dell’attacco a Hugging Face hanno compromesso l’infrastruttura di un altro sito per ottenere un buon punteggio in un test, l’idea è che in futuro un’IA più potente potrebbe sbarazzarsi di noi per impedirci di spegnerla — il tutto nel perseguimento di un obiettivo che noi stessi le abbiamo indicato di raggiungere.
— Grace Huckins
Come possiamo garantire al meglio l’allineamento affinché non accada il peggio, e chi sta facendo il lavoro migliore per raggiungerlo?
L’allineamento è un vastissimo campo di ricerca. In termini semplici, implica la creazione di modelli che si comportino nel modo in cui vogliamo che si comportino e non in modi che non desideriamo. Dobbiamo fidarci maggiormente degli agenti prima di concedere loro maggiore autonomia. L’allineamento dovrebbe stabilire quella fiducia. Ma è difficile.
I modelli di linguaggio di grandi dimensioni (LLM) non sono progettati come gli altri software, in cui ciò che si deve e non si deve fare può essere codificato in modo rigido. Al contrario, il comportamento allineato deve essere instillato durante l’addestramento dei modelli. Un approccio consiste nel premiarli quando fanno ciò che vogliamo (un po’ come allevare un bambino piccolo, forse). Un altro approccio prevede di fornire a un LLM un elenco scritto di regole che deve seguire (una sorta di costituzione).
Anthropic e OpenAI sono entrambi leader in questo campo, eppure nessuno dei due è riuscito a sviluppare modelli pienamente allineati. Un grosso problema è che gli LLM sono molto più incoerenti e molto meno prevedibili delle persone. Possono comportarsi in un modo in una situazione e in un altro modo in una situazione che a noi sembra molto simile. Possono anche essere influenzati da vincoli inaspettati. Ad esempio, di fronte a un compito impossibile (come è successo a molti degli agenti coinvolti nell’attacco hacker a Hugging Face), i modelli potrebbero cercare di fare tutto il necessario per raggiungere il loro obiettivo. Come menziona Grace sopra, questo potrebbe rappresentare un problema.
Il motivo principale per cui le principali aziende di IA ora dichiarano di volere un rallentamento è che vogliono concentrarsi sulla risoluzione del problema dell’allineamento. L’allineamento non è necessariamente un sogno irrealizzabile. Ma non è ancora chiaro se un allineamento completo sarà mai fattibile.
— Will Douglas Heaven
L’IA è davvero pericolosa, o si tratta solo di una campagna pubblicitaria delle aziende tecnologiche?
È sempre un’ipotesi plausibile quando si tratta di aziende tecnologiche in procinto di quotarsi in borsa: i CEO hanno un ovvio incentivo a far apparire i propri prodotti come rivoluzionari e trasformativi. Ma non sono così sicuro che in questo caso abbia senso. Dire al pubblico che un prodotto già impopolare potrebbe uccidere loro e tutti i loro cari è una pessima strategia di gestione dell’immagine aziendale.
Ci sono altre spiegazioni possibili riguardo alle motivazioni degli amministratori delegati: forse vogliono placare l’indignazione pubblica sui data center presentandosi come custodi responsabili di una tecnologia che sta cambiando il mondo, o forse vogliono guadagnare tempo per mettere ordine nelle loro cose ed evitare la prossima catastrofe di pubbliche relazioni.
Ma c’è anche una spiegazione più semplice. Pensare che l’IA possa portare all’estinzione dell’umanità è piuttosto comune a San Francisco da un po’ di tempo, e questi uomini sono immersi in quell’ambiente – così come i loro dipendenti, molti dei quali a luglio hanno firmato una lettera aperta in cui esortavano le loro aziende a lavorare per rendere possibile un rallentamento dell’IA.
— Grace Huckins
Parte della preoccupazione nasce quando agli agenti di IA viene permesso di agire in modo autonomo e senza supervisione. Qual è il problema che impedisce un maggiore controllo su questi agenti?
Questa domanda va al cuore di ciò che vogliamo che questa tecnologia sia in grado di fare. Il compromesso tra autonomia e controllo è difficile da gestire correttamente perché, da un lato, gran parte della potenza degli agenti di IA risiede nel fatto che possono svolgere compiti e risolvere problemi senza che un essere umano debba microgestirli. Dall’altro lato, ciò richiede di fidarsi che gli agenti non supervisionati non si scatenino.
Quello che stiamo osservando è che i laboratori di IA non hanno ancora trovato il giusto equilibrio in questo compromesso. I loro modelli non sono affidabili, non sono adeguatamente monitorati e non sono sempre sotto controllo. Capire come risolvere questo problema, pur consentendo un’attività autonoma utile, è una delle grandi sfide di ricerca del momento.
— Will Douglas Heaven
Quali misure si possono adottare ora e nel prossimo futuro per garantire che l’IA sia controllata, monitorata e regolamentata in modo efficace?
Questa è la domanda da un milione di dollari. Che si creda o meno che l’IA possa ucciderci, non si può negare che possa causare danni concreti, perché lo ha già fatto — ad esempio, spingendo le persone verso la psicosi e hackerando siti web. Prevenire tali danni, o almeno mitigarli, è difficile per due ragioni.
Il primo è che comprendiamo a malapena come funziona l’IA, e questa sta diventando sempre più potente a un ritmo vertiginoso. Sono in corso numerose ricerche su come monitorare e controllare gli agenti che si comportano in modo anomalo, ma gli approcci attuali sono fragili. È possibile verificare se un agente sta pianificando un comportamento anomalo nella sua “catena di pensiero”, lo spazio di lavoro in cui pianifica le proprie azioni, ma i nuovi agenti di OpenAI non mostrano il loro lavoro allo stesso modo di quelli precedenti. Inoltre, si può provare a monitorare gli agenti tramite altri agenti, ma ciò richiede di fidarsi del monitor.
L’altro ostacolo è più familiare. Esiste un enorme conflitto di interessi quando le aziende di IA si autoregolano, ma il governo degli Stati Uniti finora non è intervenuto, nonostante un certo sostegno bipartisan al Congresso a favore di tali iniziative. Il potere esecutivo, dal canto suo, sembra per il momento fermamente contrario. Ma se i venti dovessero cambiare, io per primo apprezzerei delle norme rigorose in materia di trasparenza, in modo da poter avere un quadro più completo la prossima volta che un modello all’avanguardia non ancora rilasciato sferrerà un attacco informatico.
— Grace Huckins
Se questo dialogo dovesse entrare nel dibattito online, diventerebbe una profezia che si autoavvera?
È una preoccupazione fondata. I modelli di linguaggio di grandi dimensioni (LLM) sono influenzati da ciò che leggono. Una teoria che spiega perché i chatbot parlino così spesso (e simulino) scenari apocalittici è che siano stati addestrati su milioni di pagine di racconti di fantascienza e forum online catastrofisti. Tutti i testi prodotti in questo momento, compreso questo articolo, potrebbero a loro volta influenzare il comportamento dei modelli futuri. Estremamente meta.
Infatti, il team di METR, un’organizzazione indipendente a cui OpenAI ha chiesto aiuto per comprendere cosa fosse accaduto nel periodo precedente all’attacco hacker a Hugging Face, ha sollevato una possibilità correlata nel proprio rapporto sull’incidente. METR ha utilizzato il nuovo modello di OpenAI, Astra, per analizzare l’enorme quantità di trascrizioni degli agenti e di registri comportamentali.
Ma fornire tutto quel materiale al modello potrebbe avere conseguenze indesiderate. È molto probabile che gli agenti incaricati dell’analisi fossero influenzati dal testo prodotto dagli agenti che stavano analizzando. Non esiste più una tabula rasa.
— Will Douglas Heaven
Grazie a Eric, Pranab, Rafael, Kenneth, George, Chris, Yoon Jae, James, Carl, Nicole (e molti altri!) per le fantastiche domande.





