Skip to main content
Aïda Amer/MIT Technology Review | Photos Adobe

Nell’ultimo anno si sono registrati rapidi progressi nella capacità dei modelli linguistici di grandi dimensioni di affrontare la matematica a livello di scuola superiore e oltre. L’intelligenza artificiale si sta avvicinando ai matematici umani?

Secondo la DARPA, la matematica è ferma al passato. In aprile, la Defense Advanced Research Projects Agency degli Stati Uniti ha dato il via a una nuova iniziativa chiamata expMath (acronimo di Exponentiating Mathematics) che spera possa accelerare il ritmo dei progressi in un campo di ricerca che è alla base di un’ampia gamma di applicazioni cruciali del mondo reale, dall’informatica alla medicina alla sicurezza nazionale.

“La matematica è la fonte di un impatto enorme, ma è fatta più o meno come è stata fatta per secoli, da persone in piedi alle lavagne”, ha detto il responsabile del programma DARPA Patrick Shafto in un video di presentazione dell’iniziativa.

Il mondo moderno è costruito sulla matematica. La matematica ci permette di modellare sistemi complessi come il modo in cui l’aria scorre intorno a un aereo, il modo in cui i mercati finanziari fluttuano e il modo in cui il sangue scorre nel cuore. Inoltre, le scoperte matematiche avanzate possono sbloccare nuove tecnologie come la crittografia, essenziale per la messaggistica privata e l’online banking, e la compressione dei dati, che ci permette di diffondere immagini e video su Internet.

Ma i progressi della matematica possono richiedere anni. La DARPA vuole accelerare i tempi. L’obiettivo di expMath è incoraggiare i matematici e i ricercatori di intelligenza artificiale a sviluppare quello che la DARPA chiama un coautore dell’intelligenza artificiale, uno strumento che potrebbe suddividere i problemi matematici più grandi e complessi in problemi più piccoli e più semplici, più facili da comprendere e, quindi, da risolvere.

I matematici usano i computer da decenni, per accelerare i calcoli o verificare la veridicità di certe affermazioni matematiche. La nuova visione è che l’intelligenza artificiale potrebbe aiutarli a risolvere problemi che in precedenza non erano risolvibili.

Ma c’è un’enorme differenza tra l’IA che può risolvere i tipi di problemi delle scuole superiori – matematica che l’ultima generazione di modelli ha già padroneggiato – e l’IA che potrebbe (in teoria) risolvere i tipi di problemi che i matematici professionisti passano la carriera a scalfire.

Da un lato ci sono strumenti che potrebbero essere in grado di automatizzare alcuni compiti che i laureati in matematica sono chiamati a svolgere; dall’altro ci sono strumenti che potrebbero essere in grado di spingere la conoscenza umana oltre i suoi limiti attuali.

Ecco tre modi di pensare a questo divario.

1/ L’IA ha bisogno di qualcosa di più di semplici trucchi intelligenti

I modelli linguistici di grandi dimensioni non sono noti per essere bravi in matematica. Inventano le cose e possono essere persuasi che 2 + 2 = 5. Ma le nuove versioni di questa tecnologia, in particolare i cosiddetti modelli di ragionamento di grandi dimensioni (LRM) come o3 di OpenAI e Claude 4 Thinking di Anthropic, sono molto più capaci e questo ha entusiasmato i matematici.

Quest’anno, un certo numero di LRM, che cercano di risolvere un problema passo dopo passo anziché sputare il primo risultato che gli viene in mente, hanno ottenuto punteggi elevati all’American Invitational Mathematics Examination (AIME), un test assegnato al 5% dei migliori studenti di matematica delle scuole superiori statunitensi.

Allo stesso tempo, una manciata di nuovi modelli ibridi che combinano gli LLM con un qualche tipo di sistema di verifica dei fatti ha fatto progressi. Emily de Oliveira Santos, matematica dell’Università di San Paolo, in Brasile, indica AlphaProof di Google DeepMind, un sistema che combina un LLM con il modello di gioco AlphaZero di DeepMind, come una pietra miliare. L’anno scorso AlphaProof è stato il primo programma informatico a eguagliare le prestazioni di un vincitore della medaglia d’argento alle Olimpiadi Internazionali di Matematica, una delle competizioni matematiche più prestigiose al mondo.

A maggio, un modello di Google DeepMind chiamato AlphaEvolve ha scoperto risultati migliori di quelli ottenuti dagli esseri umani per oltre 50 enigmi matematici irrisolti e per diversi problemi informatici del mondo reale.

L’aumento dei progressi è evidente. “GPT-4 non riusciva a fare matematica oltre il livello universitario”, dice de Oliveira Santos. “Ricordo di averlo testato all’epoca del suo rilascio con un problema di topologia, e non riusciva a scrivere più di qualche riga senza perdersi completamente”. Ma quando ha sottoposto lo stesso problema a o1 di OpenAI, un LRM rilasciato a gennaio, ha fatto centro.

Questo significa che tali modelli sono pronti a diventare il tipo di coautore che la DARPA spera? Non necessariamente, dice l’autrice: “I problemi delle Olimpiadi di matematica spesso implicano la capacità di eseguire trucchi intelligenti, mentre i problemi di ricerca sono molto più esplorativi e spesso hanno molti, molti più pezzi in movimento”. Il successo in un tipo di risoluzione dei problemi potrebbe non essere trasmesso a un altro.

Altri sono d’accordo. Martin Bridson, matematico dell’Università di Oxford, ritiene che il risultato delle Olimpiadi della matematica sia un grande risultato. “D’altra parte, non lo trovo strabiliante”, dice. “Non è un cambiamento di paradigma nel senso di ‘Wow, pensavo che le macchine non sarebbero mai state in grado di farlo’. Mi aspettavo che le macchine fossero in grado di farlo”.

Questo perché, anche se i problemi delle Olimpiadi di matematica – e di test analoghi per le scuole superiori o per gli studenti universitari, come l’AIME – sono difficili, molti di essi hanno uno schema. “Abbiamo campi di formazione per addestrare i ragazzi delle scuole superiori a svolgerli”, dice Bridson. “E se si può addestrare un gran numero di persone a risolvere questi problemi, perché non si dovrebbe essere in grado di addestrare una macchina a risolverli?”.

Sergei Gukov, matematico del California Institute of Technology che allena le squadre delle Olimpiadi della Matematica, sottolinea che lo stile dei quesiti non cambia molto tra una competizione e l’altra. Ogni anno vengono posti nuovi problemi, ma possono essere risolti con gli stessi vecchi trucchi.

“Certo, i problemi specifici non sono apparsi prima”, dice Gukov. “Ma sono molto vicini, a un passo da milioni di cose già viste. Ci si rende subito conto che ‘Oh mio Dio, ci sono così tante somiglianze che applicherò la stessa tattica’”. Per quanto sia difficile la matematica a livello di competizione, sia i bambini che le macchine possono imparare a batterla.

Questo non è vero per la maggior parte dei problemi matematici irrisolti. Bridson è presidente del Clay Mathematics Institute, un’organizzazione di ricerca senza scopo di lucro con sede negli Stati Uniti, nota soprattutto per aver istituito nel 2000 il Millenium Prize Problems, sette dei più importanti problemi irrisolti della matematica, con un premio di un milione di dollari da assegnare alla prima persona che li risolverà. (Un problema, la congettura di Poincaré, è stato risolto nel 2010; gli altri, che comprendono P contro NP e l’ipotesi di Riemann, rimangono aperti). “Siamo molto lontani dal fatto che l’IA possa dire qualcosa di serio su uno di questi problemi”, afferma Bridson.

Eppure è difficile sapere esattamente quanto sia lontano, perché molti dei benchmark esistenti utilizzati per valutare i progressi sono al limite. I migliori nuovi modelli superano già la maggior parte degli esseri umani in test come l’AIME.

Per avere un’idea più precisa di ciò che i sistemi esistenti possono o non possono fare, una startup chiamata Epoch AI ha creato un nuovo test chiamato FrontierMath, rilasciato a dicembre. Invece di cooptare test matematici sviluppati per gli esseri umani, Epoch AI ha collaborato con oltre 60 matematici di tutto il mondo per creare una serie di problemi matematici da zero.

FrontierMath è stato progettato per sondare i limiti di ciò che l’IA di oggi può fare. Nessuno dei problemi è stato mai visto prima e la maggior parte è stata tenuta segreta per evitare di contaminare i dati di addestramento. Ogni problema richiede ore di lavoro da parte di matematici esperti, sempre che riescano a risolverlo: alcuni problemi richiedono conoscenze specialistiche per essere affrontati.

FrontierMath è destinato a diventare uno standard industriale. Non è ancora popolare come AIME, dice de Oliveira Santos, che ha contribuito allo sviluppo di alcuni problemi: “Ma mi aspetto che non sia così ancora per molto, dato che i benchmark esistenti sono molto vicini alla saturazione”.

Su AIME, i migliori modelli linguistici di grandi dimensioni (Claude 4 di Anthropic, o3 e o4-mini di OpenAI, Gemini 2.5 Pro di Google DeepMind, Grok 3 di X-AI) ottengono ora un punteggio di circa il 90%. Su FrontierMath, 04-mini ottiene il 19% e Gemini 2.5 Pro il 13%. È un risultato ancora notevole, ma c’è un chiaro margine di miglioramento.

FrontierMath dovrebbe dare il miglior senso della velocità con cui l’intelligenza artificiale sta progredendo in matematica. Ma ci sono alcuni problemi che sono ancora troppo difficili da affrontare per i computer.

2/ L’IA deve gestire sequenze di passi molto vaste

Socchiudete gli occhi e per certi versi i problemi matematici iniziano ad assomigliare: per risolverli è necessario compiere una sequenza di passi dall’inizio alla fine. Il problema è trovare questi passi.

“Praticamente tutti i problemi matematici possono essere formulati come ricerca di un percorso”, spiega Gukov. Ciò che rende alcuni problemi molto più difficili di altri è il numero di passi del percorso. “La differenza tra l’ipotesi di Riemann e la matematica delle scuole superiori è che nella matematica delle scuole superiori i percorsi che cerchiamo sono brevi: 10 passi, 20 passi, forse 40 nel caso più lungo”. I passaggi si ripetono anche tra un problema e l’altro.

“Ma per risolvere l’ipotesi di Riemann non abbiamo i passaggi, e quello che stiamo cercando è un percorso estremamente lungo” – forse un milione di righe di prova al computer, dice Gukov.

Trovare sequenze di passi molto lunghe può essere considerato una sorta di gioco complesso. È ciò che AlphaZero di DeepMind ha imparato a fare quando ha imparato a giocare a Go e a scacchi. Una partita di Go potrebbe comportare solo qualche centinaio di mosse. Ma per vincere, un’intelligenza artificiale deve trovare una sequenza vincente di mosse tra un vasto numero di sequenze possibili. Immaginate un numero con 100 zeri alla fine, dice Gukov.

Ma è ancora poco rispetto al numero di sequenze possibili che potrebbero essere coinvolte nella dimostrazione o nella confutazione di un problema matematico molto difficile: “Un percorso di dimostrazione con mille o un milione di mosse comporta un numero con mille o un milione di zeri”, dice Gukov.

Nessun sistema di intelligenza artificiale è in grado di vagliare così tante possibilità. Per risolvere questo problema, Gukov e i suoi colleghi hanno sviluppato un sistema che accorcia la lunghezza di un percorso combinando più mosse in singole supermosse. È come avere degli stivali che permettono di fare passi da gigante: invece di impiegare 2.000 passi per percorrere un miglio, ora è possibile percorrerlo in 20 passi.

La sfida consisteva nel capire quali mosse sostituire con le supermosse. In una serie di esperimenti, i ricercatori hanno ideato un sistema in cui un modello di apprendimento basato sul rinforzo suggerisce nuove mosse e un secondo modello controlla se queste mosse sono utili.

Hanno usato questo approccio per fare un passo avanti in un problema matematico chiamato congettura di Andrews-Curtis, un rompicapo che è rimasto irrisolto per 60 anni. È un problema che ogni matematico professionista conosce, dice Gukov.

(Un inciso solo per gli appassionati di matematica: la congettura AC afferma che un particolare modo di descrivere un tipo di insieme chiamato gruppo banale può essere tradotto in una descrizione diversa ma equivalente con una certa sequenza di passaggi. La maggior parte dei matematici ritiene che la congettura AC sia falsa, ma nessuno sa come dimostrarlo. Gukov stesso ammette che si tratta di una curiosità intellettuale più che di un problema pratico, ma comunque di un problema importante per i matematici).

Gukov e i suoi colleghi non hanno risolto la congettura di AC, ma hanno scoperto che un controesempio (che suggerisce che la congettura è falsa) proposto 40 anni fa era a sua volta falso. “È stata una delle principali direzioni di attacco per 40 anni”, dice Gukov. Con l’aiuto dell’intelligenza artificiale, hanno dimostrato che questa direzione era in realtà un vicolo cieco.

“Escludere i possibili controesempi è una cosa utile”, dice Bridson. “Può chiudere vicoli ciechi, qualcosa che si potrebbe passare un anno della propria vita a esplorare”.

È vero che Gukov ha eliminato solo un pezzo di un puzzle esoterico. Ma ritiene che l’approccio possa funzionare in qualsiasi scenario in cui sia necessario trovare una lunga sequenza di mosse sconosciute, e intende ora provarlo su altri problemi.

“Forse porterà a qualcosa che aiuterà l’IA in generale”, dice. “Perché insegna ai modelli di apprendimento per rinforzo ad andare oltre il loro addestramento. Per me si tratta fondamentalmente di pensare fuori dagli schemi, a chilometri di distanza, a megaparsec di distanza”.

3/ L’IA può mai fornire una visione reale?

Pensare fuori dagli schemi è esattamente ciò che serve ai matematici per risolvere problemi difficili. Spesso si pensa che la matematica comporti procedure robotizzate, passo dopo passo. Ma la matematica avanzata è una ricerca sperimentale, che comporta tentativi ed errori e lampi di intuizione.

È qui che entrano in gioco strumenti come AlphaEvolve. L’ultimo modello di Google DeepMind chiede a un LLM di generare codice per risolvere un particolare problema matematico. Un secondo modello valuta le soluzioni proposte, sceglie le migliori e le rimanda all’LLM per migliorarle. Dopo centinaia di tentativi ed errori, AlphaEvolve è stato in grado di proporre soluzioni a un’ampia gamma di problemi matematici migliori di qualsiasi altra soluzione proposta. Ma può anche funzionare come strumento collaborativo: in qualsiasi fase, gli esseri umani possono condividere le proprie intuizioni con l’LLM, suggerendogli istruzioni specifiche.

Questo tipo di esplorazione è fondamentale per la matematica avanzata. “Spesso cerco fenomeni interessanti e mi spingo in una certa direzione”, dice Geordie Williamson, matematico dell’Università di Sydney in Australia. “Ad esempio: ‘Fammi dare un’occhiata in questo vicoletto. Oh, ho trovato qualcosa!””.

Williamson ha lavorato con Meta a uno strumento di intelligenza artificiale chiamato PatternBoost, progettato per supportare questo tipo di esplorazione. PatternBoost può prendere un’idea o un’affermazione matematica e generarne altre simili. “È come se: ‘Ecco un gruppo di cose interessanti. Non so cosa stia succedendo, ma puoi produrre altre cose interessanti come queste?””, spiega.

Questo brainstorming è un lavoro essenziale per la matematica. È così che nascono nuove idee. Prendiamo l’icosaedro, dice Williamson: “È un bellissimo esempio di questo, a cui continuo a tornare nel mio lavoro”. L’icosaedro è un oggetto 3D a 20 facce in cui tutte le facce sono triangoli (si pensi a un dado a 20 facce). L’icosaedro è il più grande di una famiglia di esattamente cinque oggetti di questo tipo: c’è il tetraedro (quattro facce), il cubo (sei facce), l’ottaedro (otto facce) e il dodecaedro (12 facce).

È sorprendente che il fatto che esistano esattamente cinque di questi oggetti sia stato dimostrato da matematici dell’antica Grecia. “All’epoca in cui fu dimostrato questo teorema, l’icosaedro non esisteva”, dice Williamson. “Non si può andare in una cava e trovarlo: qualcuno l’ha trovato nella sua mente. E l’icosaedro ha avuto un effetto profondo sulla matematica. Ancora oggi ci influenza in modi molto, molto profondi”.

Per Williamson, il potenziale eccitante di strumenti come PatternBoost è che potrebbero aiutare le persone a scoprire futuri oggetti matematici come l’icosaedro che andranno a plasmare il modo di fare matematica. Ma non siamo ancora a quel punto. “L’intelligenza artificiale può contribuire in modo significativo ai problemi di ricerca”, afferma. “Ma di certo in questa fase non veniamo inondati di nuovi teoremi”.

In definitiva, la questione si riduce al fatto che alle macchine manca ancora quello che si potrebbe definire intuito o pensiero creativo. Williamson riassume la questione in questo modo: ora abbiamo un’intelligenza artificiale che può battere gli esseri umani quando conosce le regole del gioco. “Ma una cosa è che un computer giochi a Go a un livello sovrumano e un’altra cosa è che il computer inventi il gioco del Go”.

“Penso che questo valga anche per la matematica avanzata”, dice. “Le scoperte derivano da un nuovo modo di pensare a qualcosa, che è simile a trovare mosse completamente nuove in un gioco. E non credo che riusciamo a capire da dove provengano queste mosse davvero brillanti nella matematica profonda”.

Forse gli strumenti di intelligenza artificiale come AlphaEvolve e PatternBoost sono meglio considerati come esploratori avanzati per l’intuizione umana. Possono scoprire nuove direzioni e indicare vicoli ciechi, risparmiando ai matematici mesi o anni di lavoro. Ma le vere scoperte verranno comunque dalla mente delle persone, come è avvenuto per migliaia di anni.

Almeno per ora. “Ci sono molte aziende tecnologiche che ci dicono che non durerà a lungo”, dice Williamson. “Ma si sa, staremo a vedere”.