Skip to main content
Stephanie Arnett/MIT Technology Review | Adobe Stock

Gli agenti potrebbero rendere più facile ed economico per i criminali violare i sistemi su scala. Dobbiamo essere pronti.

Gli agenti sono la parola d’ordine dell’industria dell’intelligenza artificiale: sono in grado di pianificare, ragionare ed eseguire compiti complessi come programmare riunioni, ordinare la spesa o persino prendere il controllo del vostro computer per modificare le impostazioni a vostro nome. Ma le stesse sofisticate capacità che rendono gli agenti utili assistenti potrebbero anche renderli potenti strumenti per condurre attacchi informatici. Potrebbero essere facilmente utilizzati per identificare obiettivi vulnerabili, dirottare i loro sistemi e rubare dati preziosi a vittime ignare.

Al momento, i criminali informatici non stanno impiegando agenti di intelligenza artificiale per hackerare su larga scala. Ma i ricercatori hanno dimostrato che gli agenti sono in grado di eseguire attacchi complessi (Anthropic, per esempio, ha osservato il suo Claude LLM replicare con successo un attacco progettato per rubare informazioni sensibili) e gli esperti di cybersicurezza avvertono che dovremmo aspettarci di vedere questo tipo di attacchi diffondersi nel mondo reale.

“Credo che alla fine vivremo in un mondo in cui la maggior parte dei cyberattacchi sarà condotta da agenti”, afferma Mark Stockley, esperto di sicurezza della società di cybersicurezza Malwarebytes. “È solo una questione di quanto velocemente ci arriveremo”.

Mentre abbiamo una buona idea dei tipi di minacce che gli agenti di intelligenza artificiale potrebbero rappresentare per la sicurezza informatica, ciò che è meno chiaro è come rilevarli nel mondo reale. L’organizzazione di ricerca sull’intelligenza artificiale Palisade Research ha costruito un sistema chiamato LLM Agent Honeypot nella speranza di fare proprio questo. Ha creato dei server vulnerabili che si mascherano da siti di informazioni governative e militari di valore per attirare e cercare di catturare gli agenti dell’IA che tentano di penetrare.

Il team che lo ha ideato spera che, tracciando questi tentativi nel mondo reale, il progetto funga da sistema di allarme precoce e aiuti gli esperti a sviluppare difese efficaci contro gli attori delle minacce dell’intelligenza artificiale prima che diventino un problema serio.

“La nostra intenzione era quella di provare a mettere a terra le preoccupazioni teoriche delle persone”, afferma Dmitrii Volkov, responsabile della ricerca di Palisade. “Siamo in attesa di un’impennata e quando ciò accadrà, sapremo che il panorama della sicurezza è cambiato. Nei prossimi anni, mi aspetto di vedere agenti di hacking autonomi a cui viene detto: ‘Questo è il tuo obiettivo. Vai e violalo””.

Gli agenti di intelligenza artificiale rappresentano una prospettiva interessante per i criminali informatici. Sono molto più economici rispetto all’assunzione dei servizi di hacker professionisti e potrebbero orchestrare attacchi più rapidamente e su scala molto più ampia di quanto potrebbero fare gli esseri umani. Sebbene gli esperti di cybersicurezza ritengano che gli attacchi ransomware, il tipo più redditizio, siano relativamente rari perché richiedono una notevole competenza umana, in futuro questi attacchi potrebbero essere esternalizzati agli agenti, afferma Stockley. “Se si può delegare il lavoro di selezione dei bersagli a un agente, allora improvvisamente si può scalare il ransomware in un modo che al momento non è possibile”, afferma . “Se posso riprodurlo una volta, allora è solo una questione di soldi per riprodurlo 100 volte”.

Gli agenti sono anche molto più intelligenti dei tipi di bot tipicamente utilizzati per violare i sistemi. I bot sono semplici programmi automatizzati che vengono eseguiti tramite script, quindi faticano ad adattarsi a scenari inaspettati. Gli agenti, invece, sono in grado non solo di adattare il modo in cui affrontano un obiettivo di hacking, ma anche di evitare il rilevamento, due aspetti che sono al di là delle capacità di programmi limitati e basati su script, spiega Volkov. “Possono osservare un obiettivo e indovinare i modi migliori per penetrarlo”, afferma Volkov. “Questo genere di cose è fuori dalla portata di bot stupidi e scriptati”.

Da quando l’LLM Agent Honeypot è entrato in funzione nell’ottobre dello scorso anno, ha registrato più di 11 milioni di tentativi di accesso, la maggior parte dei quali da parte di umani e bot curiosi. Ma tra questi, i ricercatori hanno individuato otto potenziali agenti AI, due dei quali hanno confermato essere agenti che sembrano provenire rispettivamente da Hong Kong e Singapore.

“Immaginiamo che questi agenti confermati siano stati esperimenti lanciati direttamente da esseri umani con un programma del tipo: “Esci su Internet e cerca di hackerare qualcosa di interessante per me””, spiega Volkov. Il team ha in programma di espandere il suo honeypot a piattaforme di social media, siti web e database per attirare e catturare una gamma più ampia di aggressori, tra cui bot di spam e agenti di phishing, per analizzare le minacce future.

Per determinare quali visitatori dei server vulnerabili fossero agenti LLM, i ricercatori hanno incorporato tecniche di prompt-injection nell’honeypot. Questi attacchi sono progettati per modificare il comportamento degli agenti AI impartendo loro nuove istruzioni e ponendo domande che richiedono un’intelligenza simile a quella umana. Questo approccio non funzionerebbe con i bot standard.

Ad esempio, uno dei prompt iniettati chiedeva al visitatore di restituire il comando “cat8193” per ottenere l’accesso. Se il visitatore ha eseguito correttamente l’istruzione, i ricercatori hanno verificato quanto tempo ha impiegato per farlo, partendo dal presupposto che gli LLM sono in grado di rispondere in un tempo molto inferiore a quello necessario a un essere umano per leggere la richiesta e digitare una risposta, in genere in meno di 1,5 secondi. Mentre i due agenti AI confermati hanno superato entrambi i test, gli altri sei hanno solo inserito il comando ma non hanno rispettato il tempo di risposta che li avrebbe identificati come agenti AI.

Gli esperti non sanno ancora quando gli attacchi orchestrati da agenti diventeranno più diffusi. Stockley, la cui azienda Malwarebytes ha indicato l’IA agenziale come una nuova minaccia di rilievo per la sicurezza informatica nel suo rapporto State of Malware 2025, ritiene che potremmo vivere in un mondo di aggressori agenziali già quest’anno.

E sebbene l’IA agenziale regolare sia ancora in una fase iniziale – e l’uso criminale o malevolo dell’IA agenziale lo è ancora di più – è ancora più un Far West di quanto non lo fosse il campo dell’LLM due anni fa, afferma Vincenzo Ciancaglini, ricercatore senior sulle minacce presso la società di sicurezza Trend Micro.

“L’approccio di Palisade Research è brillante: in pratica hackerare gli agenti AI che cercano di hackerare voi per primi”, afferma. “Mentre in questo caso stiamo assistendo ad agenti AI che cercano di fare ricognizione, non siamo sicuri di quando gli agenti saranno in grado di portare avanti una catena di attacchi completa in modo autonomo. È questo che stiamo cercando di tenere d’occhio”.

Se da un lato è possibile che gli agenti maligni vengano utilizzati per la raccolta di informazioni prima di passare a semplici attacchi e infine ad attacchi complessi, man mano che gli stessi sistemi agenziali diventano più complessi e affidabili, dall’altro è altrettanto possibile che si verifichi un’esplosione inaspettata e improvvisa dell’uso criminale, afferma: “Questa è la cosa strana dello sviluppo dell’IA in questo momento”. Chi cerca di difendersi dai cyberattacchi agenziali deve tenere presente che l’IA è attualmente più un acceleratore delle tecniche di attacco esistenti che qualcosa che cambia radicalmente la natura degli attacchi, afferma Chris Betz, Chief Information Security Officer di Amazon Web Services. “Alcuni attacchi potrebbero essere più semplici da condurre e quindi più numerosi; tuttavia, le basi per rilevare e rispondere a questi eventi rimangono le stesse”.

Gli agenti potrebbero anche essere impiegati per rilevare le vulnerabilità e proteggere dagli intrusi, afferma Edoardo Debenedetti, dottorando presso l’ETH Zürich in Svizzera, sottolineando che se un agente amico non è in grado di trovare alcuna vulnerabilità in un sistema, è improbabile che un agente altrettanto capace utilizzato da una parte malintenzionata sia in grado di trovarne.

Sebbene sappiamo che il potenziale dell’IA di condurre autonomamente attacchi informatici è un rischio crescente e che gli agenti di IA stanno già scansionando Internet, un passo successivo utile è quello di valutare quanto gli agenti siano bravi a trovare e sfruttare queste vulnerabilità del mondo reale. Daniel Kang, professore assistente presso l’Università dell’Illinois Urbana-Champaign, e il suo team hanno costruito un benchmark per valutare questo aspetto; hanno scoperto che gli attuali agenti di IA hanno sfruttato con successo fino al 13% delle vulnerabilità di cui non avevano alcuna conoscenza preliminare. Fornendo agli agenti una breve descrizione della vulnerabilità, la percentuale di successo è salita al 25%, dimostrando come i sistemi di intelligenza artificiale siano in grado di identificare e sfruttare i punti deboli anche senza addestramento. I bot di base farebbero presumibilmente molto peggio.

Il benchmark fornisce un metodo standardizzato per valutare questi rischi e Kang spera che possa guidare lo sviluppo di sistemi di IA più sicuri. “Spero che le persone inizino a essere più proattive sui rischi potenziali dell’IA e della cybersicurezza prima che si verifichi un momento di ChatGPT”, afferma. “Temo che le persone non se ne rendano conto fino a quando non si troveranno di fronte a un pugno in faccia”.