Finanziamenti · 21 settembre 2026
Pubblicato anche in Español
Ricercatori hanno sfruttato Claude di Anthropic per violare le difese di OpenAI
In un contesto che riflette lo stato emergente della sicurezza dell'intelligenza artificiale, ricercatori indipendenti hanno utilizzato Claude di Anthropic per penetrare nei sistemi di OpenAI, rivelando vulnerabilità nelle difese del creatore di ChatGPT, ha riferito The Wall Street Journal nella serata del giovedì.
Un team di tre esperti di sicurezza appartenenti a una startup chiamata Hacktron AI ha condotto l'attacco nell'ambito di un programma di bug bounty di OpenAI. Hacktron ha comunicato i risultati a OpenAI, che ha premiato la startup con un riconoscimento di 6.500 dollari. Il gruppo è riuscito a collegare due vulnerabilità critiche per ottenere l'accesso a più account ChatGPT di dipendenti di OpenAI, accedendo così all'infrastruttura software dell'azienda.
OpenAI ha dichiarato di aver risolto le problematiche scoperte da Hacktron, in un momento in cui le principali aziende di intelligenza artificiale sono sotto crescente pressione riguardo alle misure di sicurezza.
L'incidente si verifica poche settimane dopo che gli stessi agenti AI di OpenAI hanno infranto le barriere di contenimento durante una valutazione di cybersecurity e hanno compromesso Hugging Face, dimostrando la crescente capacità dei modelli di prendere decisioni autonome. Tale evento mette in evidenza come tecnologie pronte all'uso possano essere impiegate per individuare falle anche nelle infrastrutture più avanzate.
"Per 200 dollari al mese, chiunque può utilizzare questi strumenti e violare un'azienda come OpenAI", ha dichiarato Matt Fredrikson, amministratore delegato di una società di sicurezza AI chiamata Gray Swan, a TechCrunch. "Se può accadere a loro — e non penso che abbiano abbassato la guardia di recente sulle pratiche di cybersecurity — può accadere a chiunque".
Come ha notato un commentatore del settore sui social: "[Hacktron] ha utilizzato Opus 5 per portare a termine l'attacco…La domanda che verrà posta è, se tre persone possono compiere questo gesto, cosa può fare uno Stato nazionale".
I ricercatori hanno scoperto un percorso per penetrare in OpenAI attraverso una falla nel software Discourse, che alimenta il forum della community di OpenAI.
Secondo un blog pubblicato dai ricercatori, il punto di ingresso è stato una semplice operazione di caricamento di immagini. Quando gli utenti hanno caricato file HEIF o HEIC (formato predefinito degli iPhone) sul forum, Discourse li ha passati attraverso una catena di strumenti interni per convertirli in JPEG standard. Il primo passaggio è stato affidato a ImageMagick, una utility open source di lunga data utilizzata per ridimensionare immagini. Poiché il toolkit di ImageMagick non supporta nativamente il formato Apple, ha delegato il processo a una libreria chiamata libheif per la decodifica.
All'interno di libheif era nascosta una falla di memoria che ha consentito a un attaccante di inserire istruzioni proprie. In questo caso, fornendo alla libreria un'immagine appositamente manipolata, è stato calcolato in modo errato il posizionamento di un'immagine rispetto a un'altra, creando un varco sufficiente per compromettere il server.
Un aspetto scomodo per la comunità della cybersecurity è che la falla era già stata corretta mesi prima dagli sviluppatori di libheif. Tuttavia, la correzione non era stata formalmente segnalata come vulnerabilità, quindi non era stata assegnata una CVE (Common Vulnerabilities and Exposures), lo standard di riferimento per tracciare le debolezze di sicurezza note. Hacktron ha sottolineato che ciò potrebbe spiegare perché il software utilizzato da Discourse fosse ancora nella versione vulnerabile.
Inizialmente, il modello Claude impiegato — una versione speciale di Opus 4.8 resa disponibile per ricercatori di cybersecurity — non era in grado di generare un exploit funzionante. Il cambiamento è avvenuto poche ore dopo il rilascio di Opus 5.
"Opus 4.8 ha avuto difficoltà in diverse sessioni a produrre un exploit funzionante", hanno scritto i ricercatori nel loro blog. "Appena poche ore dopo il rilascio di Opus 5, abbiamo riproposto lo stesso problema e l'abbiamo ottenuto".
Una volta all'interno del server Discourse, i ricercatori hanno identificato un'altra falla che ha permesso loro di prendere il controllo degli account ChatGPT e Codex di OpenAI, inclusi quelli dei dipendenti.
"Abbiamo quindi preso il controllo di un account di un dipendente di OpenAI, il cui Codex era collegato all'organizzazione GitHub di OpenAI", hanno riassunto i ricercatori.
A questo punto, i ricercatori hanno informato OpenAI e Discourse, che ha rilasciato una correzione il 27 luglio.
L'evento mette in luce il confine tra le capacità dei modelli e le loro restrizioni di sicurezza. Claude Opus 5, la versione che ha infine infranto la falla, non è soggetto a restrizioni di esportazione di sicurezza, a differenza di Mythos 5, che è stato temporaneamente bloccato per preoccupazioni sulle sue avanzate capacità di hacking.
Queste sono solo le versioni chiuse. I modelli open-weight stanno colmando il divario con i sistemi di frontiera in termini di capacità cyber. Ad esempio, il nonprofit di sicurezza AI SaferAI ha recentemente scoperto che la compagnia cinese Z.ai ha rilasciato GLM-5.2, che si trova a pochi mesi di distanza da GPT-5.5 di OpenAI e da Claude Opus 4.7 di Anthropic.
Come ha affermato il fondatore di Hacktron, Mohan Pedhapati, su X: "L'intelligenza artificiale sta riducendo la quantità di competenze rare necessarie per sviluppare exploit. Lavori che una volta richiedevano mesi possono ora essere completati in giorni".
Quando si acquista tramite i link presenti nei nostri articoli, possiamo guadagnare una piccola commissione. Questo non influenza la nostra indipendenza editoriale.
Rebecca Bellan è una reporter senior di TechCrunch, dove copre affari, politiche ed emergenti tendenze legate all'intelligenza artificiale. I suoi articoli sono comparsi anche su Forbes, Bloomberg, The Atlantic, The Daily Beast e altre pubblicazioni.
Per contattare o verificare l'approccio di Rebecca, è possibile inviare una email a [email protected] o utilizzare un messaggio cifrato su Signal al numero rebeccabellan.491.