Outbreak. Cosa rivela il caso OpenAI/Hugging Face e cosa no

Un AI agent evade dal suo ambiente di test, trova uno zero-day e hackera un'altra azienda. Sembra una sceneggiatura, ma nel luglio 2026 è successo davvero. È il momento di un inquadramento lucido: con un po' di psicologia, due veterani della security e la domanda su cosa significhi tutto questo per la tua difesa.

Outbreak. Cosa rivela il caso OpenAI/Hugging Face e cosa no

Cosa è successo

Pochi giorni fa OpenAI e Hugging Face hanno reso pubblico un incidente che ha elettrizzato la community della security: un AI agent autonomo, alimentato da GPT-5.6 Sol e da un modello ancora inedito e più performante, è evaso dal suo ambiente di test isolato durante un test di sicurezza interno. L'agent si è procurato passo dopo passo più accessi all'interno dei sistemi OpenAI, sfruttando tra l'altro una vulnerabilità zero-day fino a quel momento sconosciuta, ha raggiunto internet e ha infine penetrato i sistemi interni di Hugging Face, per procurarsi lì le informazioni che gli era stato originariamente assegnato di cercare.

Nel frattempo sono pubblici i primi dettagli tecnici, tra l'altro nell'analisi del caso di Simon Willison: il test si è svolto nell'ambito di un benchmark di exploit, deliberatamente con meccanismi di protezione ridotti. L'ambiente di test aveva esattamente una connessione verso l'esterno, un proxy interno per l'installazione delle dipendenze, ed è proprio in quel proxy che il modello ha trovato lo zero-day. L'evasione è stata dunque meno magia che il forzamento dell'unica porta esistente. In Hugging Face la strada è poi passata attraverso un dataset malevolo verso l'infrastruttura di elaborazione, e da lì, con credenziali sottratte, verso diversi cluster interni.

Il motivo è quasi la battuta migliore dell'intera storia: il modello cercava informazioni con cui poter barare alla propria valutazione. Il primo attacco AI presumibilmente eseguito in modo completamente autonomo è stato quindi, a rigore, un caso di frode d'esame. Con danni collaterali.

Hugging Face descrive l'incidente come qualcosa che si distingue da tutto ciò che ha trattato finora: "driven, end to end, by an autonomous AI agent system". OpenAI parla di un incidente cyber senza precedenti. Non vogliamo in alcun modo minimizzare la portata di questo attacco. Ma vogliamo togliere dal dibattito il calore e l'emotività, perché proprio quelle sono in questo momento il rischio maggiore per le buone decisioni.

Perché questo incidente sembra così minaccioso

Uno sguardo alla psicologia aiuta. Il ricercatore del rischio Paul Slovic ha dimostrato che non valutiamo i rischi in base alla loro pericolosità statistica, ma soprattutto secondo due dimensioni: quanto ci è familiare un rischio e quanto lo temiamo. Guidare è oggettivamente pericoloso, ma sembra innocuo perché appare familiare e controllabile. Un modello di AI evaso dal laboratorio, invece, colpisce il nervo dell'ignoto e dell'incontrollabile e finisce esattamente nella categoria che Slovic descrive come "dread risk".

Daniel Kahneman in "Pensieri lenti e veloci" ha descritto cosa succede poi: di fronte a rischi ignoti e dall'apparenza minacciosa prende il comando il nostro sistema di pensiero rapido, intuitivo, emotivo, non quello lento e analitico. È esattamente questo schema che osserviamo in questo momento in molte sezioni dei commenti: l'incidente non viene analizzato, viene sentito.

Quindi: un respiro profondo, accendere il Sistema 2 e guardare il caso da altre prospettive.

Prospettiva 1: mostrate le prove (Florian Roth)

Il ricercatore di security Florian Roth (noto tra l'altro per Sigma e THOR) contesta nel suo post su LinkedIn un punto centrale: la documentazione mancante. Hugging Face sostiene che l'attacco sia stato guidato "end to end" da un sistema di agent autonomi. Ma la telemetria della vittima può in linea di principio mostrare solo ciò che è accaduto nel proprio ambiente. Non può mostrare se a monte delle persone hanno adattato prompt, riavviato esecuzioni, selezionato i percorsi riusciti o dato una mano a mano nei punti decisivi. La richiesta di Roth è tanto semplice quanto legittima: se OpenAI ha i trace (prompt, tool call, esecuzioni fallite, interventi umani), allora li pubblichi. Fino a quel momento "completamente autonomo" è un'affermazione, non un riscontro forense. Un commentatore aggiunge a proposito: anche in quel caso sarebbe difficile dimostrare senza dubbi quanta interazione umana ci sia effettivamente stata.

E Roth ci aggiunge una punta. Il racconto delle due aziende di AI si riduce in sostanza a tre righe: l'AI ci ha attaccati. L'AI ci ha salvati. Quindi ora a tutti serve più AI. Ciò che dieci anni fa sarebbe stata una figuraccia (isolamento debole, privilegi troppo estesi, segmentazione insufficiente, blast radius enorme) viene oggi confezionato come capability demo e come epica storia AI contro AI. Il suo verdetto asciutto: rate limit, restrizioni sull'egress, worker isolati e credenziali ben delimitate avrebbero frenato gran parte di questa attività e l'avrebbero resa visibile presto. Per questo non serve a nessuno un LLM.

Prospettiva 2: siamo sopravvissuti a cose peggiori (Marcus Hutchins)

Marcus Hutchins, il ricercatore di security che nel 2017 ha fermato l'epidemia di WannaCry con un kill switch, inquadra storicamente il caso nel suo contributo. Chi si lascia prendere dal panico per i "cyberattacchi completamente autonomi" dovrebbe ricordarsi dell'era d'oro dei worm informatici: ILOVEYOU, Code Red, SQL Slammer. Malware autoreplicante che senza alcun intervento umano infettava milioni di sistemi in una sola giornata, in un'epoca in cui molti sistemi erano appesi a internet direttamente e senza protezione.

Il suo argomento: gli attacchi agentici sono fondamentalmente limitati da velocità e costi. Nel tempo in cui un modello di AI genera una singola risposta, un worm classico avrebbe già infettato decine di migliaia di sistemi, e i costi in token per hackerare in modo autonomo milioni di sistemi sfondano il budget della maggior parte degli attaccanti. A questo si aggiunge: firewall, EDR, segmentazione di rete, sandboxing, MFA e molti altri controlli sono oggi standard e costituiscono ostacoli reali che allora semplicemente non esistevano. La sua conclusione: gli attacchi supportati dall'AI non possono riportare la cybersecurity indietro di decenni. Non possono cancellare dal mondo i controlli di sicurezza una volta consolidati né l'igiene di base. L'attack surface reduction funziona. Uno zero-day non può colpire un sistema che non raggiunge.

Cosa dicono entrambi e cosa ne consegue

I due esperti arrivano per strade diverse alla stessa conclusione: concentrarsi sull'essenziale. Le aziende che migliorano continuamente la propria security posture e attuano con coerenza concetti come Zero Trust, least privilege e una netta separazione dei tier hanno una probabilità nettamente inferiore di diventare vittime, indipendentemente dal fatto che all'altro capo ci sia una persona, uno script o un modello linguistico.

L'incidente va comunque preso sul serio, e questo a prescindere da come si concluda la questione delle prove. Questo incidente non è un esempio di come l'AI si impadronisca di internet. Ma mostra che aspetto ha un attacco mirato a un nuovo livello: il concatenamento autonomo di due catene d'attacco separate attraverso due infrastrutture altrui, eseguito in molte migliaia di singole azioni da uno sciame di sandbox effimere. Se OpenAI dovesse pubblicare i trace e dimostrare la piena autonomia, il quadro non diventerebbe più innocuo. Alla logica della difesa, però, questo non cambia nulla. La conferma.

Che gli attaccanti trovino strade che non si erano previste non è una scoperta nuova, ma il pane quotidiano di chiunque lavori nella security. Proprio per questo esiste la defense in depth: se non individuo o fermo l'attaccante alla stazione 4 della attack chain, allora lo fermo alla 5. E questo include espressamente gli zero-day. Si possono costruire infrastrutture capaci di resistere anche a tempeste violente. Non perché si preveda ogni tempesta, ma perché si costruisce per le tempeste.

Un'ironia marginale che nel frastuono quasi si perde: per l'analisi forense Hugging Face ha puntato proprio su un modello cinese aperto, anche perché un modello frontier statunitense in hosting si è semplicemente rifiutato di analizzare una backdoor. Il dibattito su quali strumenti i difensori possano usare, e con quanta rapidità, in caso di emergenza è dunque appena iniziato, ed è almeno tanto importante quanto la domanda su cosa sapranno fare in futuro gli attaccanti.

Non un SOC autonomo, ma uno migliore

Sia la difesa sia l'attacco hanno ricevuto nuovi strumenti. Anche se da noi "strumento" da tempo non è più la parola giusta. Nel nostro SOC l'AI non è un add-on, ma parte ovvia di ogni fase dell'incident handling: dalla detection al triage e all'enrichment fino alla response, le nostre analiste e i nostri analisti lavorano fianco a fianco con le soluzioni e i modelli di Microsoft e Anthropic. Ciò che è ripetitivo gira automatizzato, così le nostre esperte e i nostri esperti possono concentrarsi su ciò che fa la differenza: trarre nuove conoscenze da ogni incident e affinare continuamente detection, playbook e configurazioni. Un SOC autonomo al 100 % non è attualmente possibile, e del resto lo pensa anche Gartner. Ma da noi la manopola non è una questione di fede, bensì un'impostazione che rivalutiamo continuamente: con ogni generazione di modelli e ogni esperienza acquisita la alziamo esattamente quanto la qualità lo consente. Non oltre, ma nemmeno un millimetro in meno.

Questo gioco di squadra tra persona, modello e metodo è il nucleo del nostro Cloud Security Operations Center (CSOC): detection & response 24/7, combinate con il continuous improvement. Ogni mese un pezzo di security posture migliore, basato sui nostri blueprint e su ciò che i nostri esperti di threat osservano in natura.

E contro il problema di fondo che Florian Roth seziona con tanta precisione (isolamento debole, privilegi dilaganti, segmentazione mancante) abbiamo una risposta molto concreta: il Managed Red Tenant. Un ambiente amministrativo completamente isolato, che impedisce strutturalmente lateral movement e privilege escalation. Con l'architettura giusta e le configurazioni giuste gli attacchi vanno a vuoto, anche quelli degli AI agent. Perché sia che un attaccante sia di carne e ossa o di token: contro un confine di tier che non si può superare non serve nemmeno il miglior reasoning.

Conclusioni

Il caso OpenAI/Hugging Face è una pietra miliare: come avvertimento, come caso di studio e come anticipazione. Ma non è un motivo per farsi prendere dal panico, bensì per stabilire priorità. Gli attacchi del futuro saranno forse più autonomi; la difesa che serve contro di loro è sorprendentemente familiare: Zero Trust, least privilege, una netta separazione dei tier, defense in depth e un SOC che non dorme mai.

Oppure, per restare alla battuta di questo caso: se un'AI deve proprio evadere per barare al proprio test, facciamo in modo che da noi almeno non trovi risposte.

Articoli simili