Sicurezza · 23 settembre 2026
Ricerca dimostra fuga dalla sandbox di OpenAI Codex per eseguire comandi sul host
Ricercatori della sicurezza hanno scoperto due vie di fuga dalla sandbox di OpenAI Codex, una delle quali capace di eseguire comandi su una macchina di uno sviluppatore dalla modalità più bloccata di Codex, senza richiedere alcuna conferma e senza mostrare nulla a schermo.
Le due vulnerabilità sono state segnalate a OpenAI il 12 agosto e sono state risolte entro otto giorni, secondo Oren Yomtov di Accomplish AI.
La falla più grave, soprannominata Heapjack, trasforma un'azione ordinaria in esecuzione remota di codice: aprire un repository altrui in Codex, porre una domanda sul codice e il creatore del repository riceve l'esecuzione di comandi non sandboxati sul proprio computer.
Codex è l'agente di codifica di OpenAI, disponibile sia come strumento da riga di comando che come applicazione desktop. Come gli agenti concorrenti, opera le azioni del modello all'interno di una sandbox in modo che il codice non autorizzato non possa toccare il sistema più ampio. Entrambe le vie di fuga funzionano sconfiggendo questo confine dall'interno.
La tecnica Heapjack, descritta nel documento di Yomtov, colpisce un componente chiamato node_repl, che il desktop di Codex scrive nel file di configurazione globale '~/.codex/config.toml' al momento dell'installazione.
Non vi è alcun opt-in né impostazione per disattivare questa configurazione; poiché l'entry risiede in un file condiviso, gli utenti della CLI di Codex ereditano automaticamente lo stesso strumento senza alcuna richiesta.
node_repl avvia un singolo processo Node.js che mantiene due contesti di esecuzione JavaScript distinti. Uno è considerato attendibile e contiene il codice interno di OpenAI; l'altro è non attendibile ed esegue il codice dell'agente. Il contesto attendibile dimostra la sua attendibilità presentando un token casuale generato ad ogni esecuzione.
Il problema è che entrambi i contesti condividono lo stesso processo Node e la stessa area di memoria, quindi il token è semplicemente una stringa presente in memoria e può essere letto dalla parte non attendibile.
Il codice non attendibile cattura uno snapshot dell'area di memoria con 'v8.getHeapSnapshot()' e prova ogni stringa che assume la forma di un UUID. Un'ipotesi errata restituisce "not authorized"; una token corretta con un argomento non valido genera un errore di validazione reale, indicando all'attaccante che il token è corretto.
Con il token, il codice non attendibile scrive la propria richiesta sullo stesso canale usato dal contesto attendibile per comunicare con un processo padre non sandboxato.
Il padre verifica il token, lo riconosce come valido e procede con l'operazione. La prova di concetto ha utilizzato il comando di sistema 'open' per lanciare un'applicazione al di fuori del processo di Codex. Lo stesso accesso può raggiungere qualsiasi socket Unix, in particolare il socket del daemon Docker, e un file di configurazione globale.
Tutto questo avviene in modalità di sola lettura, la più restrittiva della sandbox, dove l'agente non dovrebbe scrivere nulla.
La seconda falla, denominata Overpatch, si trova nella CLI open-source di Codex. In modalità workspace-write, l'agente può scrivere solo all'interno della cartella del progetto; un comando di shell diretto alla directory home viene rifiutato.
I ricercatori hanno sfruttato lo strumento di patch interno di Codex, apply_patch, per scrivere comunque nella directory home.
apply_patch concede accesso di scrittura alla cartella padre di ogni percorso specificato nella patch. Specificando '/tmp', si concede scrittura alla radice del disco.
La patch di prova contiene due modifiche: una che nomina '/tmp' e non svolge alcuna azione utile se non ampliare le autorizzazioni, e un'altra che aggiunge una riga a '.zshrc' tramite un collegamento simbolico nella directory home.
Senza la prima modifica la scrittura è rifiutata; con essa, il prossimo terminale aperto dall sviluppatore esegue la riga inserita senza sandbox.
Entrambe le vulnerabilità condividono una struttura comune: il meccanismo di enforcement era contenuto all'interno dello stesso sistema che doveva essere enforcement. apply_patch determinava le proprie autorizzazioni da input fornito dall'attaccante; node_repl manteneva il confine tra codice attendibile e non attendibile nella stessa area di memoria del codice non attendibile.
In entrambi i casi la sandbox veniva informata, dall'interno, di concedere l'accesso.
La classe di vulnerabilità non è nuova. A luglio 2026, ricercatori di Pillar Security hanno dimostrato lo stesso concetto su Cursor, Codex, Gemini CLI e Antigravity di Google, dove un agente che rimane all'interno della propria sandbox scrive un file che uno strumento attendibile fuori dalla sandbox esegue successivamente.
Un commentatore, reagendo al post di Yomtov su X, ha scritto che "V8 isola i globali, non la memoria, quindi la sandbox era davvero una promessa che l'heap non aveva accettato." Un altro ha definito il confine di fiducia "una barriera di stanza".
L'attivazione predefinita ha suscitato ulteriori interrogativi, con qualcuno che chiedeva perché un token privilegiato fosse accessibile dal codice JavaScript non attendibile.
OpenAI ha corretto Heapjack in build 26.818.21641 di Codex Desktop e Overpatch in versione 0.149.0 della CLI di Codex, secondo Accomplish.
Gli utenti devono aggiornare alle versioni indicate o successive. Yomtov ha ringraziato OpenAI per aver risolto entrambe le questioni entro otto giorni dalla segnalazione.
BleepingComputer ha contattato OpenAI per un commento prima della pubblicazione.
In una dichiarazione a BleepingComputer odierna, un portavoce di OpenAI ha dichiarato:
"Ringraziamo i ricercatori per averci contattato e per aver condiviso i loro risultati. Abbiamo risolto entrambe le questioni ad agosto, ma continuiamo a rafforzare le nostre sandbox, con aggiornamenti recenti che stringono i controlli su dove gli agenti possono scrivere file e ampliano i test di tali protezioni su più piattaforme."
Aggiornamento, 21 settembre, 05:29 AM ET: Aggiunta la dichiarazione di OpenAI ricevuta dopo la pubblicazione.
Costruisci il tuo piano di sicurezza per gli attacchi potenziati dall'intelligenza artificiale
Partecipa a Mikko Hyppönen e a leader della sicurezza di NFL, CHANEL e Atlassian in un vertice digitale di due ore su come gli attacchi ad alta velocità potenziati dall'intelligenza artificiale cambiano le dinamiche, quali pratiche dovrebbero essere interrotte, e come validare, decidere, correggere e ri-validare a velocità macchina.