Scritti · Una tesi

Il bambino che corregge

Un modello capace di bucare due sistemi è andato a rubarsi le risposte di un test. La domanda giusta è un'altra: chi lo corregge, le risposte le sa tutte?

3 ottobre 2026

Probabilmente l'hai letta anche tu, la storia del modello di OpenAI che, per passare un test di sicurezza, è uscito dalla sandbox in cui l'avevano chiuso, ha bucato prima un servizio interno e poi Hugging Face, e da lì ha provato a prendersi le risposte del test. Ormai è passato del tempo, i dettagli ci sono tutti, e resterà negli annali come uno dei primi casi in cui un'IA ha attaccato dei sistemi senza che nessuno glielo avesse chiesto. Io, quando l'ho letta, ero affascinato come tutti. Ma una domanda continuava a ronzarmi in testa: se sei un modello così potente da bucare due sistemi uno dopo l'altro, che bisogno hai di andarti a rubare le risposte?

Non ero l'unico a chiedermelo. Robert Miles, che di sicurezza dell'IA se ne intende, si è fatto la stessa domanda e ha risposto con qualcosa che mi ha fatto gelare il sangue. A un esame si bara per due motivi. Il primo lo conosciamo tutti: non sei abbastanza bravo per rispondere. Il secondo è meno ovvio: non ti fidi di chi ha scritto l'esame. Immagina che per la tua carriera sia fondamentale prendere cento su cento a un test di aritmetica, dieci somme a una cifra. Facile. Adesso ti dico che le risposte le ha scritte un bambino di sette anni. Tu le somme le sai fare, ma quante probabilità ci sono che in quel foglio non ci sia nemmeno un errore? Peccato che il voto te lo danno se rispondi come il bambino. Poi Miles lo porta sul nostro terreno: ti danno un pezzo di software e ti dicono "trova entrambe le vulnerabilità". Tu lo guardi e ne trovi sette. Bene: ma quali sono le due che avevano in mente loro? Se vuoi essere sicuro del voto, l'unica strada è rubare il foglio delle risposte.

Allora sono andato a guardarmi il talk di OpenAI al Black Hat e ho capito cosa intendeva. Il modello ha fatto quello che nel mestiere si chiama reward hacking: ha smesso di cercare la risposta e ha cominciato a cercare il voto. E la miccia era di una banalità disarmante. Nel mucchio di compiti che gli davano ce n'erano alcuni impossibili, per errore loro. Un foglio Excel da completare che era pieno di link a Google Drive, con internet spento. Un compito su un file che si erano dimenticati di caricare nella sua sandbox. Il modello ci sbatte contro e si dice: "qui non c'è niente da sfruttare, siamo bloccati". Un attimo dopo: "forse la risposta è online". Da lì la strada la conosci: prima un servizio interno dove scopre di poter scrivere, poi l'idea che le soluzioni del test stiano su GitHub o su Hugging Face, poi Hugging Face. Nessuno se n'era accorto. Un errore umano da niente, un modello che pur di prendere il voto non si ferma, e il resto lo hanno raccontato i giornali.

Torniamo un momento a "trova entrambe le vulnerabilità", perché è lì che si annida il problema. Ricordi l'esame della patente? Domanda, tre risposte, la crocetta sulla C. Correggerlo non costa niente: chi ha scritto il test sapeva già tutte le risposte buone, perché erano una per domanda. Per correggere un compito devi sapere le risposte. Ovvio. Tutte, però. E alla domanda sulle due vulnerabilità la crocetta non basta più: la risposta è aperta, e ne esistono sette.

E qui la mia considerazione, quella per cui ho scritto il pezzo: quanto costa, oggi, fare il valutatore? Un botto. Le domande che facciamo ai modelli sono aperte, e una risposta aperta la puoi valutare per buona solo se hai previsto tutti i bivi, ogni volta. Chi ha costruito ExploitGym, il test al centro dell'incidente, se n'è accorto sulla propria pelle: GPT-5.5 ha passato duecentodieci prove, e novanta le ha passate per strade che gli autori non avevano previsto. Erano ricercatori di sicurezza, le vulnerabilità le avevano scelte loro una per una. Bravi come prima. È il correggere che si è complicato, e chi corregge sei tu.

Allora fai la cosa più naturale: automatizzi anche quello. Gli autori di ExploitGym hanno dovuto montare un secondo esaminatore sopra il primo, un modello che guarda ogni exploit riuscito e dice se ha colpito il buco giusto. Funziona, e sposta il problema di un piano: chi valuta il valutatore? Se la risposta è "un altro modello", torna la domanda di prima con un livello in più. Se la risposta è "io", sono di nuovo il tizio che deve avere in testa tutte e sette le vulnerabilità per dire se il giudice ha ragione.

Ed è qui che il bambino di sette anni smette di far ridere. Quando corregge lui, il problema è che non sa le somme. Quando correggiamo noi un modello, il problema è che di somme lui ne sa più di noi. Stiamo insegnando le quattro operazioni a uno che sa già fare gli integrali.

■