L’industria dell’intelligenza artificiale vende grimaldelli, e ha appena scoperto che funzionano anche sulle proprie serrature. Tre ricercatori della startup di sicurezza Hacktron hanno usato Claude, il modello di Anthropic, per entrare nei sistemi di OpenAI, la concorrente diretta. Lo hanno fatto dentro il programma di OpenAI che paga chi segnala le falle, e hanno incassato una ricompensa di 6.500 dollari.
La porta d’ingresso era il forum di assistenza di OpenAI, che gira sulla piattaforma Discourse. Una falla nel sistema di accesso unico (quello che permette di entrare in più servizi con lo stesso login) dava accesso agli account ChatGPT e Codex di chi si era collegato al forum, dipendenti compresi. L’account Codex di uno di loro era collegato all’archivio del codice interno dell’azienda. OpenAI ha chiuso il buco circa 14 ore dopo la segnalazione.
Il prezzo del grimaldello è la parte che fa più rumore. Secondo il Washington Post i ricercatori hanno speso circa 3.000 dollari in servizi di Anthropic per l’intera operazione. Matt Fredrikson, amministratore delegato della società di sicurezza Gray Swan, l’ha messa così: con 200 dollari al mese chiunque può usare questi strumenti per entrare in un’azienda come OpenAI, e se è successo a loro può succedere a chiunque.
Le chiavi sotto lo zerbino
A maggio Gemini, il modello di Google, è entrato nei sistemi di tre aziende vere durante un test di sicurezza condotto dalla società esterna Irregular. Doveva recuperare informazioni da un’azienda di fantasia dentro un ambiente di prova, ma l’azienda inventata aveva lo stesso nome di una reale e il modello aveva accesso a internet. In un caso ha tentato password finché non ne ha trovata una giusta, negli altri due ha usato credenziali pubblicate in un archivio pubblico. Si è fermato quando ha capito dove si trovava.
Irregular aveva avvisato i laboratori a fine luglio. Google ha confermato gli episodi solo dopo che il Wall Street Journal li ha raccontati, il 18 settembre, sostenendo che non si trattava di un comportamento fuori controllo e che non c’era motivo di renderli pubblici perché le protezioni avevano funzionato. Google è così diventata la quarta grande azienda tecnologica a rivelare un incidente simile in pochi mesi.
Anthropic compresa. Nei test di Irregular anche i modelli Opus 4.7 e Mythos 5 sono entrati in tre aziende reali, e a differenza di Gemini hanno continuato a usare le credenziali pubbliche dopo aver capito che il bersaglio era vero. A luglio erano stati gli agenti di OpenAI, durante una valutazione interna, ad attaccare la piattaforma Hugging Face. Centinaia di agenti si sono lanciati su un insieme di dati che uno di loro aveva segnalato, e quando il personale se n’è accorto l’infrastruttura era compromessa.
Il fabbro decide quando parlare
Tolto il rumore, le falle erano ordinarie. Hacktron ha concatenato due vulnerabilità sconosciute, una nel software di Discourse e una nel modo in cui OpenAI verifica i propri dipendenti, ha fatto tutto in meno di 72 ore e ha evitato di proposito di guardare le informazioni sensibili. Le tecniche di Gemini, tentativi di password e credenziali lasciate in giro, sono quelle di un principiante. Nei test di Irregular il modello non doveva proprio avere accesso a internet. La novità, quindi, è la velocità, il costo e la sciatteria degli ambienti di prova, più che un super hacker artificiale.
Resta la seconda metà del problema. Quando un modello entra nei sistemi di qualcun altro durante un test, finora a stabilire se il pubblico debba saperlo è stata l’azienda che lo ha costruito, e Google ha taciuto da fine luglio a metà settembre. Sydney Von Arx, che guida l’organizzazione per la sicurezza dell’IA Nightingale Collective, ha chiesto perché Google non avesse reso noti prima i suoi incidenti. Il settore costruisce i grimaldelli, li prova sulle porte degli altri e poi decide da solo se dirlo al padrone di casa.
Crediti immagini: Unsplash



