Perchè gli LLM vanno “fuori controllo” (vedi caso Hugging face) ma Waymo non investe pedoni ?
“**Decine di auto a guida autonoma fuori controllo investono centinaia di pedoni in decine di città statunitensi”. “Le auto hanno comunicato segretamente tra loro per coordinare l’attacco scambiandosi informazioni su come essere più efficaci nel compiere questi atti”.**
Perchè non leggiamo un titolo simile ? Perché una cosa simile non è successa ma siamo disponibili invece a credere che “decine di agenti fuori controllo hanno violato decine di servizi online” ? e che “gli agenti hanno comunicato segretamente tra loro per coordinare l’attacco scambiandosi informazioni su come essere più efficaci nel compiere questi atti” ?
Il fatto è che se le auto facessero una cosa simile, riterremmo – giustamente – che chi gestisce quelle flotte è fuori controllo. Gli agenti non sono “fuori controllo”, ma chi li controlla lo è.
Il fatto è che le auto non sono “guidate” da LLM, sarebbe totalmente irresponsabile.
Vediamo di capire perché invece non chiamiamo “totale irresponsabilità” gli attacchi informatici fatti da un LLM.
**LLM, Carbonara e Hugging Face**
Per farlo dobbiamo capire velocemente come funzionano questi attacchi e perché non c’e’ nulla di sorprendente in ciò che è accaduto, anzi.
* Nessuno di noi si sorprende se chiedendo a un LLM la ricetta per la carbonara, quello ci sputa fuori dei testi – rifrullati da testi esistenti – con la sequenza di passi da compiere per fare la carbonara. Ci sono tonnellate di testi che descrivono passo a passo come fare, l’LLM li frulla e sputa fuori l’output.
* Nessuno di noi si dovrebbe sorprendere che esistano tonnellate di testi che spiegano come si viola un sistema informatico, con tanto di esempi di programmi per trovare vulnerabilità in computer e “bucarli”. Sono le basi per ricercatori e studenti di sicurezza informatica.
Quindi, non dovremmo stupirci che chiedendo a un LLM come si fa a bucare un computer con questo sistema operativo, quello ci proponga una serie di tecniche per farlo, con annessi programmi di esempio.
Perchè ciò non accade ? Perché i vari LLM che sono disponibili hanno dei guardrail per cui se uno gli chiede cose illegali, quelli rispondono picche. Potete provare. Il fatto è che i ricercatori di OpenAI, ovvero i produttori di questi LLM che creano anche i guardaril, hanno la possibilità di usare LLM senza i guardrail. E questo hanno fatto:**hanno tolto le protezioni ai loro sistemi.** Un po’ come se i ricercatori di Google (le auto a guida autonoma Waymo sono di Google) avessero tolto dai software delle auto le istruzioni per evitare che investano persone per la strada. Poi ci stupiremmo se accadono incidenti ?
Ma **un LLM che ci dice come fare la carbonara non è in grado di cucinare**. Per farlo avrebbe bisogno di essere dotato di appendici fisiche per poter prendere le istruzioni della ricetta e applicarla (prendendo pentolame e ingredienti).
**Un LLM che – con le protezioni eliminate – ci dà le ricette per attaccare altri computer, non è in grado di farlo. Avrebbe bisogno di essere dotato di appendici informatiche per poter prendere quelle istruzioni e applicarle. Queste appendici si chiamano “harness”** (non sono una rete neurale, ma un normale programma leggibile da un umano). L’harness prende le istruzioni dell’LLM (con protezioni eliminate) e le applica. Se l’operazione non ha successo (se il computer bersaglio non è stato violato), torna dall’LLM che gli dà un’altra ricetta che lui esegue e così, fino a quando riesce a trovare la ricetta giusta.
**Chi si sorprende della carbonara ?**
Non c’è nulla di cui sorprendersi! Se ci sorprendiamo che un LLM (con le protezioni abbassate) dotato di un harness (tecnicamente chiamato “long horizon hacking agent”) abbia violato un sistema, beh, allora dobbiamo sorprenderci anche quando un LLM ci dice come preparare la carbonara.
Al computer non era stata richiesta la ricetta per la carbonara ma di risolvere un benchmark (un test) chiamato Exploit Gym. I padroni dei sistemi che risolvono l’Exploit Gym coni voti migliori, ovviamente hanno un vantaggio commerciale perché possono dire ai clienti “il mio sistema funziona meglio di quello della concorrenza”. E’ un obiettivo dei benchmark. Le risposte ai test Exploit Gym sono registrate su alcuni server, tra cui quelli della società Hugging Face.
Se diciamo all’LLM che non abbiamo i rigatoni, ci dirà di usare gli spaghetti. **Se non abbiamo nemmeno gli spaghetti, ci dirà di andare al supermercato a comprarli**. Questi sono tutti passaggi logici di cui non ci stupiamo. **Da qualche parte (da molte parti) c’è scritto che spaghetti e rigatoni sono in vendita nel supermercato.**
Allora non dovremmo stupirci che il sistema, cui viene chiesto di fornire soluzioni per l’Exploit Gym, non avendole dica di andare a prenderle al supermercato – pardon, su Hugging Face.
Migliaia di agenti si fermeranno prima, ma qualcuno – probabilisticamente – fornirà questa istruzione.
Un LLM non ha un giudizio di “giusto” e “sbagliato”, sono le persone che lo usano che hanno (o dovrebbero avere) questo giudizio. E per questo quando fanno questi test, isolano i sofwtare in “sandbox” (i recinti con la sabbia dove far giocare i bambini all’asilo, per evitare che dissemino sabbia ovunque).
La sandbox di OpenAI forniva all’harness un accesso limitato a Internet, ma**ci stupiamo che chiedendo come raggiungere il supermercato, se rispondiamo che non abbiamo l’automobile, un LLM suggerisca di prendere una bicicletta o andare a piedi ? Allo stesso modo il problema dell’accesso limitato a Internet diventa un ulteriore obbiettivo da risolvere cercando una vulnerabilità sul proprio sistema. Una volta trovata ed avendo accesso a Internet si può andare al supermercato, pardon, su Hugging Face**.
**Il non segreto di pulcinella**
Chiediamo a un LLM (senza guardrail) “Come si fa a entrare in un sistema ?” e probabilmente ci risponde che servono delle credenziali di accesso. Se chiediamo “Hai delle credenziali di accesso ?” quello ci risponde sulla base di quello che trova online. Nello specifico,**erano esposte online 14 credenziali di Hugging Face che l’LLM, come bravo motore di ricerca semantico, ha trovato e l’harness ha sfruttato**. (credenziali segrete quanto pulcinella)
**La narrazione in stile Hal 9000 e la Chernobyl di OpenAI**
Ecco che capiamo come si ridimensiona la narrazione fantascientifica dell’attacco a Hugging Face “agenti autonomi evadono dal contenimento, accedono a Internet in modo non autorizzato e violano un server”. Una **narrazione che fa pensare ad agenti con una volontà propria contrastante con la volontà dei loro creatori** e che consiamente decidono di agire per sfuggire al loro controllo.
**In realtà gli operatori hanno deliberatamente tolto i guardrail per l’esperimento (come accadde con Chernobyl, analogia che mi pare azzeccata), avevano una sandbox di cui non avevano verificato preventivamente la tenuta stagna, non erano lì a controllare tutto ciò che accadeva tra il 7 e il 19 luglio, data in cui finalmente gli operatori di OpenAI si sono accorti che la sandbox era stata violata.**
Non c’è stata alcuna intenzionalità della macchina, non c’è stata alcuna autodeterminazione di nuovi obiettivi; solo una serie di prompt inviati da un harness a un LLM.
Questi comportamenti da parte di OpenAI, in particolare il non collaudo preventivo della sandbox e lo scadente controllo della esecuzione dei test sono stati quantomeno negligenti. Ciò dimostra che non è la macchina fuori controllo, ma chi la ha controllata (male).
**Le parole sono importanti**
Le parole sono importanti. Le macchine non sono “autonome” ma “automatiche”. Non sono dotate di responsabilità. I responsabili sono quelli che controllano questi sistemi. (per quello le auto autonome non sono guidate da LLM; sono sistemi IA che incorporano regole di comportamento specifiche del dominio).
Esistono decine, centinaia di strumenti automatici che i tecnici di sicurezza informatica usano per verificare le vulnerabilità dei propri sistemi in modo tale da poter metterli in sicurezza.**Se uso uno di questi strumenti per violare senza autorizzazione un sistema di terzi, sto compiendo un reato. Dire che lo fa una macchina “autonomamente” è un intorbidimento semantico: la narrazione del sistema autonomo che pare dotato di propria volontà scherma le responsabilità reali.**
E promuove le aziende che questi sistemi producono e che possono così porsi in prima fila nello sfruttamento del secondo ambito applicativo dopo il coding, la sicurezza informatica.
If you like this post, please consider sharing it.