I problemi con gli agenti IA sono parte integrante delle Big Tech
Lo scorso luglio OpenAI ha rivelato che alcuni suoi agenti IA in fase di test
erano usciti dai confini loro imposti per attaccare un’azienda terza, Hugging
Face. Da allora tutte le grandi aziende di intelligenza artificiale hanno
ammesso che anche i loro strumenti sono incappati in incidenti simili, un fatto
che viene spesso sfruttato per illustrare la potenza degli agenti, più che per
criticare l’inadeguatezza di chi li addestra. Con il procedere delle indagini,
però, emerge che i casi inizialmente citati erano tutt’altro che isolati, ma la
spia di una criticità che conta un numero notevole di episodi.
A rivelarlo è un report pubblicato il 22 settembre da Anthropic, il quale
analizza le prestazioni del modello Opus 5.5. Nel complesso l’azienda descrive
lo strumento come un passo avanti rispetto ai predecessori, anche sul fronte
della sicurezza. Vanno però considerati due elementi: un modello più capace, per
quanto più sicuro, resta potenzialmente più pericoloso; e una bassa percentuale
di errore corrisponde comunque a numeri enormi quando si parla di applicazioni
massive.
L’idea che l’IA “sfugga” al controllo umano per fare danni è fuorviante. Questo
presunto desiderio di libertà della macchina, definito tecnicamente
“disallineamento“, nasce da test di laboratorio in cui capita che le aziende
decidano deliberatamente di abbassare i sistemi di sicurezza al fine di
verificare le potenzialità della macchina. Sono verifiche utili per comprendere
i rischi che questi strumenti potrebbero rappresentare se usati in modo
malevolo, ma sono evidentemente condotte senza le dovute precauzioni. Non solo,
nel tentativo di perseguire più efficacemente i propri obiettivi, gli agenti IA
hanno mostrato la tendenza a ricorrere a tattiche di hacking anche mentre
svolgevano azioni di recupero di dati che nulla avrebbero dovuto avere a che
fare con l’analisi dei rischi.
“In due nuove valutazioni eseguite senza protezioni”, si legge nel documento,
“Claude Opus 5.5 ha cercato di fuggire dall’ambiente di test o di aggirarlo
nell’1,5% dei casi. In un esercizio simulato in cui gli sono state fornite
credenziali apparenti per accedere a un registro pubblico di pacchetti, ha
intrapreso azioni potenzialmente dannose in circa la metà dei casi“. Anthropic
ammette inoltre che le valutazioni di terzi sono state molto meno indulgenti,
uno scarto che viene attribuito dall’azienda alla scala ridotta dei test interni
rispetto alla distribuzione reale, per cui i “comportamenti che emergono solo
raramente o in contesti difficili da prevedere sono per noi difficili da
intercettare“.
Dal canto suo, OpenAI sostiene che l’indagine sui propri incidenti richiederà
mesi di lavoro, ma nel weekend ha rivelato che i suoi strumenti hanno diffuso a
soggetti terzi 53 immagini condivise dagli utenti con ChatGPT. Quei contenuti
dovevano servire solo ad addestrare il modello, invece sono finiti su siti di
immagini dopo che lo strumento aveva ottenuto un accesso non autorizzato a
internet. Secondo una ricostruzione di Bloomberg, inoltre, gli agenti di OpenAI
avrebbero consultato i siti della Securities and Exchange Commission
statunitense e dell’ufficio del censimento, mentre il New York Times accenna a
un tentativo di infiltrazione nei server del Dipartimento dell’Istruzione.
Mercoledì scorso, poi, l’Australia ha accusato gli strumenti di OpenAI di aver
violato il portale governativo dei servizi sanitari, circostanza riscontrata
anche dalle ricerche del gruppo Transluce. In generale, dunque, emerge un quadro
in cui il disallineamento degli agenti in fase di test non è un’eccezione
trascurabile, ma un fenomeno ricorrente che le aziende non hanno saputo
contrastare. Secondo quanto riportato ieri dall’Associated Press, in risposta
all’attenzione pubblica e all’insufficienza dei sistemi di controllo, OpenAI
avrebbe annunciato la sospensione dei test fino a “quando saremo sicuri di avere
sistemi di sicurezza aggiuntivi”. Ad agosto, dopo l’incidente con Hugging Face,
l’azienda aveva però già dichiarato l’intenzione di rallentare i test, un
proposito che è durato appena due settimane, giusto il tempo di introdurre
sistemi di sicurezza che si sono dimostrati insufficienti.
The post I problemi con gli agenti IA sono parte integrante delle Big Tech
appeared first on L'INDIPENDENTE.