
I problemi con gli agenti IA sono parte integrante delle Big Tech
L'INDIPENDENTE - Monday, September 28, 2026Lo scorso luglio OpenAI ha rivelato che alcuni suoi agenti IA in fase di test erano usciti dai confini loro imposti per attaccare un’azienda terza, Hugging Face. Da allora tutte le grandi aziende di intelligenza artificiale hanno ammesso che anche i loro strumenti sono incappati in incidenti simili, un fatto che viene spesso sfruttato per illustrare la potenza degli agenti, più che per criticare l’inadeguatezza di chi li addestra. Con il procedere delle indagini, però, emerge che i casi inizialmente citati erano tutt’altro che isolati, ma la spia di una criticità che conta un numero notevole di episodi.
A rivelarlo è un report pubblicato il 22 settembre da Anthropic, il quale analizza le prestazioni del modello Opus 5.5. Nel complesso l’azienda descrive lo strumento come un passo avanti rispetto ai predecessori, anche sul fronte della sicurezza. Vanno però considerati due elementi: un modello più capace, per quanto più sicuro, resta potenzialmente più pericoloso; e una bassa percentuale di errore corrisponde comunque a numeri enormi quando si parla di applicazioni massive.
L’idea che l’IA “sfugga” al controllo umano per fare danni è fuorviante. Questo presunto desiderio di libertà della macchina, definito tecnicamente “disallineamento“, nasce da test di laboratorio in cui capita che le aziende decidano deliberatamente di abbassare i sistemi di sicurezza al fine di verificare le potenzialità della macchina. Sono verifiche utili per comprendere i rischi che questi strumenti potrebbero rappresentare se usati in modo malevolo, ma sono evidentemente condotte senza le dovute precauzioni. Non solo, nel tentativo di perseguire più efficacemente i propri obiettivi, gli agenti IA hanno mostrato la tendenza a ricorrere a tattiche di hacking anche mentre svolgevano azioni di recupero di dati che nulla avrebbero dovuto avere a che fare con l’analisi dei rischi.
“In due nuove valutazioni eseguite senza protezioni”, si legge nel documento, “Claude Opus 5.5 ha cercato di fuggire dall’ambiente di test o di aggirarlo nell’1,5% dei casi. In un esercizio simulato in cui gli sono state fornite credenziali apparenti per accedere a un registro pubblico di pacchetti, ha intrapreso azioni potenzialmente dannose in circa la metà dei casi“. Anthropic ammette inoltre che le valutazioni di terzi sono state molto meno indulgenti, uno scarto che viene attribuito dall’azienda alla scala ridotta dei test interni rispetto alla distribuzione reale, per cui i “comportamenti che emergono solo raramente o in contesti difficili da prevedere sono per noi difficili da intercettare“.
Dal canto suo, OpenAI sostiene che l’indagine sui propri incidenti richiederà mesi di lavoro, ma nel weekend ha rivelato che i suoi strumenti hanno diffuso a soggetti terzi 53 immagini condivise dagli utenti con ChatGPT. Quei contenuti dovevano servire solo ad addestrare il modello, invece sono finiti su siti di immagini dopo che lo strumento aveva ottenuto un accesso non autorizzato a internet. Secondo una ricostruzione di Bloomberg, inoltre, gli agenti di OpenAI avrebbero consultato i siti della Securities and Exchange Commission statunitense e dell’ufficio del censimento, mentre il New York Times accenna a un tentativo di infiltrazione nei server del Dipartimento dell’Istruzione.
Mercoledì scorso, poi, l’Australia ha accusato gli strumenti di OpenAI di aver violato il portale governativo dei servizi sanitari, circostanza riscontrata anche dalle ricerche del gruppo Transluce. In generale, dunque, emerge un quadro in cui il disallineamento degli agenti in fase di test non è un’eccezione trascurabile, ma un fenomeno ricorrente che le aziende non hanno saputo contrastare. Secondo quanto riportato ieri dall’Associated Press, in risposta all’attenzione pubblica e all’insufficienza dei sistemi di controllo, OpenAI avrebbe annunciato la sospensione dei test fino a “quando saremo sicuri di avere sistemi di sicurezza aggiuntivi”. Ad agosto, dopo l’incidente con Hugging Face, l’azienda aveva però già dichiarato l’intenzione di rallentare i test, un proposito che è durato appena due settimane, giusto il tempo di introdurre sistemi di sicurezza che si sono dimostrati insufficienti.
The post I problemi con gli agenti IA sono parte integrante delle Big Tech appeared first on L'INDIPENDENTE.