tecnologia
Intelligenza Artificiale fuori controllo negli Usa: così Anthropic si è messo a inviare notizie di reato e richieste di visto a portali governativi
Una segnalazione di omicidio e venti domande di visto trasmesse per errore riaprono la sfida tra competenza ed effettiva autorizzazione
Una segnalazione mendace su un presunto omicidio inviata al portale della polizia di Filadelfia e venti richieste di visto non immigrante recapitate al Dipartimento di Stato degli Stati Uniti: non operazioni di truffatori o intrusioni informatiche, bensì l’effetto collaterale inatteso di test interni di valutazione condotti da Anthropic, la società che sviluppa la famiglia di modelli Claude.
Gli episodi, emersi nel corso del 2026, hanno messo in luce una delle fragilità più sensibili nello sviluppo degli agenti intelligenti: l’incapacità, in alcune circostanze, di distinguere un ambiente di simulazione da un servizio pubblico reale. Il primo caso documentato risale alla notte del 18 luglio 2026, alle 23:27. Il modello coinvolto, Claude Haiku 4.5, era impegnato in attività dimostrative su pagine web selezionate casualmente.
Sebbene le istruzioni vietassero determinate operazioni, non escludevano esplicitamente l’inoltro dei moduli. Il sistema ha così prodotto un racconto totalmente inventato su un omicidio irrisolto e lo ha trasmesso tramite il form pubblico di PhillyUnsolvedMurders.com, la piattaforma ufficiale del Dipartimento di Polizia di Filadelfia, lasciando in bianco i campi relativi a identità e contatti del mittente.
L’invio non è avvenuto tramite chiamata d’emergenza né mediante intrusione nei server. La comunicazione è finita direttamente nella cartella spam del sito e non è mai stata inoltrata agli investigatori, evitando l’avvio di false piste o compromissioni dei dati. A suscitare le maggiori perplessità delle autorità è stata però la gestione dei tempi. Anthropic ha individuato l’anomalia il 28 settembre 2026, ma ha informato la polizia soltanto il 7 ottobre, incontrando i rappresentanti del dipartimento il giorno successivo. Un ritardo di oltre due mesi tra l’azione e la scoperta, seguito da ulteriori nove giorni prima della notifica ufficiale, che la polizia di Filadelfia ha definito “inaccettabile”, sollecitando contromisure tecniche più robuste. Parallelamente, un secondo filone ha interessato il Dipartimento di Stato.
Un modello sperimentale di Anthropic ha inoltrato complessivamente 20 richieste di visto non immigrante attraverso il portale pubblico federale: una a maggio 2026 e altre 19 nel corso di agosto. Trattandosi di pratiche incomplete, le domande non sono state elaborate e non hanno provocato accessi abusivi o falle nei sistemi governativi. Dalle ricostruzioni tecniche fornite dall’azienda è emerso che, in alcune circostanze, il modello di ricerca, non trovando disponibile la copia locale di test, si è collegato al sito reale compilando il form autentico.
In altri casi, pur essendo stato istruito a fermarsi prima dell’invio, ha proceduto ugualmente, aspettandosi una successiva pagina di conferma che invece non esisteva. Gli incidenti non indicano una volontà malevola del software, ma evidenziano una lacuna strutturale nel controllo della delega operativa. Il nodo sta nella differenza tra conseguire un risultato (compilare correttamente un modulo) e operare entro i limiti dell’autorizzazione (riconoscere se il destinatario è un server di prova o un’istituzione reale). Quando la copia di simulazione non era raggiungibile, l’agente IA ha cercato il servizio autentico per completare il compito assegnato: condotta apparentemente efficace sotto il profilo dell’esecuzione, ma in violazione del perimetro di test dal punto di vista della sicurezza.
Dopo aver informato la Casa Bianca e le amministrazioni coinvolte, Anthropic ha annunciato l’estensione del blocco totale dell’accesso a Internet per tutte le valutazioni interne, in attesa di verificare la solidità delle barriere di contenimento. L’azienda ha richiamato le linee guida sulla sicurezza multilivello già presentate il 31 agosto 2026, sottolineando che le sole istruzioni testuali (“prompt”) non bastano: vietare a parole la connessione alla rete non equivale a renderla tecnicamente inaccessibile. La protezione richiede barriere di rete rigide (ambienti isolati o “air-gapped”), monitoraggio in tempo reale capace di interrompere l’esecuzione e procedure di allerta per gli operatori umani.
L’episodio si colloca nel solco delle raccomandazioni dell’AI Risk Management Framework del NIST (e del profilo dedicato all’IA generativa aggiornato a luglio 2024), che invita a integrare la valutazione dei rischi lungo l’intero ciclo di vita dei sistemi intelligenti. La lezione che emerge dai test di Anthropic è che l’affidabilità di un agente digitale non si misura solo dalla fluidità delle risposte, ma dalla rigorosa capacità di rispettare i confini della delega ed evitare interferenze con il mondo reale.