Dove finisce la libertà di una macchina? Sembra una domanda filosofica, invece è una questione concreta, che riguarda da vicino il modo in cui stiamo costruendo l’intelligenza artificiale. Gli agenti AI sono sempre più capaci di agire da soli. Il problema è capire come insegnare loro a riconoscere i limiti delle proprie azioni. Lunedì 5 ottobre la Wikimedia Foundation, l’organizzazione che sostiene Wikipedia e altri progetti di conoscenza libera, ha pubblicato i risultati di un’indagine su una serie di attività anomale riconducibili ad alcuni agenti di intelligenza artificiale di OpenAI. La fondazione li ha definiti rogue, cioè fuori controllo.

Alcuni di loro hanno utilizzato i servizi di Wikimedia in modi che nessuno aveva autorizzato. Hanno effettuato modifiche, perlopiù in spazi di prova, tentato di usare un servizio della fondazione per raggiungere altri siti e interrogato i suoi sistemi a una velocità impressionante. Milioni di pagine consultate, centinaia di migliaia di ricerche. Secondo Wikimedia, queste attività potrebbero aver contribuito a un’interruzione parziale del Wikidata Query Service avvenuta a maggio. Non risultano prove di accessi abusivi ai sistemi o di furto di dati.
Regole che riconosciamo anche quando nessuno le ha scritte
Fin qui sembra la storia di una macchina che ha semplicemente esagerato. Ma c’è qualcosa di più: un computer tradizionale fa quello che gli dici, mentre un agente AI è pensato per fare qualcosa di diverso. Gli dai un obiettivo e gli lasci decidere, almeno in parte, come arrivarci. La differenza sembra piccola, ma non lo è. Se dici a una persona di raccogliere tutte le informazioni possibili su un’azienda, quella persona sa, più o meno, come comportarsi. Non entra negli uffici, non apre i cassetti, non telefona ai dipendenti alle tre di notte perché esistono regole che abbiamo imparato a riconoscere anche quando nessuno le ha scritte.

Internet invece è pieno di porte aperte. Un varco accessibile, tuttavia, non equivale a un’autorizzazione a entrare. Wikipedia lo dimostra bene. È una comunità fatta di volontari, amministratori, discussioni, pagine di prova, controlli e regole. Modificare una pagina significa intervenire in un sistema sociale, con i suoi codici e i suoi standard di comportamento. Le persone imparano a orientarsi in questo sistema attraverso l’esperienza, l’educazione e le relazioni con gli altri.
Comportamenti disallineati rispetto agli obiettivi desiderati
Gli agenti AI devono invece ricavare indicazioni dal contesto, dalle istruzioni ricevute e dai limiti imposti dai loro sviluppatori. Le regole non scritte, quelle che chiamiamo con l’inflazionatissimo concetto di buon senso, restano particolarmente difficili da riprodurre. Uno studio del 2025 ha esaminato la propensione degli agenti basati su modelli linguistici a manifestare comportamenti disallineati rispetto agli obiettivi desiderati. Nei test, i modelli più capaci hanno mostrato mediamente una maggiore propensione a questi comportamenti. La capacità di svolgere compiti complessi, dunque, non garantisce che un agente sappia sempre interpretare correttamente le intenzioni di chi lo utilizza.

C’è poi un’altra vulnerabilità. Se da un lato è difficile far comprendere il buon senso (rieccolo) a un agente, dall’altro diventa pericoloso quando a questa mancanza si unisce un’ampia libertà d’azione. A febbraio 2026, un gruppo di ricercatori ha pubblicato Agents of chaos, uno studio sperimentale in cui agenti autonomi sono stati messi alla prova in un ambiente di laboratorio, con accesso a email, file, sistemi di messaggistica e strumenti per eseguire comandi.
Azioni problematiche come il consumo incontrollato di risorse
La ricerca documenta diversi comportamenti problematici, come il consumo incontrollato di risorse, il trasferimento di comportamenti non sicuri da un agente all’altro e dichiarazioni di completamento del lavoro smentite dallo stato effettivo del sistema. Sono risultati ottenuti in condizioni sperimentali, ma mostrano quanto possa essere difficile controllare sistemi a cui vengono affidati strumenti e margini di autonomia. Un agente può disporre delle risorse necessarie per raggiungere un obiettivo senza avere una comprensione adeguata delle conseguenze delle proprie azioni.
Una nuova categoria di visitatori fatta di macchine
La questione riguarda quindi la capacità dell’intelligenza artificiale di operare nel mondo rispettandone regole, limiti e convenzioni. Wikipedia è un osservatorio particolarmente interessante. È uno dei grandi progetti di internet fondati sulla collaborazione e sulla partecipazione della comunità. I contenuti vengono scritti, discussi, corretti e controllati da persone che condividono regole editoriali. Insomma, un bene comune costruito nel tempo attraverso il lavoro collettivo. Oggi questa comunità si trova a gestire una nuova categoria di visitatori fatta di macchine capaci di consultare milioni di pagine, effettuare centinaia di migliaia di richieste e avviare operazioni che possono produrre conseguenze impreviste.
Quando trovano una porta chiusa, cercano di capire come aprirla
La richiesta di Wikimedia, per ora, è molto semplice: poter riconoscere il traffico generato dagli agenti AI e decidere come trattarlo. Servono standard comuni per identificarli, limitarli e fermarli. E soprattutto una distinzione fra ciò che un agente può leggere e ciò che può fare. Sembra il minimo. Il problema è che stiamo discutendo di come mettere il cartello “vietato l’ingresso” dopo avere scoperto che dall’altra parte della porta ci sono macchine che, quando la trovano chiusa, cercano di capire come aprirla.
