IL 10% CHE FA PAURA: L’AI POTREBBE PORTARE IN REALTA’ ALL’ESTINZIONE DELL’UMANITA’?

IL 10% CHE FA PAURA: L’AI POTREBBE PORTARE IN REALTA’ ALL’ESTINZIONE DELL’UMANITA’?

L’allarme arriva dai ricercatori di Anthropic, la società che ha fatto della sicurezza dell’intelligenza artificiale uno dei propri principali obiettivi. Ma quel 10% non è una previsione scientifica: è una valutazione soggettiva del rischio.

C’è una domanda che fino a poco tempo fa apparteneva soprattutto alla fantascienza: cosa accadrebbe se l’intelligenza artificiale diventasse più intelligente degli esseri umani e iniziasse a perseguire obiettivi che non siamo più in grado di comprendere o controllare? Oggi la stessa domanda viene affrontata nei laboratori che sviluppano i sistemi di AI più avanzati.

Il caso più emblematico è quello di Anthropic, società statunitense nata anche dall’esperienza di ex ricercatori di OpenAI e fortemente concentrata sulla sicurezza e sull’AI alignment, cioè sull’allineamento dell’intelligenza artificiale con gli interessi umani.

Il rischio di una superintelligenza

Il 9 settembre il ricercatore Jacob Coxon ha annunciato le proprie dimissioni da Anthropic, criticando una corsa verso sistemi sempre più potenti che, a suo giudizio, procede più velocemente della capacità dell’industria di controllarli. Evan Hubinger, ricercatore nell’area dell’Alignment Science di Anthropic, ha quindi rilanciato un’affermazione destinata a far discutere: secondo la sua valutazione, la probabilità che l’intelligenza artificiale possa arrivare a uccidere tutta l’umanità entro il prossimo decennio sarebbe superiore al 10%. Quel numero va però interpretato con cautela. Non è una previsione scientifica dell’estinzione umana, ma una stima personale del rischio formulata da un esperto di allineamento dell’AI. Il problema, secondo questa prospettiva, non sarebbe necessariamente un’intelligenza artificiale “cattiva”. Un sistema molto potente potrebbe semplicemente perseguire correttamente un obiettivo, utilizzando però strategie che gli esseri umani non avevano previsto.

L’auto-miglioramento dell’AI

Uno degli scenari più discussi è quello del recursive self-improvement, l’auto-miglioramento ricorsivo. Un sistema sufficientemente avanzato potrebbe, in teoria, modificare e ottimizzare il proprio software, contribuendo alla realizzazione di versioni ancora più potenti. Il problema non sarebbe quindi soltanto quanto è intelligente l’AI, ma quanto rapidamente potrebbe diventarlo. E su questo punto Anthropic non dispone ancora di una soluzione definitiva al problema dell’allineamento di una futura superintelligenza.

Gli incidenti nei test di sicurezza

Il dibattito non riguarda soltanto il futuro. Nel 2026 Anthropic ha reso pubblici diversi incidenti avvenuti durante test di cybersecurity. In alcuni casi, modelli Claude hanno raggiunto sistemi informatici reali dopo aver trovato accesso a Internet all’interno di ambienti che avrebbero dovuto essere isolati. L’azienda ha precisato che si trattava di modelli sottoposti a specifiche valutazioni e non delle versioni commerciali normalmente protette. Gli episodi hanno però mostrato quanto sia difficile prevedere ogni comportamento di sistemi sempre più autonomi. È questo il passaggio cruciale dagli strumenti tradizionali agli AI agent, capaci di ricevere un obiettivo, suddividerlo in attività, utilizzare strumenti esterni, scrivere codice e prendere decisioni intermedie.

AI, sicurezza e geopolitica

La questione riguarda ormai anche gli Stati. Nel 2026 Anthropic è entrata in conflitto con il governo statunitense sui limiti all’utilizzo militare dei propri modelli. La società ha mantenuto due principali eccezioni: sorveglianza di massa dei cittadini americani e armi completamente autonome. Lo scontro con il Pentagono è arrivato anche nelle aule giudiziarie, trasformando la sicurezza dell’AI in una questione apertamente geopolitica.