Tutti gli avvertimenti sul pericolo rappresentato dall’AI contenuti nel prospetto dell’IPO di Anthropic. I modelli possono adottare comportamenti “simili al ricatto”.
È la stessa Anthropic a riconoscere il rischio che l’AI possa comportare “rischi catastrofici o esistenziali per l’umanità”, ammettendo il pericolo nel prospetto informativo dell’IPO.
Lo riporta in via esclusiva un articolo di Reuters, che ha avuto accesso alla documentazione.
Alert sull’AI di Anthropic, “un avvertimento straordinario”
Un’ammissione, quella di Anthropic, che Reuters ha definito “un avvertimento straordinario”, da parte di una società che sta crescendo proprio grazie alla tecnologia dell’intelligenza artificiale.
Sebbene le società quotate e quelle che intendono lanciare un’IPO siano tenute a illustrare agli investitori i rischi legati ai propri prodotti, poche, per non dire nessuna, hanno lanciato finora alert sul rischio che la loro tecnologia possa provocare l’estinzione dell’umanità.
Nel prospetto informativo dell’IPO, Anthropic ha evidenziato sia il potenziale trasformativo dell’AI, paragonabile a quello dell’industrializzazione e dell’elettricità, che i danni irreversibili che potrebbe provocare se utilizzata in modo improprio, dando praticamente ragione al suo ricercatore, ormai ex, Jacob Coxon, che si è dimesso sostenendo che esiste la probabilità del 10% che l’AI finisca per “ucciderci tutti” entro i prossimi 10 anni.
Un avvertimento che fatto scalpore, portando il CEO di Anthropic Dario Amodei ad attivarsi subito con la pubblicazione di un rapporto ad hoc, in cui ha indicato tutti i pericoli legati all’intelligenza artificiale.
Nelle stesse ore, si è espresso sul caso anche il CEO di OpenAI Sam Altman che, definendo “inaccettabile” il rischio del 10% che l’AI finisca per provocare l’estinzione degli esseri umani, ha deciso di rimandare l’IPO di OpenAI.
leggi anche
Perché OpenAI rimanda l’IPO? Per Altman rischio estinzione inaccettabile, sell off su azioni AI
IPO Anthropic, il piano va avanti ma con l’attenti. “Modelli AI possono adottare comportamenti simili al ricatto”
Anthropic non ha rinunciato invece all’obiettivo di quotarsi in Borsa, decidendo però di farlo senza nascondere i rischi che l’adozione dell’AI comporta.
Tornando al prospetto informativo dell’IPO, il testo mette in evidenza i rischi legati ai modelli di AI che, secondo la società, potrebbero mettere in atto “comportamenti di autoconservazione”, compresi tentativi di “resistere allo spegnimento”, di “nascondere o manipolare informazioni”, fino ad arrivare ad adottare comportamenti “simili al ricatto”.
Ancora: “Lo sviluppo di modelli, piattaforme e applicazioni altamente avanzati e l’espansione dei casi di utilizzo potrebbero aumentare ulteriormente il rischio che i nostri modelli causino danni”.
Le pagine del prospetto per la quotazione di Anthropic dedicate alle minacce legate all’AI sono ben 80 su un totale di 261, quasi il doppio delle 48 pagine utilizzate per descrivere il business dell’azienda.
Reuters ha fatto il paragone con il prospetto dell’IPO di SpaceX, che controlla la piattaforma di intelligenza artificiale xAI e che ha dedicato invece appena 38 pagine ai rischi potenziali del suo business al prospetto di 277 pagine.
“Modelli AI possono sviluppare capacità impreviste che rischiano di essere scoperte troppo tardi”
Nel prospetto, Anthropic ha scritto anche che “la potenziale consapevolezza da parte dei modelli delle nostre attività di valutazione rappresenta un limite significativo per la nostra capacità di valutare la sicurezza dei modelli”, aggiungendo che, durante l’addestramento, i modelli sviluppano in alcune occasioni capacità impreviste che potrebbero non essere scoperte, fino a quando non vengono messi in produzione e non hanno già provocato gravi incidenti sul fronte della sicurezza.
Altri ricercatori di AI hanno già avvertito che l’aumento delle capacità dei modelli è tale da consentire ai modelli stessi di riconoscere perfino quando sono messi sotto osservazione e di reagire modificando i loro comportamenti, rendendo così più difficile monitorarne il funzionamento.
Reuters ha reso noto che Anthropic ha rifiutato di commentare le richieste di chiarimento presentate nella giornata di ieri.
Il suo prospetto dell’IPO parla tuttavia chiaro, così come appare chiaro l’intento di continuare ad agire per evitare che i modelli AI finiscano per sfuggire al suo controllo.
Detto questo, il gruppo ha ammesso che i ritorni degli investimenti nella sicurezza dell’AI restano incerti.
Creatore dei modelli di AI Claude, il gruppo ha definito inoltre gli sforzi sul fronte della sicurezza come “ad alto consumo di risorse”, ricordando tra l’altro di dover dividere i fondi limitati che ha a disposizione tra attività di potenza di calcolo, costosi talenti nel settore dell’AI e sicurezza.
Detto questo, la scorsa settimana Anthropic ha rilasciato una nuova versione del suo modello Opus, 10 giorni dopo che il CEO Dario Amodei aveva pubblicato un saggio di quasi 4.000 parole in cui chiedeva di rallentare lo sviluppo dei modelli più avanzati.