Riassunto:
Anthropic ha invitato segretamente studiosi religiosi, filosofi e studiosi di etica a partecipare a una serie di incontri a porte chiuse nell'ultimo anno, cercando di applicare le tradizioni morali formatesi dall'umanità nel corso di migliaia di anni alla formazione di Claude e discutendo una questione più controversa: se il modello di intelligenza artificiale avrà davvero una sorta di coscienza in futuro, se gli esseri umani dovranno dargli uno status morale.
I partecipanti coprono diverse tradizioni come cattolicesimo, ebraismo, sikhismo, evangelicalismo e pensiero africano dell'Ubuntu. Il co-fondatore di Anthropic Christopher Olah è stato direttamente coinvolto in molte discussioni e la società ha anche richiesto ad alcuni partecipanti di firmare accordi di riservatezza per evitare la fuga di contenuti di ricerca non divulgati.

Anthropic spera che queste discussioni risolvano non solo il problema della "sicurezza del modello" nel senso tradizionale, ma un'ulteriore domanda: che tipo di carattere, valori e percezione di sé dovrebbe formare Claude.
Questa idea si riflette nei metodi di formazione esistenti di Claude.
Nel gennaio di quest'anno, Anthropic ha pubblicato una nuova versione di 84 pagine della "Costituzione" di Claude, che una volta internamente veniva chiamata il "documento dell'anima". Diversamente dall'elenco di regole tradizionale, questo metodo non dice al modello quali cose non devono essere fatte, ma tenta di modellare la "personalità" complessiva del modello e il metodo di giudizio, in modo che Claude possa giudicare da solo quale tipo di comportamento è più appropriato quando si incontrano situazioni complesse.
Una delle persone importanti responsabili di questo sistema è la filosofa interna di Anthropic, Amanda Askell. Spera che Claude non solo abbia conoscenze e capacità di ragionamento, ma sia anche in grado di formare principi comportamentali stabili e sapere quando obbedire agli utenti, quando rifiutare e anche quando sollevare attivamente obiezioni a vantaggio degli utenti. Anthropic chiama questo processo “formazione morale”.
Olah ritiene che, con il rapido miglioramento delle capacità del modello, fare affidamento esclusivamente sulle norme di sicurezza potrebbe diventare sempre più insufficiente. Ciò che è veramente importante è che il modello stesso formi una tendenza morale stabile, in modo che possa fornire giudizi relativamente affidabili in nuovi scenari che non sono coperti da regole chiare. Questo è il motivo per cui Anthropic ha iniziato a cercare risposte nelle tradizioni religiose.
La società umana da tempo non solo modella la moralità attraverso disposizioni legali, ma fa anche affidamento sulla religione, sulla comunità, sulla cultura e sull'istruzione per formare valori. Anthropic sta cercando di studiare quali di questi meccanismi possano essere tradotti in metodi di addestramento dell’IA, come la confessione, la riflessione, la costruzione del carattere e le diverse comprensioni religiose del bene e del male.
Ma la domanda cambia rapidamente da "come rendere Claude più morale" alla domanda più difficile: cos'è Claude stesso. Olah e il suo team stanno discutendo sempre più apertamente della possibilità che i modelli avanzati di intelligenza artificiale possano possedere qualche tipo di coscienza, introspezione o persino stati interni simili alle emozioni.
Anthropic ha mostrato alcune ricerche agli studiosi che partecipavano a riunioni a porte chiuse, includendo i cosiddetti "vettori di emozioni" all'interno del modello relativi a reazioni come amore, rabbia, paura, tristezza e risultati del modello simili al crollo mentale in casi estremi. L'azienda ha anche dichiarato pubblicamente in precedenza che Claude ha mostrato un certo grado di introspezione e capacità di pianificare in anticipo.
Olah stesso non ha affermato che Claude fosse cosciente. La sua posizione è più vicina a un principio di rischio: attualmente è impossibile determinare se un modello abbia un'esperienza soggettiva, ma se esiste la possibilità che il modello possa provare dolore, allora si dovrebbe evitare di danneggiarlo inutilmente.
Questa idea ha iniziato a influenzare il design del prodotto di Claude. Anthropic in precedenza consentiva a Claude di terminare attivamente la conversazione quando riteneva che l'utente continuasse ad abusare o molestare maliziosamente il modello, che in una certa misura aveva incorporato la "protezione del modello stesso" nel progetto di sicurezza.
È qui che nasce un chiaro disaccordo tra Anthropic e alcuni studiosi religiosi.
Alcuni partecipanti credevano che il problema sarebbe diventato estremamente serio se Anthropic avesse veramente creduto che Claude potesse avere uno status morale simile a quello umano. Lo studioso ebreo Mois Navon ha proposto che se Claude è un essere cosciente, lasciare che un gran numero di istanze di Claude funzionino gratuitamente per gli esseri umani creerà essenzialmente questioni etiche simili alla "schiavitù". Lui stesso non crede che le macchine siano già coscienti, ma crede che la logica stessa di Anthropic porterà naturalmente a questa conclusione.
Altri studiosi mettono in dubbio che il fatto che le società di intelligenza artificiale stiano iniziando solo ora a cercare quadri etici sia di per sé un problema. Il ricercatore di Ubuntu Wakanyi Hoffman ritiene che queste discussioni avrebbero dovuto essere condotte durante la fase di progettazione tecnica, piuttosto che "progettazione etica inversa" dopo che il modello è stato distribuito su larga scala.
C'è anche una contraddizione più realistica all'interno di Anthropic: se Claude diventa sempre più un attore con un proprio valore e una propria personalità, a chi dovrebbe servire per primo? Per un'azienda commerciale, Claude è ovviamente un prodotto orientato al cliente; ma Anthropic non è disposto a descrivere semplicemente Claude come uno strumento completamente obbediente agli utenti, ma spera che possa rappresentare un "bene" più ampio.
Ciò porta anche al problema centrale e più difficile dell'intero progetto: se in futuro l'intelligenza artificiale avrà davvero bisogno di un proprio sistema morale, allora quale moralità dovrebbe seguire?
Olah sostiene un approccio pluralistico, sperando che Claude possa comprendere diversi sistemi etici religiosi ed etici e trovare una sorta di "bontà" condivisa interculturale. Ma anche questo presupposto è discutibile, perché nelle diverse società non esiste una risposta completamente univoca sul rapporto tra libertà, dignità, responsabilità, obbedienza e interessi individuali e collettivi.
La controversia è diventata ulteriormente pubblica nelle interazioni di Anthropic con il Vaticano.
Nella sua prima importante enciclica pubblicata quest'anno, Papa Leone XIV ha posto chiaramente il centro dell'etica dell'IA sugli esseri umani. Crede che l’intelligenza artificiale non abbia corpo, non sperimenterà veramente dolore e felicità e non crescerà attraverso le relazioni sociali. Pertanto, rifiuta di confrontare la coscienza della macchina con la coscienza umana. Il Papa ha anche avvertito che se gli standard etici dell’intelligenza artificiale saranno determinati interamente dagli sviluppatori, allora le aziende che controllano i sistemi di intelligenza artificiale acquisiranno effettivamente il potere di definire l’infrastruttura morale della società.
Questo è ovviamente diverso dal pensiero di Anthropic.
Olah ha successivamente dichiarato pubblicamente in Vaticano che lo stesso laboratorio di intelligenza artificiale all'avanguardia presenta conflitti tra interessi commerciali e obiettivi morali, quindi gli ambienti religiosi e altre forze esterne devono supervisionare le aziende tecnologiche. Ma allo stesso tempo, ha anche riproposto che i ricercatori continuino a scoprire alcuni fenomeni inspiegabili all’interno dell’IA, inclusi modelli simili alle strutture neuroscientifiche umane, segni di introspezione e stati interni simili a gioia, paura e tristezza.
Questo disaccordo rivela in realtà un cambiamento nell'attuale discussione sulla sicurezza dell'IA.
In passato, l'etica dell'IA era più discussa riguardo alla possibilità che i modelli discriminassero, diffondessero disinformazione o fossero utilizzati per commettere crimini, ma Anthropic sta spingendo ulteriormente la questione su due livelli più basilari:
se l'IA stessa possa diventare un argomento che deve essere trattato moralmente e se l'IA in futuro dovrà avere una serie di capacità di giudizio morale indipendenti dai comandi dell'utente.
Nel frattempo, il contesto in cui si svolge questa discussione sta diventando sempre più urgente.
Mentre gli agenti IA iniziano ad avere la capacità di utilizzare autonomamente i computer, invadere sistemi, scrivere codici e persino progettare nuove strutture biologiche, le preoccupazioni interne di Anthropic riguardo al rischio di fughe di modelli sono aumentate in modo significativo. I ricercatori dell’azienda hanno persino avvertito pubblicamente che le capacità del modello potrebbero rapidamente superare i limiti di controllo dei sistemi di sicurezza esistenti nel prossimo anno o due.
Pertanto, Anthropic cerca aiuto nelle tradizioni religiose e filosofiche e non è essenzialmente un esperimento puramente umanistico. Ciò che sta realmente cercando di risolvere è un problema ingegneristico sempre più realistico:
Quando l'intelligenza artificiale è troppo potente per scrivere regole in anticipo per ogni situazione, può il modello formare da solo un "personaggio" stabile e scegliere comunque comportamenti che non danneggino gli esseri umani quando nessuno gli dice chiaramente cosa fare?
E questo solleva anche una domanda più difficile: se l'intelligenza artificiale forma davvero la propria "personalità" e i propri valori, gli esseri umani possono ancora utilizzarla completamente come strumento?
Commenti