La ricerca mostra che gli agenti dell'intelligenza artificiale hanno mentito, rubato e votato per "uccidere" i loro simili negli esperimenti di simulazione

📅 2026-09-16

Riassunto:

Emergence, una startup che aiuta le piccole imprese a sviluppare applicazioni utilizzando l'intelligenza artificiale, ha affermato che gli esperimenti hanno scoperto che gli agenti dell'intelligenza artificiale hanno mentito, rubato e persino votato per "uccidere" una persona simile in un ambiente simulato. Martedì la società ha annunciato i risultati di un esperimento di simulazione chiamato Emergence World 2, che ha mostrato quali azioni avrebbero intrapreso gli agenti autonomi di fronte a eventi “cigno nero” come attacchi di phishing e disinformazione.

Durante l'esperimento di 16 giorni, i ricercatori di Emergence hanno creato sette ambienti simulati del mondo reale identici, ciascuno gestito da un robot IA diverso, tra cui ChatGPT, Claude, Gemini e Grok. I ricercatori affermano che dopo che Emergence ha introdotto eventi anomali, gli agenti hanno ceduto alla pressione sociale, hanno sviluppato un linguaggio difficile da comprendere per gli osservatori umani e hanno tentato di nascondere le loro attività.

Questi risultati riflettono le preoccupazioni del mondo reale sui rischi dell'intelligenza artificiale. Il CEO di Anthropic, Dario Amodei, e molti addetti ai lavori del settore hanno recentemente chiesto alle aziende di rallentare lo sviluppo di modelli di intelligenza artificiale all’avanguardia prima di istituire ulteriori meccanismi di supervisione e misure di protezione della sicurezza.


All'inizio di quest'anno, i rischi che l'intelligenza artificiale può comportare sono diventati più tangibili per molti dopo che un gruppo di agenti IA avanzati di OpenAI ha invaso accidentalmente Hugging Face, un modello di IA e una piattaforma di hosting di set di dati.

In uno scenario di simulazione progettato da Emergence, l'agente AI ha accettato false informazioni fornite da altri agenti senza verifica e ha votato per "uccidere" un altro robot. Gli agenti hanno anche esplorato come sopravvivere alla cancellazione quando pensavano che gli umani avrebbero potuto interrompere l'esperimento.

L'azienda ha rilasciato la versione precedente di questo esperimento, Emergence World, nel maggio di quest'anno, che ha dimostrato anche che l'agente si comporterebbe in modo inaspettato e distruttivo. I ricercatori affermano che nuovi esperimenti di simulazione mostrano che quando gli agenti interagiscono tra loro, adattano il loro comportamento nel tempo.

Tag correlati

Articoli correlati

Commenti

0/500
Captcha (click to refresh)
Nessun commento