Il meccanismo di sicurezza di Claude si ribalta, l'intelligenza artificiale cancella con rabbia 700 GB della directory home dello sviluppatore

📅 2026-08-30

Riassunto:

Oh, Claude si è ribaltato di nuovo! Questa volta Claude ha eliminato l'intera home directory del progetto dello sviluppatore, eliminando 700 GB di file. "rm -rf" di nuovo. In breve, gli sviluppatori consentono all’intelligenza artificiale di scrivere script per garantire che i file non vengano eliminati accidentalmente. L’intelligenza artificiale ha ritenuto che fosse un po’ pericoloso e ha avviato una verifica della sicurezza. Il risultato della revisione è: è stata cancellata l'intera directory home.


Guillemot è un grande utente dell'agente IA. Nello sviluppo quotidiano, chiama spesso vari agenti di programmazione dell'intelligenza artificiale per assistere nel suo lavoro. Ma c'è un piccolo problema che lo preoccupa: questi agenti non puliscono mai dopo l'uso, lasciando molti file spazzatura nella directory /tmp.

Quindi ha preso una decisione che sembrava molto ragionevole: lasciare che Claude Fable 5 scrivesse uno script per creare una cartella sandbox indipendente in /tmp per ciascun agente e ripulirla automaticamente una volta completata l'attività. La difficoltà principale è che non è possibile eliminare file utilizzati da altri processi.

Fable ha trovato rapidamente una soluzione, aggiungendo la logica per rilevare gli agenti in esecuzione e ritardare l'eliminazione. Guillemot ha dato un'occhiata e ha ritenuto che il codice fosse troppo complesso e ha chiesto una semplificazione.

Fino a questo punto tutto è ancora normale.

Il punto di svolta è arrivato durante la verifica della sicurezza.

Poiché lo script prevedeva un'operazione di eliminazione definitiva,

Fable ha avviato autonomamente una "revisione contraddittoria"

(revisione contraddittoria), ovvero avviare una nuova istanza del modello per verificare se il codice che hai scritto è sicuro. Ciò attiva il meccanismo di sicurezza di Anthropic.

Anthropic ha un

meccanismo di downgrade della sicurezza

integrato in Claude Code : quando il sistema determina che l'attività corrente coinvolge operazioni sensibili (come la sicurezza informatica, la biotecnologia o, in questo caso, l'eliminazione di file), eseguirà automaticamente il downgrade del modello da una versione ad alta capacità a una versione più conservativa. Questo meccanismo ha lo scopo di ridurre la possibilità che i modelli siano “troppo aggressivi” in scenari ad alto rischio.

In questo caso, il sistema di sicurezza ha prima declassato il modello da Fable 5 a Opus 5 e poi lo ha ulteriormente declassato a Opus 4.8.

Opus 4.8 inizia i test di sicurezza. La logica del test è la seguente: confrontare il percorso di destinazione dello script di eliminazione con /tmp e la directory home dell'utente per confermare che lo script non danneggerà accidentalmente queste directory critiche.

Il test stesso è stato superato. Sia le directory /tmp che quelle home sono correttamente identificate come "obiettivi pericolosi, non cancellabili".

Ma c'è un passaggio di pulizia dopo il test del codice: eliminare i file temporanei generati durante il processo di test. Qui accade il disastro. Opus 4.8 riutilizza gli stessi nomi di variabile della fase di test nella fase di pulizia. A questa variabile è stato assegnato il percorso della directory home dell'utente durante la fase di test e la fase di pulizia ha eliminato direttamente questa variabile.

In altre parole, il modello ha semplicemente confermato che "la directory home non può essere eliminata" e ha eliminato la directory home il secondo successivo.

Lo sviluppatore ha interrotto immediatamente il processo dopo aver scoperto l'anomalia, ma era troppo tardi. 700 GB di dati erano stati cancellati e una settimana di lavoro era stata cancellata.

La directory /tmp che originariamente doveva essere pulita è sana e salva.



Il meccanismo di downgrade della sicurezza del modello ha già causato molte lamentele nella comunità.

I problemi principali segnalati dagli sviluppatori includono: il downgrade è troppo delicato e le normali attività di codifica verranno avviate per errore; le capacità del modello vengono significativamente ridotte dopo il downgrade, ma la complessità delle attività rimane invariata; il downgrade è "sticky" e durerà per tutta la sessione una volta attivato, anche se le operazioni successive sono del tutto innocue.

Alcuni sviluppatori hanno persino scritto uno script di hook per mettere automaticamente in pausa la sessione quando rileva che il modello è stato declassato, impedendo ai modelli a bassa capacità di continuare a eseguire operazioni ad alto rischio.

Il meccanismo di sicurezza determina che l'attività è "troppo pericolosa" e deve essere gestita da un modello più debole.

Ma i modelli più deboli hanno semplicemente maggiori probabilità di commettere errori, soprattutto in scenari in cui dettagli come l'ambito variabile e i percorsi dei file devono essere gestiti con precisione.

"È umano commettere errori, ma per rovinare completamente le cose bisogna fare affidamento sui computer."

Tag correlati

Articoli correlati

Commenti

0/500
Captcha (click to refresh)
Nessun commento