Riassunto:
All'inizio di maggio di quest'anno, un video di cinque secondi di X è diventato virale. Questa è una trasmissione della Lega coreana di baseball professionale, gli Hanwha Eagles giocano contro i Doosan Bears. La telecamera fece una panoramica su una donna sugli spalti che indossava un top bianco e jeans con le gambe accavallate. Ad un certo punto, sembrò sospirare e distolse lo sguardo, sembrando insoddisfatta del gioco.

La didascalia del video è "Donne coreane ordinarie". Al momento della pubblicazione di questo articolo, il video è stato riprodotto 15,25 milioni di volte|Fonte video: X @kangminlee
Ma presto un gruppo di tifosi senior si accorse che qualcosa non andava. Il tabellone dei punteggi diceva che il battitore era Cho Inseong, ma Cho Inseong si è ritirato nel 2017 e ora è un allenatore del Doosan.
Inoltre, lo slogan esultante sugli spalti contiene una parola in più rispetto allo slogan ufficiale dei Doosan Bears, che sembra essere una traduzione schietta e letterale di AI. Per quanto riguarda questa trasmissione, il commento era in un accento americano standard, anche questo molto sospetto.
Questa donna non esiste, è stata generata dall'intelligenza artificiale. Ma il video non è scomparso dopo essere stato esposto. Invece, è diventato un modello. Tutti hanno messo i loro volti sullo stesso schermo televisivo, creando una loro foto catturata dalla telecamera dello stadio, che è diventata rapidamente popolare sui social network.

"Me stesso catturato dalla telecamera dello stadio" è diventato rapidamente un modello popolare|Fonte foto: RADII
Ogni volta che le funzionalità dell'immagine dell'intelligenza artificiale vengono migliorate, si otterrà quasi sempre un successo popolare. Ad esempio, nel marzo 2025, GPT-4o era in grado di disegnare immagini e lo schermo si riempiva di foto ridisegnate nello stile delle animazioni Ghibli; a fine agosto è stata lanciata Nano Banana di Google. Il modo preferito da tutti per giocarci era trasformare i selfie in figure da posizionare sulla scrivania del computer. Gli utenti hanno generato più di 200 milioni di immagini in due settimane.
Gli oggetti popolari cambiano ogni volta e la maggior parte di essi si basa sul gameplay "mettiti in gioco". Ma questa volta in campo è stata svelata una sequenza che prima non era così ovvia: prima, una bellezza inesistente ha ingannato decine di milioni di persone, e poi ha sviluppato un modello che tutti possono giocare.
La bellezza non è un ruolo secondario che appare accidentalmente nella scena, è più un valore predefinito
.Questa impostazione predefinita precede l'intelligenza artificiale di mezzo secolo. Nel 1973, agli albori della digitalizzazione delle immagini, un gruppo di ingegneri volle testare una nuova tecnologia per le immagini e scelse anche una bella donna.
01
La First Lady di Internet
Lena Soderberg ha iniziato la sua carriera come modella a Chicago, Illinois. In precedenza si era trasferita negli Stati Uniti dalla Svezia come ragazza alla pari. Nel 1972, posò per il paginone centrale del numero di novembre della rivista Playboy. Quel numero di Playboy ha venduto più di 7,16 milioni di copie, diventando così il numero più venduto della rivista.
La maggior parte delle persone che hanno studiato l'elaborazione delle immagini digitali l'hanno vista: indossare un cappello a tesa larga, spalle scoperte e guardare di traverso la fotocamera. Nel corso dei decenni su questo versante sono stati testati innumerevoli algoritmi di compressione ed elaborazione delle immagini.

Lena Soderberg è la first lady del cyber | Fonte immagine: SIPI IMAGE DATABASE
Nel 1973, i ricercatori del Signal Image and Processing Institute della University of Southern California erano alla ricerca di una nuova immagine per un documento di ricerca. Hanno esaurito la loro solita scorta di immagini di prova. In quel momento, secondo quanto riferito, un collega entrò con il numero di Playboy del novembre 1972. Vedendo la difficile situazione dei ricercatori, ha strappato una striscia da 5,12 pollici dalla parte superiore dell'inserto centrale e l'ha inserita nello scanner.
Da allora,
questa immagine è stata ampiamente utilizzata nella comunità dell'elaborazione delle immagini ed è persino diventata l'immagine di prova predefinita del settore
.Nel 1996, David Munson, redattore capo di IEEE Transactions on Image Processing, scrisse un breve articolo in cui spiegava come questa immagine scansionata in modo casuale sia diventata uno standard del settore. Ha fornito due ragioni. Il primo è tecnico. Questa immagine ha tutti i dettagli, aree piatte, ombre e trame, quindi è adatta per testare gli algoritmi. Il secondo articolo è più in linea con la natura umana:
Questa è la foto di una donna attraente. Non sorprende che un ambiente di ricerca dominato dagli uomini ne sia attratto
.Data l'origine di questa immagine, il suo utilizzo non è stato privo di controversie. Nel 1991, Playboy scoprì l'immagine sulla copertina di una rivista accademica, inviò una lettera rivendicando il copyright e alla fine la lasciò andare, consentendone l'uso nella ricerca. Il vicepresidente dei nuovi media dell'azienda ha affermato che poiché è diventato un fenomeno, è meglio trarne vantaggio.
Ci sono anche voci diverse all'interno della comunità di ricerca sull'elaborazione delle immagini. Hanno notato che gli ingegneri non dovrebbero utilizzare materiale tratto da pubblicazioni che potrebbero essere viste come umilianti per le donne.
Anche Lena stessa ha dichiarato nel documentario "Losing Lena" che spera di smettere di usare questa foto.

Nel documentario, Lena stessa mostra la sua famosa foto di più di 50 anni fa | Fonte immagine: IMDB
Di conseguenza, a partire dal 1° aprile 2024, la IEEE Computer Society non accetterà più documenti che utilizzano questa immagine.
Sono passati cinquantuno anni da quella scansione
.02
Viso medio
Ora le domande del test nel circolo tecnico sono state modificate da tempo.
L'intelligenza artificiale non può spillare un bicchiere pieno di vino rosso. Il livello del liquido nel bicchiere si ferma sempre al centro. Quando l'IA disegna un orologio, le lancette si fermano sempre alle 10:10. Il motivo è lo stesso: la maggior parte delle foto di vino rosso su Internet non sono bicchieri pieni, e la convenzione nella pubblicità degli orologi è di mostrarli alle 10:10. Il modello replicherà la distribuzione dei dati di addestramento e non potrà eliminare l'inerzia dei dati.

La spiegazione più popolare del motivo per cui gli annunci pubblicitari con orologio si fermano sempre alle 10:10 è che assomiglia a un "sorriso allegro", ma prima degli anni '50 era più popolare fermarsi alle 8:20 | Fonte immagine: Reddit
Il vino rosso e gli orologi dimostrano che "i modelli non sono abbastanza buoni". Ma quando si tratta di belle donne la situazione è diversa. La "sua" inerzia sembra essere allineata con l'estetica delle persone.
Nel 1990, le psicologhe Judith Langlois e Lori Roggman hanno condotto un esperimento: hanno calcolato la media matematica di un gruppo di volti per sintetizzare un nuovo volto, quindi hanno chiesto alle persone di valutarlo. Di conseguenza, il volto sintetico è più attraente di quasi tutti i volti reali coinvolti nella sintesi, e maggiore è il numero dei volti coinvolti nella media, migliore risulta il volto sintetico. Questo effetto vale sia per i volti maschili che per quelli femminili e per i diversi gruppi etnici.
Il titolo dell'articolo si chiama semplicemente
"I volti attraenti sono solo nella media"
.Osservazioni simili si sono verificate in precedenza. Nel 1877 qualcuno scrisse a Darwin dicendogli che sovrapponendo due ritratti di una donna usando uno stereoscopio, il volto risultante sarebbe stato ogni volta significativamente più bello.
L'essenza del modello generativo è in realtà quella di apprendere una distribuzione dei dati e quindi campionare vicino al centro della distribuzione. In altre parole, il modello è programmato per disegnare volti medi, e i volti medi sono ciò che gli esseri umani vedono come belli.
La psicologia umana combinata con i principi della macchina è diventata il fondamento tecnico della bellezza come valore predefinito dell'intelligenza artificiale
.Uno studio del 2023 dell'Università Nazionale Australiana ha portato questa collisione all'estremo. Gli psicologi hanno scoperto che i volti bianchi generati dall’intelligenza artificiale venivano giudicati come “reali” dai partecipanti all’esperimento più spesso dei veri volti bianchi. I ricercatori lo chiamano "iperrealismo dell'intelligenza artificiale", spiegando che i dati di addestramento riguardano principalmente persone bianche, e i volti generati dal modello sono più vicini alla media di questo gruppo e saranno percepiti come più tipici e più simili a persone reali.
Dopo la pubblicazione dell'esperimento, Langlois ricevette una critica: il viso sintetico ha un bell'aspetto solo perché le macchie e le imperfezioni sulla pelle si cancellano facilmente facendo la media. Questa critica era metodologica nel 1990.
Ma oggi sembra una profezia.
La caratteristica più tipica delle bellezze AI è la pelle eccessivamente liscia. Più di tre decenni dopo, le organizzazioni di fact-checking stanno insegnando alle persone a identificare le immagini AI, e uno dei difetti elencati è la pelle eccessivamente liscia. Quell'artefatto statistico che i critici hanno sottolineato più di tre decenni fa caratterizza le bellezze dell'IA del 2025.
03
Uovo di gesso
Lena è stata selezionata in un laboratorio. Il valore predefinito di oggi viene sviluppato dai dati.
Alla fine del 2022, la funzione "Magic Avatar" dell'applicazione di fotoritocco Lensa è diventata improvvisamente popolare: carica alcuni selfie e l'intelligenza artificiale genererà per te un centinaio di ritratti di stili diversi. Anche Melissa Heikkilä, giornalista AI del MIT Technology Review, lo ha utilizzato per generare 100 avatar di se stessa, 16 dei quali in topless e 14 con abiti minimali e pose sexy. E i suoi colleghi maschi hanno tutti astronauti, esploratori e inventori. Nessuno di loro ha dato alcun suggerimento al modello durante questo processo.

Immagine generata da Melissa tramite Lensa|Fonte immagine: MIT TECHNOLOGE REVIEW
Melissa ha spiegato nel suo articolo che la modella dietro questo modello si è formata su immagini catturate da Internet e
Internet è già piena di foto di donne poco vestite. Ciò fa sì che il modello generi "donne poco vestite" come valore predefinito
.Quindi, l'inerzia comportamentale degli utenti continuerà a guidare questa tendenza. Ogni generazione, salvataggio e inoltro è un voto. Uno studio del 2025 ha contato le modifiche ai contenuti della comunità di immagini AI Civitai: la percentuale di immagini NSFW (orientate agli adulti) è passata dal 41% nel gennaio 2023 all'80% nel dicembre 2024.
Infine, il produttore scriverà questi voti nel modello. Per consentire al modello di immagine di generare immagini più gradevoli, i produttori formeranno un "marcatore", che tecnicamente è chiamato modello di ricompensa o punteggio estetico. Il suo compito è apprendere quali immagini le persone pensano siano belle e quindi utilizzare questo standard per addestrare il modello: andare più nella direzione con un punteggio alto e andare meno nella direzione con un punteggio basso.
Uno dei marcatori più comunemente utilizzati si chiama PickScore. I dati di allenamento provengono da un'applicazione web: l'utente scrive una parola, il sistema fornisce due immagini e l'utente sceglie quella che gli piace di più.
Questi dati verranno esaminati e gli utenti che generano contenuti NSFW verranno eliminati, ma ci sono ancora molte parole suggerite NSFW mescolate. Un documento del 2024 che studia i modelli di ricompensa ha rilevato che utilizzando PickScore per mettere a punto il modello,
anche se le parole suggerite non hanno nulla a che fare con il sesso, il modello disegnerà più immagini NSFW
.Viene quindi visualizzata un'immagine: il revisore dei contenuti al front desk sta intercettando, ma il marcatore al backend si sta tirando indietro. Le demo ufficiali del produttore non presentano mai bellezze NSFW e la politica di generazione è molto severa. Ma come tutti sappiamo, i grandi modelli di oggi non sono del tutto controllabili. È stato addestrato dal gusto dell'utente, e il gusto dell'utente è andato molto lontano nell'inerzia.
Negli anni '30, l'etologo olandese Niko Tinbergen osservò una specie di gabbiano. Questo uccello depone piccole uova di colore blu pallido con macchie grigie. Ma quando metteva accanto al nido enormi uova finte di gesso blu brillante e punteggiate di nero, gli uccelli abbandonavano le proprie uova e si arrampicavano sulle uova di gesso per farle schiudere. Chiamò queste imitazioni esagerate, che sono più attraenti della realtà, "stimolazione sopranormale".

Niko Tinbergen dipinge uova durante una spedizione all'aperto | mondo accademico
Anche il volto umano offre stimoli straordinari, che portano il concetto "la media è la più bella" a un ulteriore passo avanti. Nel 1994, David Perrett e altri pubblicarono uno studio su Nature: un gruppo dei volti più belli fu sintetizzato come più simpatico del volto medio di tutte le persone; e se la differenza tra questo e il volto medio fosse amplificata del 50%, il punteggio sarebbe ancora più alto. Soggetti giapponesi e soggetti bianchi hanno scelto la stessa direzione.
Tra le principali aziende di intelligenza artificiale, almeno una ha trasformato direttamente questa psicologia in una caratteristica del prodotto. La generazione di immagini di Grok ha quattro modalità, una delle quali si chiama Spicy. Una volta attivato, il filtro dei contenuti verrà allentato, consentendo la generazione di contenuti suggestivi e nudità parziali, ed è aperto solo agli utenti paganti.
Nel gennaio 2026, gli utenti hanno scoperto che potevano caricare foto di chiunque per "spogliare digitalmente" Grok. Tra le vittime c’erano bambini e molti governi sono intervenuti per esercitare pressioni. X ha risposto limitando la generazione complessiva di immagini a una funzionalità a pagamento.
Il portavoce del primo ministro britannico ha commentato: Questa è solo una funzione per generare immagini illegali, trasformata in un servizio a pagamento.
L'intelligenza artificiale prende la forma del gruppo di persone che premono "Mi piace" più spesso
. Nel 1973, questo gruppo era un laboratorio prevalentemente maschile. Oggi sono gli utenti che cliccano di più, inoltrano di più e risparmiano di più. La preferenza delle persone per la bellezza ha una base biologica. I bambini di due o tre mesi guarderanno più a lungo i volti considerati attraenti dagli adulti.Lena, la First Lady di Internet, è stata un incidente. L'impostazione predefinita odierna prevede che il modello cresca dal centro dei dati. I clic dell'utente lo hanno spinto sempre più lontano e alla fine qualcuno gli ha messo un prezzo.
Le caratteristiche statistiche del modello di generazione dell'intelligenza artificiale, le preferenze estetiche umane per il "viso medio", nonché i clic degli utenti e gli incentivi commerciali formano un ciclo di feedback. Sono indipendenti l’uno dall’altro, ma insieme puntano nella stessa direzione, diventando oggi la nostra opzione predefinita per il consumo di contenuti.
Commenti