“Io sono Giorgia Meloni” da qualche giorno è un marchio registrato. La presidente del Consiglio ha infatti chiesto la registrazione del proprio timbro vocale all’Ufficio dell’Ue per la proprietà intellettuale, per contrastarne l’uso improprio con strumenti di IA e deepfake.

L’obiettivo è evidente: inibire la circolazione di materiale multimediale falso e potenzialmente oggetto di imbarazzo. Perché, sebbene depositare il marchio non impedisca di per sé che quella voce possa essere clonata tramite software di intelligenza artificiale, persino nel timbro e nelle inflessioni, per far dire al personaggio cose che non ha mai detto (i deepfake vocali), rappresenta comunque un deterrente, in Italia e in tutti gli altri stati membri dell’Unione.

Che cosa tutela il deposito

Ma perché far diventare la propria voce un “marchio registrato”? Prima di tutto perché l’eventuale contraffazione del dato biometrico dà diritto al titolare di intraprendere azioni legali in ciascun Paese europeo, con conseguenze gravi per il trasgressore. Conseguenze che si fanno addirittura più pesanti se il deepfake viene usato per trarre profitti.

Lo ha spiegato bene, in un articolo pubblicato su Agenda Digitale, Agostino Ghiglia, Componente del Garante per la protezione dei dati personali, specificando gli ambiti di applicazione possibili derivanti dalla registrazione effettuata:

“Le classi indicate nella domanda presentata da Meloni includono molti servizi di intrattenimento e di produzione artistica (classe 41) e i contenuti digitali (classe 9). Oltre a queste due classi, ce n’è un’altra associata all’«organizzazione di manifestazioni politiche», e questo lascia supporre che l’obiettivo sia scoraggiare anche eventuali utilizzi della voce di Meloni per campagne elettorali non autorizzate.”

Ora, la richiesta, fatta pervenire all’Euipo, risulta al momento “in fase di esame”, ma, come era facile immaginare, ha contribuito ad accendere un riflettore sui rischi, sempre più frequenti, di subire la clonazione della propria voce.

Leggi anche

Tech It Easy

L’esplosione del “Posting Zero”

L’esplosione del “Posting Zero”
L’esplosione del “Posting Zero”

Bastano pochi secondi

Grazie all’intelligenza artificiale, clonare voci reali è diventato sempre più facile. Bastano veramente pochi secondi, tre o quattro parole e, con strumenti che sono ormai pericolosamente alla portata di tutti, la replicazione della nostra voce può essere fatta in quattro e quattr’otto.

Sì, perché il problema non riguarda “soltanto” personaggi pubblici o famosi. E sebbene sfumature e impatti possano essere diversi a seconda del soggetto colpito, il rischio di essere oggetto di attacchi cybercriminali riguarda ormai tutti noi.

Come si clona una voce

Ma come fanno i cybercriminali a imitare una voce reale? La tecnologia utilizzata è la cosiddetta GAN (reti generative avversarie). Si tratta di un sistema di intelligenza artificiale formato da due reti neurali che competono tra loro per creare dati realistici.

Il Generatore: crea dati falsi (come immagini o suoni) partendo da un segnale casuale. Il Discriminatore: esamina i dati e decide se sono reali (presi dal set di dati originale) o falsi (creati dal generatore).

In questa competizione continua e velocissima, il generatore cerca di ingannare il discriminatore. Il discriminatore impara a riconoscere i trucchi. La “sfida” spinge entrambe le reti a migliorare molto in fretta. Questo consente migliaia di scomposizioni e comparazioni con le parole registrate, fino ad arrivare, in pochi secondi, al risultato più simile alla voce originale. Talmente simile da essere facilmente scambiata per quella vera.

Leggi anche

Le truffe al telefono

Ed è proprio questa tecnologia a rappresentare la nuova frontiera delle truffe telefoniche. In questo caso, la nostra voce può essere facilmente presa da video online o, sempre più spesso, registrata nel corso di chiamate mute, effettuate da finti call center.

Una volta processate da un software di IA, quelle poche parole (“Pronto? Chi parla?”) diventano la base su cui il software riesce a lavorare per comporre qualsiasi frase a nostra insaputa.

Più sono le parole e i vocali, maggiore sarà la perfezione nel riprodurre pause, tono e persino accento.

Una volta acquisita una voce, la truffa più frequente nella quale ognuno di noi può incappare è quella in cui un figlio, un parente o un amico sembra avere bisogno di aiuto.

Alla base dell’inganno c’è infatti sempre un’apparente emergenza e il coinvolgimento di una persona a noi cara (di cui crediamo di sentire la voce), mix perfetto per far sì che le vittime predestinate siano più spesso gli anziani (ma non solo loro).

A questo si aggiunge un ulteriore perfezionamento di una tecnica criminale chiamata spoofing, con la quale i malintenzionati riescono a far comparire sul display della vittima scelta il nome dell’amico o del familiare presente in rubrica a cui sembrerebbe appartenere la voce clonata.

Va da sé, a quel punto, che la diffidenza lascia spazio molto più facilmente all’idea che quella persona sia realmente in difficoltà. La vittima è così molto più propensa a rispondere e a fidarsi di richieste di denaro, codici o dati personali. Per questo è veramente sempre più difficile capire che si tratta di una truffa.

Il rischio nelle aziende

Ma attenzione, perché questa tecnica di inganno è sempre più usata anche negli ambiti lavorativi, mettendo a rischio lavoratrici e lavoratori, a tutti i livelli. Un finto amministratore delegato potrebbe impartire ordini ai dipendenti, ad esempio chiedendo pagamenti o bonifici. Se il numero (o la e-mail) da cui proviene la richiesta è ufficiale, diventa davvero complicato capire che si tratta di un raggiro.

Un caso eclatante è quello che ha recentemente riguardato l’ex presidente di Fideuram, ingannato con messaggi WhatsApp e voce artificiale. Un sofisticato e criminale raggiro ha infatti sfruttato l’identità digitale di un banchiere e la voce finta di un avvocato, per sottrarre milioni, 59 dei quali sono fortunatamente stati recuperati grazie alla collaborazione internazionale.

È evidente che questi scenari terrorizzano non poco, perché dimostrano quanto un utilizzo improprio o addirittura criminale di questa tecnologia possa potenzialmente arrecare danni a ognuno di noi.

Leggi anche

Un vuoto da colmare

Per questo, la scelta di Meloni di tutelare esclusivamente sé stessa stride fortemente con una realtà in cui è sempre più evidente il profondo vuoto normativo e operativo che colpisce i comuni cittadini di fronte alle truffe e ai danni reputazionali causati dal voice cloning.

Un vulnus grave e sempre più marcato, che va colmato con urgenza. Perché non è pensabile che la tutela dell’identità vocale e biometrica possa essere delegata a rimedi commerciali elitari. Quello che serve con immediatezza è una riforma legale sistemica, accompagnata da canali di emergenza operativi accessibili e rapidi per la popolazione generale, lasciata sola ad affrontare i rischi dell’intelligenza artificiale generativa.

Come riconoscere il raggiro

E nel frattempo, in attesa che la politica definisca modalità e strumenti di protezione generale dai rischi sopra citati (che vadano dunque oltre la registrazione individuale del singolo “marchio”), c’è qualcosa a cui possiamo prestare attenzione per tentare di difenderci, quantomeno dalle truffe telefoniche.

Il primo campanello d’allarme deve infatti suonare quando l’oggetto della telefonata è la richiesta di denaro o di dati personali o sensibili. Anche se ci sembra di riconoscere la voce e persino se il numero chiamante è uno di quelli che abbiamo in rubrica.

Per prima cosa facciamo attenzione al linguaggio usato, perché, per quanto la tecnologia GAN sia sempre più sofisticata, spesso il ritmo appare insolito o possono esserci piccoli difetti di pronuncia.

Inoltre, trattandosi di frasi registrate, la richiesta viene spesso reiterata. E questo, un po’ come il déjà-vu di Matrix (quando Neo vede passare due volte lo stesso gatto nero identico, capisce che l’ambiente è stato alterato), rappresenta una chiara anomalia del “sistema” e, nel nostro caso, della chiamata.

Ma anche se il check di queste prime indicazioni sembra darci esito positivo, di fronte a richieste insolite e urgenti il suggerimento migliore è quello di riagganciare e provare a ricontattare la presunta persona che ci ha telefonato.

Leggi anche

La parola d’ordine

Infine, c’è una buona pratica che nessun sistema di intelligenza artificiale potrà mai aggirare, ed è quella della “parola d’ordine”: una parola o una frase unica, conosciuta solo dai membri del nucleo familiare da richiedere nel momento in cui si vuole verificare la reale identità dell’interlocutore. Chiedere la parola segreta interrompe immediatamente l’inganno, perché un estraneo o un sistema IA non la conoscono.

Una parola o una frase semplice ma efficace, che non deve essere riconducibile a contenuti pubblicati sui social o a informazioni personali facilmente indovinabili o riscontrabili, come il nome della nostra via di casa o dell’animale domestico. Può essere una parola buffa usata in famiglia o un aneddoto specifico.

Perché alla fine l’IA potrà pure tentare di imitarci, basandosi su quello che di noi condividiamo o su quello di cui riesce ad appropriarsi. Ma i nostri ricordi, le nostre emozioni, non dovrebbe averli mai (ogni riferimento ai chatbot emotivi è esplicitamente voluto!). Quelli teniamoceli stretti. Così come le parole segrete.

Alì Babà docet.

Barbara Apuzzo, responsabile Politiche e sistemi integrati di telecomunicazioni Cgil nazionale