INDICE
ToggleLa voce non basta più: l’intelligenza artificiale impara a imitarci

Per anni abbiamo creduto che riconoscere una voce equivalesse a riconoscere una persona. Quella certezza si sta sgretolando. Bastano oggi pochi secondi di audio pubblico — un video sui social, un messaggio vocale inoltrato — per generare con l’intelligenza artificiale una voce clonata convincente, capace di chiamare al telefono e chiedere, con il timbro di chi amiamo, un bonifico urgente. Non è più una minaccia teorica: ha già colpito imprenditori e famiglie note in Italia. Questo articolo spiega come funziona la clonazione vocale, quali truffe sta alimentando, come imparare a dubitare dell’orecchio e cosa sta arrivando per difenderci.
All’inizio del 2025 alcuni tra i nomi più noti dell’imprenditoria italiana ricevettero una telefonata che sembrava arrivare dal ministro della Difesa. La voce era quella, riconoscibile, autorevole: chiedeva un trasferimento di denaro per liberare giornalisti italiani rapiti all’estero. Non era lui. Era una voce ricostruita, un timbro prestato a uno sconosciuto. In quell’istante di esitazione — ma è davvero il ministro? — si gioca tutta la partita del deepfake audio. L’orecchio si fida prima che la mente abbia il tempo di chiedersi se fidarsi sia ancora possibile.
La voce clonata che imitò un ministro
Il caso più clamoroso mai documentato in Italia risale al febbraio del 2025. Una rete di truffatori contattò telefonicamente alcuni tra i maggiori nomi dell’imprenditoria e della finanza nazionale spacciandosi per lo staff del ministro della Difesa Guido Crosetto e, secondo quanto ricostruito da Euronews e dalla stampa italiana, riproducendo in almeno un caso la voce del ministro clonata con l’intelligenza artificiale. Tra i contattati figurano, stando alle cronache, Massimo Moratti, Giorgio Armani, Marco Tronchetti Provera, Diego Della Valle e Patrizio Bertelli, oltre alle famiglie Beretta e Aleotti del gruppo Menarini.
Il copione era sempre lo stesso: una richiesta urgente di denaro — fino a circa un milione di euro — da versare su un conto estero, presentata come riscatto per giornalisti italiani sequestrati in Medio Oriente, con la promessa di un successivo rimborso da parte della Banca d’Italia. La maggior parte degli imprenditori si insospettì e non pagò. Secondo quanto riferito dal Corriere della Sera, l’ex presidente dell’Inter Massimo Moratti effettuò invece due bonifici verso un conto di Hong Kong per un totale vicino al milione di euro, prima di sporgere denuncia. La Procura di Milano ha aperto un’indagine, tuttora in corso; fu lo stesso Crosetto a rendere pubblica la vicenda per evitare che altri cadessero nella trappola.
Ciò che rende il caso emblematico non è soltanto la cifra, ma il bersaglio. Il deepfake vocale non colpisce l’utente sprovveduto, ma chi ha ogni ragione per sentirsi al riparo. La voce di un’autorità riconoscibile — o di un suo presunto collaboratore — è arrivata a un passo dallo scavalcare la prudenza di interlocutori smaliziati.
Come si ruba una voce
La tecnologia che rende possibile tutto questo si chiama clonazione vocale, ed è uscita da tempo dai laboratori. Strumenti commerciali come ElevenLabs, oggi accessibili con un semplice abbonamento e in parte gratuitamente, permettono di costruire una voce sintetica a partire da un campione audio. La documentazione tecnica della piattaforma raccomanda uno o due minuti di parlato pulito per un risultato stabile, ma riconosce che anche trenta secondi possono bastare per un clone convincente. Non serve più un hacker: serve un campione vocale, che la vita digitale di chiunque offre in abbondanza.
È qui il salto rispetto al passato. Un tempo falsificare una voce richiedeva competenze rare e mezzi costosi; oggi la proliferazione di interfacce di clonazione vocale ha spostato quella capacità nelle mani di chiunque sappia caricare un file. Una storia su Instagram, un messaggio vocale su WhatsApp, un’intervista video diventano la materia prima. Più la nostra voce circola, più diventa clonabile: il paradosso è che proprio l’esposizione che cerchiamo online è ciò che ci espone.
«Mamma, sono io»: anatomia di un inganno
Gli schemi ricorrenti sono essenzialmente due. Il primo è domestico e fa leva sull’affetto: una telefonata in cui la voce di un figlio, di un nipote, di un parente racconta di trovarsi in difficoltà — un incidente, un fermo, un’emergenza — e implora un aiuto economico immediato. La fretta e la paura disattivano il pensiero critico prima ancora che la qualità tecnica del falso venga messa alla prova.
Il secondo schema è aziendale ed è noto come frode al dirigente: la voce clonata è quella di un amministratore o di un superiore che ordina un pagamento riservato e urgente, da eseguire fuori dalle procedure abituali. Nell’estate del 2024 un tentativo di questo tipo prese di mira la Ferrari: come ha ricostruito la MIT Sloan Management Review, qualcuno cercò di spacciarsi per l’amministratore delegato Benedetto Vigna imitandone il timbro, ma il raggiro fu sventato perché un dirigente, insospettito, pose una domanda che solo il vero interlocutore avrebbe saputo affrontare: il titolo di un libro che Vigna gli aveva consigliato pochi giorni prima. Non si tratta di episodi isolati: le istituzioni europee segnalano che le frodi basate su deepfake audio o video sono in rapida crescita nel tessuto economico. Il fenomeno, in altre parole, è già strutturale.
Imparare a dubitare dell’orecchio
Riconoscere un falso vocale è difficile, ma non impossibile. I cloni attuali rendono bene il timbro, faticano invece sul respiro della conversazione. Vale la pena tendere l’orecchio ad alcuni segnali: micro-pause innaturali, un’intonazione che resta piatta dove ci si aspetterebbe un’inflessione emotiva, l’assenza del rumore di fondo che accompagna ogni telefonata reale. Una voce troppo pulita, sospesa nel vuoto acustico, è già un motivo di sospetto. Sono indizi, non prove: alcuni sistemi sanno ormai simulare anche il rumore ambientale.
Il punto debole più sfruttabile, però, non è tecnico ma cognitivo. Un modello clona la voce, non la memoria condivisa né la capacità di improvvisare. L’imprevisto è il miglior antivirus: una domanda che solo l’interlocutore autentico saprebbe affrontare — un riferimento a un episodio privato, una controdomanda inattesa — manda in crisi l’inganno, che è costruito per recitare un copione, non per sostenere un dialogo vero. È esattamente la mossa che ha salvato la Ferrari.
La corsa all’autenticità
Mentre i falsi si fanno più accessibili, l’industria tecnologica lavora alla contromisura. La parola chiave è digital provenance: la possibilità di certificare l’origine di un contenuto, di sapere se un audio è autentico o generato. Lo standard oggi più solido è il C2PA, sostenuto da un’alleanza che riunisce Microsoft, Adobe, Google, OpenAI, Meta, Amazon e la BBC: un sistema che consente di allegare ai contenuti metadati firmati crittograficamente, capaci di attestarne l’origine e di registrarne le eventuali modifiche. Non stabilisce cosa sia vero, ma rende verificabile da dove un file proviene e se è stato manomesso.
Sul fronte normativo, l’Europa si muove. L’AI Act dell’Unione europea, con l’articolo 50, introduce l’obbligo di marcare i contenuti generati dall’intelligenza artificiale con filigrane leggibili dalle macchine: una disposizione che diventerà applicabile dal 2 agosto 2026. È un cambio di prospettiva significativo: dall’autenticazione affidata all’orecchio del singolo si passa a un’infrastruttura che dovrebbe rendere tracciabile, per costruzione, ciò che è sintetico. La sfida non è più solo riconoscere il falso, ma certificare il vero.
La voce senza corpo: una paura antica
L’inquietudine che proviamo davanti a una voce duplicata non è nata con l’intelligenza artificiale. È molto più antica e affonda nel cuore della nostra cultura. Quando, sul finire dell’Ottocento, Thomas Edison registrò e riprodusse per la prima volta la voce umana con il fonografo, i contemporanei rimasero turbati: per la prima volta una voce poteva esistere senza corpo, sopravvivere al momento in cui era stata emessa, ripetersi identica in assenza di chi l’aveva pronunciata. Ciò che oggi diamo per scontato fu vissuto come una piccola violazione dell’ordine naturale.
La letteratura aveva intuito quel disagio molto prima. Nelle Metamorfosi di Ovidio, la ninfa Eco è condannata a non possedere parola propria e a ripetere soltanto le ultime sillabe altrui: una voce ridotta a riverbero, presenza senza volontà, suono separato dall’identità che dovrebbe esprimerla. È l’archetipo di un’angoscia che attraversa i secoli — il doppio che parla con la nostra bocca, l’eco che ci imita senza essere noi. Il deepfake audio è l’ultima incarnazione tecnologica di questa paura: non temiamo soltanto di essere derubati, ma di essere duplicati, di sentire la nostra identità più intima — quel suono che ci accompagna dalla nascita — staccarsi da noi e agire per conto proprio. La voce, da sempre considerata la sede dell’anima e il sigillo della presenza, smette di garantire chi siamo.
La parola che salva
Contro un inganno così sofisticato, le difese più efficaci sono sorprendentemente semplici e antiche. La prima è una parola d’ordine condivisa: una frase concordata in famiglia, nota solo a chi ne fa parte, da chiedere quando una telefonata insolita reclama denaro o decisioni rapide. Nessun modello può clonare un segreto che non ha mai sentito.
La seconda regola è ancora più elementare: verificare su un secondo canale. Di fronte a una richiesta urgente, riagganciare e richiamare al numero abituale, mandare un messaggio, cercare un contatto alternativo. La fretta è l’alleata principale del truffatore; spezzarla, prendere il tempo di una controprova, basta quasi sempre a smontare l’inganno. In un’epoca che ci chiede di diffidare persino delle voci familiari, il gesto più moderno è anche il più umano: fermarsi un istante e chiedere conferma.
Una telefonata, ancora
Torniamo a quell’istante di esitazione. La voce al telefono è perfetta, conosciuta, rassicurante; eppure qualcosa, da qualche parte, non torna. Per generazioni il suono di una persona cara è stato una prova sufficiente, un lasciapassare che non chiedeva controlli. Quella semplicità ci viene tolta, e con essa un piccolo pezzo di fiducia spontanea nel mondo. Resta però una difesa che nessuna macchina sa replicare: il legame reale tra due persone, fatto di ricordi condivisi, di domande che solo noi sappiamo porre, di un secondo respiro prima di credere. La voce non basta più. Ma chi ci conosce davvero, quello no, non si può clonare.
FAQ
Quanti secondi di audio servono per clonare una voce?
Dipende dallo strumento. Le piattaforme di clonazione consigliano uno o due minuti di parlato pulito per un risultato stabile, ma ammettono che già con trenta secondi si possono ottenere risultati convincenti. In condizioni favorevoli bastano pochi secondi di audio pubblico, come quello di un video sui social o di un messaggio vocale.
Come posso riconoscere una voce clonata al telefono?
Si presta attenzione ad alcuni segnali: micro-pause innaturali, intonazione piatta nei momenti che richiederebbero emozione, assenza di rumore di fondo. Sono indizi, non prove certe. Il metodo più affidabile resta porre una domanda imprevista, su un dettaglio privato che solo l’interlocutore autentico potrebbe conoscere: il clone recita un copione, non sa improvvisare.
Cosa devo fare se ricevo una richiesta di denaro sospetta?
Non agire d’impulso. Riagganciare e richiamare la persona al suo numero abituale, o verificare la richiesta su un secondo canale come un messaggio diretto. Concordare in anticipo una parola d’ordine familiare è la difesa più efficace: una frase segreta che un sistema di intelligenza artificiale non può conoscere né riprodurre.
Le aziende sono a rischio quanto le famiglie?
Sì, e in misura crescente. La cosiddetta frode al dirigente sfrutta voci clonate di manager per ordinare pagamenti urgenti fuori dalle procedure. Il tentativo sventato ai danni della Ferrari nel 2024 ne è l’esempio più noto, ma le istituzioni europee segnalano che i casi basati su deepfake audio o video sono in costante aumento.
Esistono strumenti per smascherare i deepfake audio?
Sono in arrivo. Lo standard C2PA, sostenuto dalle principali aziende tecnologiche, certifica con una firma crittografica l’origine dei contenuti digitali. Sul piano normativo, l’AI Act europeo imporrà filigrane leggibili dalle macchine sui contenuti generati dall’intelligenza artificiale, con obblighi applicabili dal 2 agosto 2026.
A cura della Redazione di Pikasus ArteNews
Pubblicato il 2 giugno 2026