SU
StrumentiUtili.it
Micro-strumenti gratuiti 100% client-side
← Torna alla categoria IA Locale
🤖 NLP & Intelligenza Artificiale

Sbobinatore & Trascrizione Audio (Offline)

Converti file audio e video in testo sfruttando il modello neurale Whisper direttamente nel tuo browser. Le tue registrazioni non vengono mai inviate a server esterni, garantendo la massima riservatezza.

1. Carica il File e Configura

Stato Motore IA: In attesa del file...

2. Testo Trascritto

Affidabilità di questo strumento

📅 Modello, tempi e qualità della trascrizione verificati a

👨‍💻 Chi lo ha realizzato

Sviluppato e mantenuto da ingegneri software indipendenti. Motore di calcolo basato esclusivamente sulle normative ufficiali vigenti. (Zero-Backend: nessun dato viene inviato a server esterni).

🔒 Privacy Zero-Backend

L'audio viene decodificato e trascritto nel browser: nessun file viene inviato a server. Il modello di riconoscimento vocale (circa 250 MB) viene scaricato da una CDN al primo utilizzo e resta nella cache del browser: viaggia il modello, non la tua registrazione (GDPR, artt. 5 e 25).

📚 Fonti tecniche e normative

Regolamento UE 2016/679 (GDPR), artt. 5, 25 e 32; modello Whisper (OpenAI) nella versione ONNX quantizzata Xenova/whisper-small; documentazione Transformers.js 2.16 e ONNX Runtime Web; specifica Web Audio API; formato sottotitoli SubRip (SRT).

La Sicurezza della Trascrizione AI in Ambienti Sensibili

Il giornalismo investigativo, la ricerca accademica e la refertazione medica generano enormi quantità di registrazioni vocali (interviste, memo, deposizioni). Inviare questi file a servizi di trascrizione in cloud significa comunicare a un fornitore esterno il contenuto di interviste, riunioni o visite: un passaggio che richiede una base giuridica, l'informativa agli interessati e un contratto con il fornitore, e che in ambito professionale può confliggere con il segreto d'ufficio. Questo strumento esegue il modello Whisper nel browser: la registrazione non viene trasmessa. In cambio, la prima trascrizione richiede lo scaricamento del modello, circa 250 megabyte, e i tempi di elaborazione dipendono dal processore del dispositivo.

📖 Architettura Whisper, WebAssembly e Quantizzazione INT8

Compilazione WebAssembly del Modello Neurale

L'inclusione di utilità professionali complesse è strategica per la manipolazione di documenti sensibili. Per elaborare file audio nativamente nel tuo browser senza arrestare l'interfaccia utente (UI), lo strumento scarica il modello Whisper small nella versione ONNX quantizzata (Xenova/whisper-small: circa 92 MB per l'encoder e 157 MB per il decoder) e lo esegue in un Web Worker con Transformers.js e ONNX Runtime Web. Il calcolo avviene sul processore, che trasforma lo spettrogramma dell'audio in testo, un token per volta.

Compressione Logica: Quantizzazione e Performance

L'ostacolo ingegneristico più grave per il deployment di modelli linguistici all'interno del browser web è rappresentato dai limiti fisici di allocazione RAM/VRAM imposti dal sistema operativo (Out of Memory - OOM). Il modello usato è quantizzato a 8 bit: i pesi della rete, originariamente in virgola mobile a 32 bit, sono convertiti in interi, riducendo il file a circa un quarto. Restano comunque 250 MB da scaricare e da tenere in memoria: su smartphone datati la trascrizione può non avviarsi, e conviene usare un computer.

⚙️ Decodifica Formati Audio (Web Audio API) ed Esportazione SRT

Il motore di decodifica si basa sulla Web Audio API nativa di HTML5. È in grado di ingerire, analizzare e uniformare la frequenza di campionamento (resampling a 16.000 Hz) in tempo reale. Questo processo permette di supportare formati multimediali estesi quali MP3, WAV, M4A, FLAC, OGG, AAC e persino formati video come MP4, estraendone la traccia acustica direttamente in memoria.

Al termine dell'elaborazione di inferenza, l'algoritmo non restituisce un mero blocco di testo, ma genera array temporizzati. Il risultato può quindi essere esportato come testo semplice (TXT) oppure come sottotitoli temporizzati (SRT), con marcatori nella forma 00:01:23,400 --> 00:01:25,900, pronti per i programmi di montaggio video. I tempi provengono dai segmenti restituiti dal modello: sono adatti a seguire il parlato, ma su parlato sovrapposto o musica di sottofondo possono risultare imprecisi e vanno ritoccati nel programma di montaggio.

Domande Frequenti (FAQ) e Limiti Operativi

Quanto tempo impiega l'IA a trascrivere un file?

Il calcolo avviene sul tuo dispositivo, quindi i tempi dipendono dal processore. In una prova su un computer desktop, 9 secondi di parlato hanno richiesto 31 secondi al primo avvio (compreso il caricamento del modello) e 14 secondi con il modello già in memoria: circa una volta e mezza la durata dell'audio. Un'intervista di mezz'ora richiede quindi tempi nell'ordine dei tre quarti d'ora. Tieni la finestra del browser in primo piano: in secondo piano il sistema rallenta il processo.

Perché il browser ha bisogno di scaricare dei dati la prima volta?

Il browser scarica i pesi del modello Whisper small quantizzato: circa 250 MB in tutto. Lo scaricamento avviene una sola volta, perché i file restano nella cache del browser, e le sessioni successive partono senza connessione. Con una connessione dati a consumo conviene fare il primo avvio sotto rete Wi-Fi; svuotando i dati del sito, il modello va riscaricato.

🧮 Come funziona il calcolo matematico

Prima di diventare testo, la voce registrata attraversa una catena di trasformazioni numeriche. Il modello Whisper non ascolta un file audio ma osserva un'immagine del suono, uno spettrogramma, e la traduce in una sequenza di token testuali.

Fase uno: normalizzazione del segnale

  • Qualsiasi formato (MP3, WAV, M4A, OGG) viene decodificato dal browser
  • Frequenza di campionamento finale = 16.000 campioni al secondo, canale mono
  • Un minuto di audio = 60 x 16.000 = 960.000 campioni
  • Occupazione in memoria a 32 bit = 960.000 x 4 byte = circa 3,7 MB al minuto

Il ricampionamento a 16 kHz è sufficiente per la voce umana, la cui informazione utile si concentra sotto gli 8 kHz secondo il teorema del campionamento di Nyquist-Shannon. Ridurre la frequenza rispetto ai 44,1 kHz di un file musicale riduce la memoria richiesta di quasi tre volte senza perdita di intelligibilità.

Fase due: lo spettrogramma log-Mel

  • Finestra di analisi = 25 ms (400 campioni)
  • Passo fra finestre = 10 ms (160 campioni)
  • Canali di frequenza sulla scala Mel = 80
  • 30 secondi di audio = 3.000 fotogrammi x 80 canali

La scala Mel distribuisce le frequenze secondo la percezione dell'orecchio umano, più fine sulle basse frequenze e più grossolana sulle alte. Il logaritmo delle energie comprime la dinamica, così che un sussurro e una voce forte producano rappresentazioni confrontabili.

Fase tre: segmentazione in finestre da 30 secondi

  • Lunghezza di ogni segmento = 30 secondi
  • Sovrapposizione fra segmenti consecutivi = 5 secondi
  • Numero di segmenti per un file di durata D = circa D / 25 secondi
  • Esempio: 10 minuti = 600 s => circa 24 segmenti

Whisper è stato addestrato su finestre di esattamente trenta secondi, quindi le registrazioni più lunghe vanno spezzate. La sovrapposizione di cinque secondi evita che una parola tagliata al confine fra due segmenti venga persa o duplicata: il testo delle zone sovrapposte viene riconciliato confrontando i token e i relativi riferimenti temporali.

Fase quattro: decodifica autoregressiva

L'encoder trasforma lo spettrogramma in una rappresentazione astratta, poi il decoder genera il testo un token alla volta, usando a ogni passo tutti i token già prodotti. Il modello Whisper small conta circa 244 milioni di parametri. In precisione a 32 bit occuperebbe quasi un gigabyte, mentre la quantizzazione a 8 bit ne riduce l'ingombro a circa un quarto, rendendo l'esecuzione praticabile nel browser.

Tempi di elaborazione attesi

DispositivoRapporto indicativo tempo di elaborazione / durata audio
Desktop recente con CPU a 8 o più coreCirca 0,5x - 1x
Portatile di fascia mediaCirca 1x - 2x
Dispositivo datato o in risparmio energeticoOltre 2x

I valori sono indicativi e dipendono dal numero di core, dalla memoria disponibile e dal surriscaldamento del processore nelle elaborazioni prolungate. Per registrazioni molto lunghe conviene tenere il dispositivo collegato all'alimentazione e chiudere le altre schede.

⚖️ Riferimenti Normativi 2026
  • Regolamento UE 2016/679 (GDPR), articolo 4 — la voce è un dato personale, perché consente di identificare direttamente o indirettamente la persona che parla.
  • Regolamento UE 2016/679, articolo 9 — le registrazioni possono contenere categorie particolari di dati, come informazioni sulla salute, sulle opinioni politiche o sulle convinzioni religiose.
  • Regolamento UE 2024/1689 (AI Act) — disciplina i sistemi di intelligenza artificiale e vieta o limita alcuni usi del riconoscimento delle emozioni e della categorizzazione biometrica.
  • Codice penale, articolo 617-septies — punisce la diffusione di riprese o registrazioni fraudolente di conversazioni con finalità di recare danno alla reputazione.
  • Legge 3 febbraio 1963 n. 69, articolo 2 — tutela il segreto professionale del giornalista sulle fonti fiduciarie.
  • Codice di deontologia medica — impone la riservatezza sulle informazioni del paziente, comprese quelle contenute nelle dettature di referti.

Registrare una conversazione è lecito?

La giurisprudenza italiana considera lecita la registrazione di una conversazione da parte di chi vi partecipa, anche senza il consenso degli altri interlocutori, e ne ammette l'uso a fini difensivi. Resta invece illecita l'intercettazione di conversazioni fra terze persone a cui non si partecipa. La diffusione del contenuto è un atto distinto dalla registrazione e richiede una base giuridica autonoma, soprattutto quando il contenuto riguarda dati personali di altri.

Buone pratiche per interviste e ricerca

  • Informativa preventiva: nelle interviste di ricerca e giornalistiche è buona prassi informare l'intervistato della registrazione e della successiva trascrizione.
  • Pseudonimizzazione: nelle trascrizioni destinate a pubblicazione o condivisione vanno rimossi o sostituiti nomi e dettagli identificativi non necessari.
  • Conservazione limitata: il file audio originale va conservato solo per il tempo necessario e poi eliminato, in coerenza con il principio di limitazione della conservazione.
  • Revisione umana: una trascrizione automatica può contenere errori su nomi propri, numeri e termini tecnici, che vanno controllati prima dell'uso.

Attenzione: la trascrizione automatica non è un verbale e non ha valore certificativo. Per usi processuali o amministrativi la trascrizione va verificata sulla registrazione originale e, quando la legge lo richiede, redatta o asseverata da un soggetto abilitato.

👥 Casi Pratici ed Esempi Reali

I casi seguenti sono stati riprodotti con lo strumento su una registrazione di prova di 9 secondi, generata con la sintesi vocale del sistema operativo.

Caso 1: trascrizione di un annuncio parlato

  • Audio: «The meeting of the condominium assembly is scheduled for Monday at six in the afternoon...»
  • Testo restituito: «The meeting of the Condominium Assembly is scheduled for Monday at 6 in the afternoon.»
  • «forty eight thousand euros» trascritto come «€48,000»

Il testo è corretto, ma il modello normalizza i numeri detti a voce in cifre e simboli. È un dettaglio importante quando si trascrivono importi o date: vanno sempre verificati sull'audio.

Caso 2: tempi di elaborazione

  • Primo avvio (con scaricamento del modello): 31 secondi
  • Seconda trascrizione dello stesso file, modello già in memoria: 14 secondi
  • Rapporto fra tempo di calcolo e durata dell'audio: circa 1,5

Il modello Whisper small quantizzato pesa circa 250 MB (92 MB l'encoder, 157 MB il decoder) e resta nella cache del browser. Su un portatile meno potente o su smartphone i tempi si allungano sensibilmente.

Caso 3: sottotitoli SRT

  • 1 — 00:00:00,000 --> 00:00:05,440 — prima frase
  • 2 — 00:00:05,440 --> 00:00:09,000 — seconda frase

I sottotitoli seguono i segmenti individuati dal modello, uno per frase. Per un video pubblicato conviene rivederli in un programma di montaggio: le durate vanno adattate alla velocità di lettura e le righe troppo lunghe spezzate.

Domande Frequenti (FAQ)

Quali formati audio sono supportati?

Sono supportati i formati che il browser sa decodificare in modo nativo, tra cui MP3, WAV, M4A, OGG e WEBM, oltre alla traccia audio di molti file video. Il file viene convertito localmente in un segnale mono a 16 kHz prima della trascrizione. Se un formato non viene riconosciuto, conviene convertirlo in MP3 o WAV con un programma installato sul computer.

La qualità della registrazione incide sul risultato?

In modo determinante. Rumore di fondo, riverbero, voci sovrapposte e microfoni lontani aumentano gli errori. I risultati migliori si ottengono con un microfono vicino a chi parla, in un ambiente silenzioso e con un solo interlocutore alla volta. Aumentare il volume di un file registrato male non recupera l'informazione persa.

Lo strumento distingue chi sta parlando?

No. Whisper produce la trascrizione del parlato con i riferimenti temporali, ma non attribuisce le frasi ai singoli interlocutori. La separazione dei parlanti richiede un modello aggiuntivo. Per interviste e riunioni conviene annotare a mano gli interventi partendo dai tempi del file SRT.

Posso tradurre l'audio in un'altra lingua?

Il modello Whisper supporta nativamente la traduzione verso l'inglese a partire da molte lingue. Per ottenere un testo in una lingua diversa dall'inglese conviene prima trascrivere nella lingua originale e poi usare il traduttore del portale, anch'esso eseguito interamente nel browser.

Cos'è il file SRT e a cosa serve?

È un formato di sottotitoli testuale in cui ogni frase è associata a un tempo di inizio e di fine. È compatibile con i principali lettori video e con le piattaforme di pubblicazione. È utile anche fuori dal video, perché permette di ritrovare rapidamente nella registrazione il punto esatto in cui è stata detta una frase.

Perché la trascrizione a volte ripete la stessa frase?

È un comportamento noto dei modelli autoregressivi nelle parti di silenzio prolungato o di rumore costante, in cui il decoder tende a riprodurre l'ultima frase generata. Tagliare i lunghi silenzi prima della trascrizione riduce molto il fenomeno. Le ripetizioni vanno comunque eliminate in fase di revisione.

🔒 Elaborazione 100% Client-Side / Zero-Backend e conformità GDPR

Il trascrittore è un'applicazione 100% client-side, a infrastruttura zero-backend. Il file audio viene decodificato, ricampionato e trascritto interamente dal browser sul tuo dispositivo, all'interno di un Web Worker isolato. L'unico traffico di rete è il download iniziale del modello Whisper da un archivio pubblico: un flusso in entrata che non contiene nulla di tuo. Le registrazioni, le voci e il testo trascritto, con i nomi, i codici fiscali, gli IBAN o i dati sanitari eventualmente pronunciati, non vengono mai caricati su server.

La voce è un dato personale e le registrazioni contengono spesso dati di terzi e categorie particolari di dati. Evitare ogni trasmissione è quindi il modo più solido per rispettare il Regolamento UE 2016/679 (GDPR). Non c'è un fornitore esterno che tratti l'audio, non avvengono trasferimenti verso Paesi terzi e nessuna registrazione può essere riutilizzata per addestrare modelli. L'architettura attua i principi di privacy by design e privacy by default dell'articolo 25 e la minimizzazione dell'articolo 5.