Estrazione Testo da Immagini e PDF (OCR)
Estrai testo da foto o PDF direttamente nel browser con elaborazione 100% privata.
Formati: immagini (JPG, PNG, WEBP) e PDF. Di un PDF vengono elaborate tutte le pagine, una alla volta.
Risoluzione: per il testo stampato servono circa 300 punti per pollice: una scansione a 100 DPI produce errori sistematici sui numeri e sulle lettere simili. Le pagine dei PDF vengono convertite automaticamente a 300 DPI.
Foto da smartphone: inquadra il foglio da vicino, con luce uniforme e senza ombre; se la foto è storta, raddrizzala prima con lo Scanner Documenti.
Scrittura a mano: il motore riconosce il testo stampato: il corsivo non viene letto in modo affidabile.
Perché conta: il modello usa un dizionario per scegliere fra caratteri ambigui: indicare la lingua giusta riduce gli errori su accenti e parole comuni.
Più lingue insieme: l'opzione «Italiano + Inglese + Spagnolo» serve ai documenti misti, ma scarica tre modelli e rallenta il riconoscimento: se il documento è in una sola lingua, scegli quella.
Primo avvio: il modello viene scaricato la prima volta che usi una lingua (alcuni megabyte) e poi resta nella cache del browser.
Tempi: qualche secondo per pagina su un computer, di più su smartphone. La riga di stato indica la fase e, per i PDF, la pagina in corso.
Risultato: il testo compare nel riquadro sottostante ed è modificabile: correggi gli errori prima di esportarlo.
Documenti con più pagine: il testo di ogni pagina è preceduto da un separatore «--- Pagina n ---».
Layout: il riconoscimento restituisce testo semplice: tabelle e colonne perdono la disposizione originale.
Correggi prima di esportare: i caratteri ambigui più frequenti sono 0/O, 1/l/I, 8/B e 5/S: controlla codici fiscali, partite IVA, IBAN e importi.
TXT e DOCX: conservano il testo così com'è, comprese lettere accentate e simboli.
PDF: usa il font Helvetica, che copre l'alfabeto latino occidentale: le lettere di altri alfabeti vengono ricondotte alla lettera base (č diventa c) o sostituite con «?».
Niente livello invisibile: l'esportazione in PDF crea un documento di solo testo, non una copia dell'originale con il testo sovrapposto.