SU
StrumentiUtili.it
Micro-strumenti gratuiti 100% client-side
← Torna alla categoria PDF & Scanner
📄 Gestione Documenti

Comprimi e Converti PDF

Riduci il peso dei tuoi PDF scansionati o converti documenti Word e immagini in formato PDF. Elaborazione sicura e 100% offline.

Immagini → PDF

Unisci JPG/PNG in un unico PDF.

Trascina immagini o sfoglia

Compressore PDF

Riduce il peso ricampionando le pagine.

Trascina il PDF o sfoglia

Converti DOCX → PDF

Estrai il testo da Word e genera un PDF.

Trascina file .docx o sfoglia

Affidabilità di questo strumento

📅 Metodi di compressione e conversione verificati a

👨‍💻 Chi lo ha realizzato

Sviluppato e mantenuto da ingegneri software indipendenti. Motore di calcolo basato esclusivamente sulle normative ufficiali vigenti. (Zero-Backend: nessun dato viene inviato a server esterni).

🔒 Privacy Zero-Backend

Immagini, PDF e documenti Word vengono letti ed elaborati nel browser: nessun file viene inviato a server. Le librerie di conversione sono scaricate da CDN al primo utilizzo e non ricevono i documenti (GDPR, artt. 5 e 25).

📚 Fonti tecniche e normative

ISO 32000 (formato PDF) e ISO 19005 (PDF/A), ISO/IEC 10918 (JPEG), D.Lgs. 82/2005 (CAD) e Linee guida AgID sulla formazione del documento informatico, D.Lgs. 36/2023 art. 25 sulle piattaforme di approvvigionamento digitale, librerie pdf.js, pdf-lib e Mammoth.js.

Trattato Tecnico-Normativo: Compressione Raster/Vettoriale, Conversione OpenXML DOCX e Protezione dei Dati Sensibili (GDPR)

La riduzione del peso digitale dei file Portable Document Format (PDF) e la conversione inter-formato di documenti di testo Microsoft Word (.docx) ed immagini raster (JPEG, PNG) costituiscono operazioni nevralgiche per l'interfaccia con i portali della Pubblica Amministrazione, per i sistemi di Posta Elettronica Certificata (PEC) e per il deposito telematico negli uffici giudiziari. L'adozione di un'architettura Zero-Backend (Serverless Client-Side) garantisce la totale conformità al Regolamento Generale sulla Protezione dei Dati (GDPR - Regolamento UE 2016/679), eliminando i rischi di data breach legati all'upload remoto. Il presente trattato analizza dettagliatamente l'inquadramento normativo, le formule algebriche di compressione e ricampionamento, la decodifica dell'architettura OpenXML e la risoluzione delle casuistiche reali in ambito tributario e concorsuale.

🏛️ Inquadramento Normativo: Codice Amministrazione Digitale (CAD), Limiti PEC/AgID e Conformità GDPR

L'interazione telematica con le strutture pubbliche, i portali di gara (e-Procurement), l'Agenzia delle Entrate e il Processo Telematico (PCT/PAT) è regolamentata in Italia dal Codice dell'Amministrazione Digitale (CAD - D.Lgs. 82/2005) e dalle Linee Guida AgID sulla formazione, gestione e conservazione dei documenti informatici. I gestori di Posta Elettronica Certificata e i gateway di ricezione ministeriali impongono limiti di dimensione agli allegati, diversi da un gestore all'altro: per la PEC sono frequenti tetti complessivi fra 30 e 100 MB per messaggio, mentre le piattaforme di gara indicano spesso un limite per singolo file. Il superamento di tali soglie determina il rigetto telematico automatico dell'invio, con conseguenti decadenze dai termini perentori di gara o di deposito processuale.

Al contempo, il trattamento dei documenti inoltrati sconta il ferreo regime del GDPR. L'uso di convertitori e compressori PDF commerciali ospitati in cloud genera un trasferimento di dati verso server remoti di terze parti. Questo innesca l'obbligo formale di censire il trattamento nei Registri ex Art. 30 GDPR, di sottoscrivere un Data Processing Agreement (DPA) ex Art. 28 GDPR con il provider e di condurre una Valutazione d'Impatto sulla Protezione dei Dati (DPIA ex Art. 35 GDPR) per accertare i rischi inerenti alla trasmissione online di informazioni finanziarie o sanitarie.

L'architettura 100% Client-Side di questo applicativo concretizza il principio della Data Protection by Design e by Default (Articolo 25 GDPR). L'intero ciclo computazionale — dalla lettura del file sorgente, alla decompressione dei Flate Stream, al ricampionamento dei raster via Canvas, fino alla ricostruzione del binario tramite `pdf-lib` — avviene esclusivamente all'interno della memoria RAM isolata del browser dell'utente. Senza alcun caricamento remoto (Zero-Upload), viene a cadere la qualifica giuridica di Data Processor in capo al gestore del sito, esonerando il professionista da qualsiasi vincolo DPA o responsabilità sanzionatoria ex Articolo 83 del GDPR per fuga indebita di dati aziendali o clinici.

⚙️ Meccanica e Formule: Rasterizzazione PDF.js, Quantizzazione DCT JPEG, Decodifica OpenXML e Geometria Punti

1. Algoritmo di Compressione tramite Rasterizzazione e Quantizzazione DCT

La riduzione volumetrica dei documenti PDF scansionati ad alta risoluzione opera attraverso un processo di ri-rasterizzazione e quantizzazioneLossy gestito dal modulo `PDF.js` unitamente alle API HTML5 Canvas. Il motore decodifica le pagine vettoriali e disegna ogni pagina su una tela in memoria a 1,5 volte la dimensione in punti, pari a circa 108 DPI ($DPI_{\text{target}} = 72 \times 1{,}5$), e mantiene nel file compresso il formato originale della pagina:

$$\text{Pixel}_{\text{larghezza}} = \left( \frac{\text{Punti}_{\text{larghezza}}}{72} \right) \times DPI_{\text{target}}$$

La tela viene successivamente serializzata in un Blob `image/jpeg` applicando un coefficiente di qualità $Q \in [0.1, 1.0]$. L'algoritmo JPEG comprime il segnale cromatico dividendo la matrice di pixel in blocchi 8x8 ed eseguendo la Trasformata Discreta del Coseno (DCT):

$$F(u,v) = \frac{1}{4} C(u) C(v) \sum_{x=0}^{7} \sum_{y=0}^{7} f(x,y) \cos\left[\frac{(2x+1)u\pi}{16}\right] \cos\left[\frac{(2y+1)v\pi}{16}\right]$$

La successiva fase di quantizzazione divide i coefficienti $F(u,v)$ per una matrice di quantizzazione scalata sul parametro $Q$, azzerando le frequenze spaziali ad alta variazione impercettibili all'occhio umano e riducendo drasticamente il peso in kbyte. L'efficienza globale viene espressa dal Rapporto di Compressione ($CR$):

$$CR = \frac{\text{Dimensione}_{\text{Sorgente}}}{\text{Dimensione}_{\text{Compressa}}}$$

2. Decodifica dell'Architettura OpenXML DOCX (Mammoth.js)

I file Microsoft Word con estensione `.docx` costituiscono in realtà archivi compressi ZIP contenenti la struttura stilistica OpenXML (`word/document.xml`). La libreria client-side `Mammoth.js` decomprime il pacchetto in RAM, analizza il file XML sottostante, estrae l'albero sintattico astratto (AST) ed estrae il solo testo dei paragrafi (``, ``, ``), senza grassetti, tabelle, immagini o intestazioni. La libreria `pdf-lib` impagina poi il testo in Helvetica 11 punti su pagine A4 (595,28 × 841,89 punti), andando a capo sulla larghezza utile e iniziando una nuova pagina ogni 50 righe. Le lettere di alfabeti non supportati dal font, come «Ș», diventano la lettera base; i simboli non stampabili diventano «?».

3. Vettorializzazione e Proiezione di Immagini (JPG/PNG → PDF)

Nel modulo Immagini → PDF, le immagini caricate (JPG, PNG) vengono decodificate dal browser e incorporate nel PDF rettificando la scala in punti tipografici ($1\text{ pt} = 1/72\text{ pollici}$):

$$\text{Larghezza}_{\text{pt}} = \text{Pixel}_{\text{larghezza}} \times \frac{72}{DPI_{\text{sorgente}}}$$

Ogni immagine viene centrata in una pagina A4, verticale o orizzontale secondo la forma dell'immagine, con un margine di 20 punti e senza alterarne le proporzioni.

📊 Casuistica Reale: Bando di Gara Pubblica PA e Conversione Massiva di Referti Clinici

Caso 1: Superamento del Blocco Dimensionale PEC per Bando di Gara Pubblica.
Un'impresa di costruzioni deve caricare sulla piattaforma telematica della stazione appaltante un allegato composto da planimetrie scansionate a 300 DPI, mentre la piattaforma accetta file fino a una dimensione massima indicata nel disciplinare.

Il direttore tecnico carica il file PDF nell'area "Compressore PDF" dell'applicativo e imposta il parametro di qualità sul valore `0.6`. Il motore client-side ricampiona le pagine scansionate applicando la quantizzazione DCT.

  • Risoluzione di partenza delle scansioni: 300 DPI
  • Risoluzione dopo la compressione: circa 108 DPI, con qualità JPEG 0,6
  • Riduzione del numero di pixel per pagina: circa l'87% ($1 - (108/300)^2$)

Il peso finale dipende dal contenuto delle pagine; il compressore mostra la dimensione prima e dopo e non scarica il file se non risulta più leggero. Prima di caricarlo va verificata la leggibilità delle quote e dei dettagli più piccoli delle planimetrie.

Caso 2: Conversione Massiva di Referti DOCX/JPG in Archivio Sanitario Unificato (Art. 9 GDPR).
Un laboratorio di analisi cliniche deve trasformare in PDF alcuni referti redatti in Word (`.docx`) e le relative scansioni in `.jpg`. Caricare questi file su portali di conversione gratuiti comunicherebbe dati sanitari a un fornitore esterno senza le garanzie richieste dal GDPR.

Sfruttando i moduli "DOCX → PDF" e "Immagini → PDF" operanti al 100% nel browser locale, la struttura converte un documento Word per volta e unisce le scansioni di ciascun paziente in un PDF, caricando solo le immagini di quel paziente. I dati di salute non attraversano la rete; la conversione DOCX mantiene solo il testo, quindi per referti con tabelle o loghi è preferibile l'esportazione PDF del programma di videoscrittura.

👥 Casi Pratici ed Esempi Reali

I casi seguenti sono stati riprodotti con gli strumenti della pagina su file di prova; pesi e formati sono quelli misurati sui file scaricati.

Caso 1: foto di un documento e di un logo in un unico PDF

  • File: una foto JPG 1920 × 1537 px e un PNG 400 × 300 px
  • Risultato: PDF di 2 pagine A4 orizzontali (842 × 595 punti), 300 KB

Entrambe le immagini sono più larghe che alte, quindi le pagine sono orizzontali. Per una carta d'identità fotografata in verticale la pagina sarebbe verticale.

Caso 2: compressione del PDF appena creato

  • Qualità 0,7, pagine rese a circa 108 DPI
  • Da 300 KB a 140 KB (-53%)
  • Formato delle pagine invariato: A4 orizzontale

Il formato di stampa resta quello dell'originale, così il documento compresso si stampa alle stesse dimensioni.

Caso 3: PDF di testo già leggero

  • Referto di 2 pagine generato da un programma: 1 KB
  • Versione compressa come immagini: 27 KB
  • Esito: «il file è già ottimizzato, usa l'originale»; nessun download

I PDF testuali contengono solo caratteri e font: trasformarli in immagini li appesantisce e toglie il testo selezionabile.

Caso 4: verbale di assemblea da Word a PDF

  • Paragrafo di oltre 330 caratteri: ripartito su 4 righe entro i margini
  • «Ștefan Popescu» diventa «Stefan Popescu»; la freccia «→» diventa «?»

Prima di inviare il PDF conviene rileggere nomi stranieri e simboli: se il documento contiene frecce, emoji o alfabeti non latini, esporta il PDF direttamente da Word.

⚠️ FAQ, Risoluzione Anomalie Software e Limiti Tecnologici (OOM V8 e Layout Shift OpenXML)

Esaurimento della Memoria V8 e Arresto Anomalo (Out of Memory - OOM):
La manipolazione di file PDF di dimensioni estese (es. oltre 200 MB) all'interno del browser è limitata dall'allocazione di memoria dell'heap del motore JavaScript (es. V8 di Chrome). Istanziare l'intero albero degli oggetti PDF e decodificare contemporaneamente decine di pagine raster ad alta risoluzione in un unico `ArrayBuffer` continuo può saturare la RAM allocabile, causando il crash imprevisto della scheda browser (*OOM*). Per mitigare questo limite su dispositivi mobili o pc datati, si raccomanda di ridurre il fattore di qualità a `0.5` o di processare il documento dividendo preventivamente le sezioni tramite lo strumento "Unisci e Dividi".

Perdita del Testo Vettoriale nella Compressione PDF:
È fondamentale comprendere che il processo di compressione via ricampionamento raster decodifica la pagina vettoriale trasformandola in un'immagine ad alta efficienza. Se il file PDF originale conteneva testo selezionabile e ricercabile, la compressione raster convertirà tali caratteri in pixel. Qualora sia indispensabile mantenere il testo selezionabile per le funzioni di copia-incolla o per la conservazione sostitutiva ISO 19005 (PDF/A), si raccomanda di conservare la versione originale o di effettuare la compressione agendo esclusivamente sugli stream di immagini interni tramite software desktop dedicati.

Alterazioni di Layout nella Conversione DOCX (OpenXML Shift):
La conversione di documenti Word (`.docx`) basata sulla libreria Mammoth.js estrae soltanto il testo dei paragrafi: titoli, grassetti, elenchi puntati, tabelle, immagini, intestazioni e piè di pagina non vengono riprodotti. Qualora il file Word contenga impaginazioni grafiche complesse su più colonne o forme vettoriali avanzate, il documento PDF generato potrebbe mostrare un riallineamento del layout. In tali scenari, è preferibile esportare il file direttamente da Microsoft Word o LibreOffice tramite la funzione nativa "Salva come PDF".

Responsabilità e Sanzioni GDPR per Fuga di Dati Aziendali (Articolo 83):
L'upload involontario o non autorizzato di contratti secretati, bilanci non pubblicati o dati personali su server gratuiti terzi espone l'operatore alle sanzioni pecuniarie previste dall'Articolo 83, paragrafo 5 del GDPR: fino a 20 milioni di euro o fino al 4% del fatturato globale annuo. L'impiego della nostra suite 100% client-side azzera categoricamente questo rischio eliminando la trasmissione remota dei file.

Domande Frequenti (FAQ)

Perché il PDF compresso non viene scaricato?

Perché non risultava più leggero dell'originale. Succede con i PDF creati da programmi di scrittura o gestionali, che contengono testo e non immagini.

La compressione riduce la qualità di stampa?

Le pagine vengono rese a circa 108 DPI: il testo resta leggibile, ma dettagli minuti come note a piè di pagina di disegni tecnici o firme sottili possono perdere nitidezza.

Posso convertire un PDF in Word?

No, questo strumento converte da Word a PDF e crea PDF da immagini e PDF compressi. Per estrarre il testo da un PDF puoi usare l'Assistente documenti.

I file vengono caricati su un server?

No. Tutte le conversioni avvengono nel browser e i file restano sul dispositivo.