Tabella PDF in CSV

Tabella PDF in CSV

Scegli un PDF basato su testo

Trasforma semplici tabelle PDF basate su testo in file CSV o TSV senza inviare il PDF a un server. Il browser raggruppa i frammenti in base alla posizione visibile, cerca colonne ricorrenti e prova a escludere il testo discorsivo. Controlla ogni tabella rilevata prima di scaricarla: il riconoscimento è prudente e approssimativo, non garantisce righe e colonne perfette nei layout complessi.

Come estrarre una tabella PDF in CSV

  1. 1

    Scegli un PDF basato su testo

    Seleziona un PDF di massimo 20 MiB e 150 pagine. Le scansioni composte solo da immagini devono prima essere sottoposte a OCR.

  2. 2

    Rileva le tabelle nel browser

    Lo strumento usa le coordinate visibili del testo, comprese rotazione e CropBox, e cerca posizioni ricorrenti per righe e colonne.

  3. 3

    Controlla e scegli il formato

    Seleziona le tabelle da conservare e verifica le righe. Scegli virgola, punto e virgola o tabulazione, oltre al marcatore UTF-8 e alla protezione delle formule.

  4. 4

    Scarica ogni tabella scelta

    Ogni tabella selezionata viene scaricata localmente come file CSV o TSV separato. Le tabelle non vengono unite tra pagine.

Che cosa può dedurre il rilevatore

Di solito un PDF non memorizza una tabella come una griglia di celle, ma come frammenti di testo posizionati tramite coordinate. Lo strumento raggruppa i frammenti sulla stessa riga visibile, unisce quelli vicini e conserva le posizioni di colonna che si ripetono in più righe. Può separare più tabelle regolari nella stessa pagina e scartare il testo a colonna singola quando lo schema è chiaro.

La rotazione e lo spostamento della CropBox sono inclusi nel calcolo. Nelle righe prevalentemente da destra a sinistra, l’ordine segue la direzione indicata dal livello di testo del PDF. Celle unite o su più righe, layout decorativi e direzioni miste possono comunque richiedere correzioni.

Layout del PDF Risultato probabile Che cosa controllare
Esportazione pulita con colonne ricorrenti In genere il caso migliore Intestazioni, decimali e celle vuote
Valore mancante in una riga regolare Cella vuota nella colonna dedotta Che sia rimasta vuota la colonna corretta
Cella unita o con testo su più righe Il testo può dividersi, spostarsi o unirsi Confronta l’anteprima con il PDF
Più tabelle regolari in una pagina Possono essere rilevate separatamente Seleziona solo quelle necessarie
Pagina acquisita come immagine Nessuna tabella rilevata Esegui prima l’OCR

Oltre ai limiti di 20 MiB e 150 pagine esistono soglie di sicurezza per frammenti e caratteri. Un PDF molto frammentato può quindi fermarsi prima.

CSV, TSV e sicurezza dei fogli di calcolo

Gli output con virgola o punto e virgola usano il delimitatore scelto; la tabulazione produce un TSV. I record terminano con CRLF. Un campo con il delimitatore attivo, virgolette, ritorno a capo o nuova riga viene racchiuso tra virgolette doppie, e le virgolette interne vengono raddoppiate. Sono le regole descritte in RFC 4180, adattate al delimitatore selezionato.

La protezione dalle formule è attiva per impostazione predefinita. Se una cella inizia, dopo eventuali spazi, con =, +, - o @, comprese le varianti a larghezza intera supportate, viene aggiunto un apostrofo. Il foglio di calcolo tenderà a trattarla come testo, ma il valore cambia. Disattivando la protezione si conserva il testo estratto; aprire contenuti simili a formule provenienti da PDF non affidabili può però essere pericoloso. La guida OWASP sulla CSV Injection spiega perché nessuna misura è universale in tutti i programmi e dopo un nuovo salvataggio.

Il marcatore UTF-8 facoltativo aiuta alcuni programmi a riconoscere i caratteri non latini. Controlla il file prima di usarlo per contabilità, report o importazioni automatiche.

Stato privato tra i passaggi

Il PDF, le tabelle rilevate e le scelte restano nel browser. Vengono conservati in uno spazio locale limitato per un massimo di 30 minuti, così i tre passaggi possono continuare, e ogni download viene creato localmente. Lo strumento non carica nulla. Ricominciare elimina il lavoro corrente; il browser può cancellare i dati prima per le proprie regole di archiviazione o in navigazione privata.

Domande frequenti

No. Lettura, rilevamento e creazione di CSV o TSV avvengono nel browser. Il lavoro resta nello spazio locale limitato per un massimo di 30 minuti e ogni download è locale.

Non da solo. Una scansione formata soltanto da immagini non contiene un livello di testo da posizionare. Esegui prima l’OCR e usa poi il PDF testuale ottenuto.

Puoi scegliere virgola, punto e virgola o tabulazione. I record usano CRLF; i campi con delimitatore, virgolette, ritorno a capo o nuova riga vengono racchiusi tra virgolette, e quelle interne raddoppiate. La tabulazione produce .tsv.

Aggiunge un apostrofo alle celle che, dopo eventuali spazi, iniziano come una formula con =, +, - o @. È attiva per impostazione predefinita e modifica tali valori. Disattivala solo se serve il testo esatto e il PDF è affidabile.

Il rilevamento usa le posizioni del testo, non celle reali. Testo su più righe, celle unite, spazi insoliti e direzioni miste possono spostare i valori. Anche con rotazione e CropBox normalizzate, confronta ogni anteprima con il PDF.

Può rilevare separatamente più tabelle regolari in una pagina. Ogni tabella selezionata viene scaricata in un file proprio. Non unisce una tabella che prosegue nella pagina successiva.

Strumenti correlati