Convertitore PDF in HTML

Converti in HTML
Avanti

Questo convertitore legge il testo del tuo PDF e lo racchiude in un file HTML pulito e minimale: una <section> per pagina, un titolo di pagina <h2> e paragrafi <p>. Funziona interamente nel tuo browser con PDF.js, quindi il file non viene mai caricato. Il risultato è HTML semplice, solo testo, che puoi aprire, modificare o incollare in un CMS e poi formattare con il tuo CSS. È pensato per portare il testo di un PDF sul web, non per riprodurre una pagina impaginata.

Come convertire un PDF in HTML

  1. 1

    Seleziona il tuo PDF

    Trascina un PDF con testo nel riquadro o fai clic per cercarlo. Tutto resta nel tuo browser.

  2. 2

    Converti in HTML

    PDF.js legge ogni pagina ed estrae il testo, raggruppando le righe in paragrafi.

  3. 3

    Controlla l'HTML

    Il markup generato compare in un riquadro di anteprima per verificare il risultato.

  4. 4

    Scarica il file

    Salva un unico file `.html` con una sezione per pagina, pronto da modificare o riformattare.

Che aspetto ha il risultato

Il convertitore produce un file HTML5 valido con una struttura minimale:

Elemento Da dove proviene
Struttura <!DOCTYPE html> Un contenitore HTML5 standard con set di caratteri UTF-8
<title> Il nome del file del tuo PDF
<section data-page> Un blocco per ogni pagina del PDF
<h2>Pagina N</h2> Un titolo che segna l’inizio di ogni pagina
<p> Righe di testo raggruppate in paragrafi in base allo spazio verticale

Cosa non fa

È uno strumento di estrazione del testo, non un motore di impaginazione. Di proposito, il risultato non include:

  • Immagini, loghi o figure del PDF.
  • Tabelle, elenchi puntati o elenchi numerati come <table>/<ul>/<ol> HTML.
  • Font, colori, colonne o posizionamento originali.
  • Nessun CSS né stile inline.

Ottieni le parole in ordine di lettura, racchiuse in paragrafi semantici, e nient’altro. Aggiungi il tuo CSS in seguito.

Risultati migliori

  • Usa un PDF con testo (uno in cui puoi selezionare il testo in un lettore). I PDF scansionati o composti solo da immagini non hanno un livello di testo; qui non c’è OCR e per quelle pagine il risultato sarà vuoto.
  • Passa il file attraverso prettier --parser html o un formattatore per sistemare gli spazi prima di fare il commit.
  • Lo stai portando su WordPress? Incolla l’HTML nel blocco codice/HTML, non nell’editor visuale, che lo re-impaginerebbe.

Non è uno strumento di impaginazione

Non aspettarti che l’HTML assomigli al PDF. Il web è fluido, una pagina PDF è fissa. Usa questo strumento quando vuoi il contenuto sul web, poi riformattalo con il CSS del tuo sito.

Domande frequenti

No. Lo strumento estrae il testo e lo inserisce in semplici paragrafi. Font, colori, colonne e posizionamento non vengono riprodotti. Formatta il risultato con il tuo CSS.

No. Viene estratto solo il testo. Immagini, loghi e figure non vengono trasferiti nell’HTML.

Solo se il PDF ha un vero livello di testo. Le pagine scansionate o fotografate sono immagini senza testo selezionabile e qui non c’è OCR, quindi quelle pagine non producono alcun testo.

No. L’intera conversione avviene nel tuo browser con PDF.js. Il PDF non lascia mai il tuo dispositivo, quindi è sicuro per i documenti riservati.

Strumenti correlati

Strumento disponibile in altre lingue