Estrai URL dal testo

Incolla un registro chat, un documento markdown, una conversazione e-mail o un dump HTML grezzo e ottieni un elenco pulito di tutti i link http:// e https:// contenuti. Il matcher elimina la punteggiatura finale, gestisce la sintassi dei link markdown e HTML e rimuove i duplicati esatti, così puoi inviare l’elenco direttamente a un crawler o a uno strumento di archiviazione.

Come estrarre URL

  1. 1

    Incolla la sorgente

    Inserisci il testo o l'HTML. Virgolette, parentesi angolari, sintassi dei link markdown e punteggiatura finale vengono gestite automaticamente.

  2. 2

    Esegui la scansione

    Ogni link `http://` e `https://` viene individuato, la punteggiatura finale viene rimossa e i duplicati esatti vengono eliminati.

  3. 3

    Controlla il conteggio

    Vedi quante URL uniche sono state trovate e l'elenco completo.

  4. 4

    Copia o esporta

    Una URL per riga, pronta per `curl -I`, un archiviatore, un servizio di screenshot o elenchi seed di Screaming Frog.

Cosa conta come URL

La rilevazione delle URL è più difficile di quanto sembri, e questo estrattore segue deliberatamente una regola sicura: riconosce solo i link completi http:// e https://. Tutto il resto resta nel tuo testo.

Forme riconosciute

Forma Esempio
HTTPS assoluto https://example.com/path?q=1
HTTP assoluto http://example.com
Destinazione di un link markdown [text](https://example.com)
href assoluto in HTML href="https://example.com"

Regole di rifinitura

La punteggiatura finale viene rimossa, quindi (https://example.com). diventa https://example.com. Spazi, virgolette, parentesi angolari, parentesi tonde, parentesi quadre, virgole e punti e virgola interrompono la corrispondenza. Una URL con parentesi viene tagliata alla prima parentesi aperta, quindi un titolo stile Wikipedia viene catturato solo fino alla parentesi aperta.

Cosa viene saltato

  • mailto:, tel:, ftp: e qualsiasi altro schema che non sia http o https.
  • I link relativi al protocollo come //cdn.example.com/asset.js.
  • I domini nudi e gli indirizzi con prefisso www. senza schema, come example.com/docs/intro o www.example.com/page.
  • I soli frammenti di ancoraggio come #section e le pseudo-URL JavaScript.

Come vengono gestiti i duplicati

I duplicati esatti vengono rimossi: https://example.com conta una sola volta, non importa quante volte compare, mentre Example.com e example.com restano voci separate. L'elenco mantiene l'ordine di prima comparsa di ogni URL.

Suggerimenti per il post-processing

  • Usa le minuscole per la deduplicazione canonica. Se Example.com e example.com devono contare come un unico host, porta l'output in minuscolo e deduplica di nuovo.
  • Rimuovi i parametri di tracciamento con un pulitore UTM prima di archiviare, altrimenti ti ritrovi con decine di quasi duplicati.
  • Controlla lo stato. Invia l'elenco a un controllo di link rotti per eliminare i 404 prima di adottarlo.

Domande frequenti

Solo se il link corto è scritto con lo schema completo. bit.ly/xyz da solo non viene catturato, mentre https://bit.ly/xyz è trattato come una URL normale. L’estrattore non segue i reindirizzamenti; risolvili separatamente se ti serve la destinazione finale.

Sì, quando l’href è una URL http:// o https:// completa. Il valore viene estratto pulito senza il tag circostante; gli href relativi non vengono catturati.

Vengono mantenuti tali e quali. Se vuoi eliminare utm_* e parametri di tracciamento simili, usa uno strumento di pulizia URL dopo l’estrazione.

No. Il testo viene elaborato durante la richiesta e il contenuto non viene salvato né registrato.

Strumenti correlati

Strumento disponibile in altre lingue