Ricerca Unicode

Inserisci un carattere misterioso, lo strano spazio bianco incollato dall’utente, un glifo da un’anteprima di font, un’emoji che rompe la tua regex, e la ricerca restituisce il suo punto codice Unicode (U+XXXX) e i byte grezzi UTF-8 in esadecimale, una riga per carattere.

Come identificare un carattere Unicode

  1. 1

    Incolla il carattere

    Puoi incollare un glifo o un'intera stringa, ogni carattere viene analizzato in ordine.

  2. 2

    Leggi il punto codice

    Ottieni la notazione canonica U+, in maiuscolo e riempita di zeri fino ad almeno quattro cifre esadecimali.

  3. 3

    Ispeziona i byte UTF-8

    Vedi la sequenza di 1–4 byte che il carattere occupa su disco o in transito.

  4. 4

    Copia i risultati

    L'output è una tabella in formato CSV (carattere, punto codice, byte UTF-8) che puoi selezionare e incollare in un foglio di calcolo o in una segnalazione di bug.

Tipico lavoro investigativo che puoi fare con una ricerca

La maggior parte dei bug Unicode appare identica sullo schermo. L’unico modo per distinguere uno spazio normale da uno spazio non interruzione, o un apostrofo curvo da un primo, è ispezionare il punto codice.

Problemi comuni che la ricerca risolve

Sembra In realtà è Punto codice
Spazio Spazio non interruzione U+00A0
Spazio Spazio non interruzione stretto U+202F
(niente) Spazio a larghezza zero U+200B
(niente) Unione a larghezza zero U+200D
Apostrofo Apostrofo singolo destro U+2019
Apostrofo Primo (piedi/minuti) U+2032
Trattino Trattino lungo U+2013
Trattino Trattino non interruzione U+2011

Layout dei byte UTF-8 a colpo d’occhio

  • 1 byte, ASCII, U+0000 a U+007F (0xxxxxxx)
  • 2 byte, Supplemento latino, arabo, ebraico (110xxxxx 10xxxxxx)
  • 3 byte, CJK, la maggior parte dei simboli (1110xxxx 10xxxxxx 10xxxxxx)
  • 4 byte, Emoji, script rari (11110xxx 10xxxxxx 10xxxxxx 10xxxxxx)

Se la tua colonna di database ha una lunghezza fissa in byte, un’emoji a 4 byte occuperà quattro slot anche se si rende come un glifo, una comune fonte di bug di troncamento.

Domande frequenti

Di solito sono marcatori BOM (U+FEFF) all’inizio del file o giuntori a larghezza zero erranti da un elaboratore di testi. Incolla uno nella ricerca e ti dirà immediatamente, poi puoi rimuoverli con una semplice ricerca e sostituzione.

Sì. La ricerca itera carattere per carattere, quindi un’intera parola produce una riga per carattere con il suo punto codice e byte UTF-8.

Un punto codice è l’identità astratta di un carattere, U+00E9 è sempre “é” indipendentemente da dove lo memorizzi. UTF-8 è una delle diverse codifiche che trasformano un punto codice in byte; lo stesso “é” è i due byte C3 A9 in UTF-8 ma il singolo byte E9 in Latin-1.

Sì. La ricerca viene calcolata sul nostro server: i caratteri che incolli vengono inviati, analizzati e il loro punto codice e i loro byte UTF-8 vengono restituiti immediatamente. Non conserviamo il testo che invii.

Strumenti correlati

Strumento disponibile in altre lingue