Ricerca Unicode
Inserisci un carattere misterioso, lo strano spazio bianco incollato dall’utente, un glifo da un’anteprima di font, un’emoji che rompe la tua regex, e la ricerca restituisce il suo punto codice Unicode (U+XXXX) e i byte grezzi UTF-8 in esadecimale, una riga per carattere.
Come identificare un carattere Unicode
-
1
Incolla il carattere
Puoi incollare un glifo o un'intera stringa, ogni carattere viene analizzato in ordine.
-
2
Leggi il punto codice
Ottieni la notazione canonica U+, in maiuscolo e riempita di zeri fino ad almeno quattro cifre esadecimali.
-
3
Ispeziona i byte UTF-8
Vedi la sequenza di 1–4 byte che il carattere occupa su disco o in transito.
-
4
Copia i risultati
L'output è una tabella in formato CSV (carattere, punto codice, byte UTF-8) che puoi selezionare e incollare in un foglio di calcolo o in una segnalazione di bug.
Tipico lavoro investigativo che puoi fare con una ricerca
La maggior parte dei bug Unicode appare identica sullo schermo. L’unico modo per distinguere uno spazio normale da uno spazio non interruzione, o un apostrofo curvo da un primo, è ispezionare il punto codice.
Problemi comuni che la ricerca risolve
| Sembra | In realtà è | Punto codice |
|---|---|---|
| Spazio | Spazio non interruzione | U+00A0 |
| Spazio | Spazio non interruzione stretto | U+202F |
| (niente) | Spazio a larghezza zero | U+200B |
| (niente) | Unione a larghezza zero | U+200D |
| Apostrofo | Apostrofo singolo destro | U+2019 |
| Apostrofo | Primo (piedi/minuti) | U+2032 |
| Trattino | Trattino lungo | U+2013 |
| Trattino | Trattino non interruzione | U+2011 |
Layout dei byte UTF-8 a colpo d’occhio
- 1 byte, ASCII, U+0000 a U+007F (
0xxxxxxx) - 2 byte, Supplemento latino, arabo, ebraico (
110xxxxx 10xxxxxx) - 3 byte, CJK, la maggior parte dei simboli (
1110xxxx 10xxxxxx 10xxxxxx) - 4 byte, Emoji, script rari (
11110xxx 10xxxxxx 10xxxxxx 10xxxxxx)
Se la tua colonna di database ha una lunghezza fissa in byte, un’emoji a 4 byte occuperà quattro slot anche se si rende come un glifo, una comune fonte di bug di troncamento.
Domande frequenti
Di solito sono marcatori BOM (U+FEFF) all’inizio del file o giuntori a larghezza zero erranti da un elaboratore di testi. Incolla uno nella ricerca e ti dirà immediatamente, poi puoi rimuoverli con una semplice ricerca e sostituzione.
Sì. La ricerca itera carattere per carattere, quindi un’intera parola produce una riga per carattere con il suo punto codice e byte UTF-8.
Un punto codice è l’identità astratta di un carattere, U+00E9 è sempre “é” indipendentemente da dove lo memorizzi. UTF-8 è una delle diverse codifiche che trasformano un punto codice in byte; lo stesso “é” è i due byte C3 A9 in UTF-8 ma il singolo byte E9 in Latin-1.
Sì. La ricerca viene calcolata sul nostro server: i caratteri che incolli vengono inviati, analizzati e il loro punto codice e i loro byte UTF-8 vengono restituiti immediatamente. Non conserviamo il testo che invii.
Strumenti correlati
Generatore di Font per Instagram
Genera "font" Unicode (grassetto, corsivo, script, monospace, fraktur) da incollare direttamente nella tua bio, nel nome, nelle didascalie e nei commenti su Instagram.
Generatore di Font di Facebook
Trasforma il testo in lettere Unicode in grassetto, corsivo, script e altri stili da copiare in post e commenti di Facebook, nella tua bio e su Messenger.
Generatore di nomi di città
Genera nomi immaginari di città, cittadine, villaggi e capitali per worldbuilding, mappe, giochi, storie e dati fittizi, in una lingua reale o in uno stile inventato.
Validatore di DNI e NIE spagnoli
Controlla nel browser formato e lettera di controllo di un DNI o NIE esistente. Non interroga identità, documenti o registri pubblici.
Simbolo Minore o Uguale
Copia il simbolo ≤ e i simboli di confronto matematico correlati. Include Unicode, entità HTML e markup LaTeX per fogli di calcolo, articoli e pagine web.
Traduttore di emoji
Scrivi un testo in inglese e ogni parola dell'elenco integrato riceve un'emoji. Copia il risultato come testo con emoji incorporate.
Strumento disponibile in altre lingue
- Wyszukiwarka Unicode [PL]
- ค้นหา Unicode [TH]
- Búsqueda de Unicode [ES]
- Unicode検索 [JA]
- بحث يونيكود [AR]
- 유니코드 조회 [KO]
- Tra cứu Unicode [VI]
- Recherche Unicode [FR]
- Unicode-Suche [DE]
- Pencarian Unicode [ID]
- Pesquisa de Unicode [PT]
- Unicode-uppslagning [SV]
- Unicode opzoeken [NL]
- Unicode Lookup [EN]
- Поиск символов Unicode [RU]
- Unicode Arama [TR]
- Unicode 字符查找 [ZH]