Deduplicatore CSV

I duplicati si infiltrano nelle esportazioni CSV in modi fastidiosi: consegne ripetute di webhook, due report concatenati a mano o un join che ha espanso righe che non ti aspettavi. Questo deduplicatore crea un hash di ogni riga di dati e mantiene solo la prima occorrenza, in modo che l’output preservi il tuo ordine originale delle righe mentre elimina silenziosamente le copie. La riga di intestazione è opzionale: attiva l’interruttore se il tuo file inizia direttamente con i dati.

Come funziona la deduplicazione

  1. 1

    Incolla il CSV

    Includi o escludi la riga di intestazione; usa la casella di controllo per dire allo strumento quale sia.

  2. 2

    Ogni riga viene hashata

    Le righe vengono analizzate in array e un MD5 della loro rappresentazione JSON viene utilizzato come chiave di unicità.

  3. 3

    Il primo visto vince

    La prima riga con un dato hash viene mantenuta. Le righe successive con lo stesso contenuto vengono saltate silenziosamente.

  4. 4

    Intestazione preservata

    Se la modalità intestazione è attivata, la riga 1 viene sempre passata senza essere deduplicata rispetto ai dati.

Cosa conta come duplicato

Il deduplicatore utilizza l’uguaglianza di riga completa. Due righe sono duplicate quando ogni cella corrisponde, posizione per posizione, dopo l’analisi standard del CSV.

Cose che contano ancora come diverse

Riga A Riga B Trattata come
Alice,30,Parigi Alice, 30, Parigi Diversa (spazi extra)
Bob,25 Bob,25, Diversa (cella vuota finale)
"Jane Smith",42 Jane Smith,42 Uguale (la citazione è a livello di parser)
TRUE,1 true,1 Diversa (sensibile al maiuscolo)

Quando una deduplicazione a livello di colonna sarebbe più appropriata

Il confronto di righe complete è rigoroso, il che è solitamente ciò che desideri, ma a volte vuoi effettivamente “una riga per email indipendentemente dalle altre colonne”. In tal caso, usa prima l’Estrattore di Colonne CSV per ridurre il file alla sola colonna chiave, deduplica quella e usa il risultato come ricerca. Oppure ricorri a SQL: SELECT DISTINCT ON (email) * FROM users ORDER BY email, created_at DESC; in PostgreSQL, o un GROUP BY con aggregati MIN() altrove.

Suggerimenti pratici

  • Normalizza prima di deduplicare. Rimuovi gli spazi bianchi e standardizza la capitalizzazione sulle colonne chiave prima, altrimenti ALICE@EXAMPLE.COM e alice@example.com sopravvivranno entrambi.
  • Ordina, poi deduplica, per risultati verificabili. Se hai bisogno di sapere quale copia è stata mantenuta, ordina il CSV in base al tuo preferito criterio di risoluzione (timestamp più recente, ID più basso) prima di eseguire il deduplicatore.
  • Controlla il conteggio delle righe. Usa il Contatore di Righe CSV sull’originale e sull’output per confermare quante righe duplicate sono state rimosse.

Domande frequenti

No, crea hash di righe complete analizzate. Per l’unicità a colonna singola, riduci prima il CSV a quella colonna utilizzando l’Estrattore di Colonne CSV e poi esegui il deduplicatore.

La prima occorrenza nel file. Ordina il CSV in anticipo se desideri che una copia specifica (il record più recente, il ID più basso, ecc.) vinca.

Sì. Le righe vengono analizzate con regole standard del CSV, quindi "Jane, Smith" rimane una singola cella e viene confrontata come tale.

Il CSV viene inviato al nostro server per calcolare la deduplicazione. Non viene archiviato né condiviso e non viene aggiunto al link della pagina.

Strumenti correlati