Corrispondente di Liste Fuzzy

Reconciliare un’esportazione CRM con un foglio di calcolo di clienti fatturati, o abbinare nomi di fornitori da due ERP diversi, quasi sempre si interrompe su piccole differenze, “Acme Corp.” vs “ACME Corporation” vs “acme corp”. Incolla entrambe le liste, imposta una soglia di somiglianza e lo strumento suggerisce il miglior candidato nella lista B per ogni voce nella lista A, contrassegnando quelle sotto soglia per una revisione manuale.

Come abbinare due liste disordinate

  1. 1

    Incolla la lista A

    Un elemento per riga, nomi dei clienti, codici prodotto, indirizzi.

  2. 2

    Incolla la lista B

    Il pool di candidati. Differenze in maiuscole, spazi e refusi sono OK.

  3. 3

    Imposta una soglia

    Percentuale di somiglianza sopra la quale un abbinamento è accettato (70% è un valore predefinito sensato).

  4. 4

    Leggi il rapporto

    Ogni elemento A è abbinato al miglior candidato B e a un punteggio di fiducia. Gli elementi sotto soglia sono contrassegnati per revisione.

Come viene misurata la somiglianza

Lo strumento utilizza similar_text di PHP (un punteggio di sottosequenza comune più lunga) e riporta il risultato come percentuale. Maggiore è meglio; un abbinamento esatto è 100%.

Soglia Comportamento
≥ 95% Quasi identico, solo differenze in maiuscole o spazi
80–94% Refusi, punteggiatura mancante, suffissi troncati
60–79% Cambiamenti nell’ordine delle parole, abbreviazioni vs forme complete
< 60% Probabilmente non è un vero abbinamento, rivedere manualmente

Suggerimenti

  • Normalizza prima se conosci il rumore comune: minuscole, rimuovi la punteggiatura, riduci gli spazi bianchi. Otterrai punteggi più precisi.
  • Rimuovi i suffissi aziendali (“Inc”, “Ltd”, “GmbH”) se appaiono in modo incoerente in una lista ma non nell’altra.
  • Dividi indirizzi lunghi, abbinare “via + città” separatamente è migliore che abbinare una riga concatenata.
  • Fai attenzione ai casi uno-a-molti. Lo strumento sceglie il miglior abbinamento B per ogni voce A; non impedisce che lo stesso B corrisponda a più righe A.

Quando utilizzare un algoritmo più rigoroso

Per grandi lavori di deduplicazione, la distanza di Levenshtein o Jaro–Winkler superano similar_text, specialmente sui nomi dove la posizione dei caratteri è importante. Se l’abbinamento fuzzy influisce sulla fatturazione o sulle fusioni, controlla a campione 20 coppie casuali prima di fidarti dell’output su larga scala.

Domande frequenti

Il 70% cattura la maggior parte degli abbinamenti legittimi mentre segnala le vere mancanze. Stringi a 85% se la lista B è pulita e non puoi permetterti falsi positivi; allenta a 55% se entrambe le liste sono disordinate e prevedi di rivedere tutto manualmente.

Sì, ma normalizza prima, rimuovi spazi, trattini e prefissi di codice paese, minuscole le email. L’abbinamento fuzzy su valori grezzi riporterà punteggi bassi per voci strutturalmente identiche.

Internamente lo strumento converte in minuscole entrambi i lati prima del confronto, quindi “Apple” e “apple” ottengono 100%.

Sì, l’abbinamento viene eseguito lato server, quindi le tue due liste vengono inviate allo strumento per essere confrontate. Vengono elaborate in memoria per quella singola richiesta e non vengono conservate né registrate in seguito.

Strumenti correlati

Strumento disponibile in altre lingue