Perché è importante individuare e verificare i dati duplicati prima di intervenire
Un duplicato è un valore o un record che compare più volte secondo un criterio definito. Il criterio va stabilito prima della ricerca: due righe possono essere identiche in ogni colonna, oppure riferirsi alla stessa entità perché condividono un identificatore, come un indirizzo email o un codice prodotto. Se si confronta soltanto il cognome, per esempio, due persone diverse potrebbero essere scambiate per la stessa.
Le ripetizioni non verificate alterano conteggi e analisi. Un cliente presente due volte può gonfiare il numero dei contatti; un ordine importato più volte può far apparire errati i totali di vendita. D’altro canto, eliminare una riga legittima può far perdere informazioni, come una data, una transazione distinta o un aggiornamento dell’anagrafica.
Prima di intervenire, chiarire quale unità si sta confrontando e quale campo la identifica in modo affidabile. È utile chiedersi:
- Qual è la chiave di confronto? Un ID stabile è spesso più significativo di nome e cognome.
- Si cercano valori o righe intere? Una email ripetuta non rende necessariamente identici tutti i dati della riga.
- Quale occorrenza va conservata? La prima riga potrebbe non essere la più aggiornata o completa.
Questa distinzione evita falsi positivi e rende la verifica comprensibile anche a chi consulterà il file in seguito. In un flusso di lavoro prudente, l’evidenziazione è un segnale da esaminare, non un’autorizzazione automatica alla cancellazione.
Evidenziare i duplicati con la formattazione condizionale
La regola predefinita di Excel permette di colorare rapidamente i valori ripetuti in un intervallo. Selezionare la colonna o l’area da controllare, quindi aprire Home > Formattazione condizionale > Regole evidenziazione celle > Valori duplicati. Nella finestra successiva si può scegliere uno stile di formattazione e confermare. I nomi dei comandi possono variare leggermente tra versioni, ma la funzione si trova nella scheda Home.
Per esempio, per verificare gli indirizzi email in B2:B500, selezionare quell’intervallo e applicare la regola. Excel evidenzia tutte le celle il cui contenuto si ripete nell’area selezionata: se un indirizzo appare tre volte, saranno segnalate tutte e tre le occorrenze. Il metodo è utile per un primo controllo e non modifica né elimina alcun dato.
Se interessa colorare l’intera riga, non basta selezionare la sola colonna: si può selezionare l’intera tabella e creare una regola basata su formula. Per un ID in colonna A, con dati dalla riga 2, la formula tipica è:
=CONTA.SE($A$2:$A$500;$A2)>1
La formula controlla quante volte compare il valore della colonna A nell’intervallo. I simboli $ mantengono fissa l’area di ricerca, mentre il riferimento alla riga si adatta durante l’applicazione della regola. In Excel configurato in inglese, il nome della funzione è COUNTIF; nelle installazioni italiane è generalmente CONTA.SE. Anche il separatore degli argomenti può dipendere dalle impostazioni locali.
Per evidenziare soltanto le ripetizioni dalla seconda occorrenza, si può usare una regola progressiva sull’intervallo A2:A500:
=CONTA.SE($A$2:A2;A2)>1
Così la prima comparsa resta senza evidenziazione e quelle successive vengono segnalate. Conviene infine controllare Gestisci regole, verificando che il campo “Si applica a” includa tutte le righe interessate. Un intervallo limitato, colori leggibili e una colonna con intestazione chiara rendono la revisione più agevole, soprattutto nei fogli condivisi.
Usare COUNTIF e criteri su più colonne per controllare le ripetizioni
Una formula in una colonna di supporto trasforma il controllo in un indicatore filtrabile. Supponendo che i valori da verificare siano in A2:A500, inserire in B2:
=CONTA.SE($A$2:$A$500;A2)>1
Riempendo la formula verso il basso, Excel restituisce VERO per i valori presenti più di una volta e FALSO per quelli unici. Si può poi filtrare la colonna B per visualizzare soltanto le righe segnalate, senza spostare o cancellare i record. Per contare le occorrenze, anziché ottenere un risultato vero/falso, usare =CONTA.SE($A$2:$A$500;A2).
Se il duplicato dipende dalla combinazione di più campi — per esempio codice cliente e data — un controllo su una sola colonna non basta. In una colonna di appoggio si può usare:
=CONTA.PIÙ.SE($A$2:$A$500;A2;$B$2:$B$500;B2)>1
La formula segnala le righe in cui la coppia di valori nelle colonne A e B ricorre più di una volta. Per tre criteri si aggiunge un’altra coppia intervallo/criterio, ad esempio ;$C$2:$C$500;C2. Gli intervalli devono avere la stessa dimensione; intestazioni e righe vuote vanno gestite coerentemente per non ottenere segnalazioni inattese.
Un’alternativa, quando si desidera controllare la riga completa, è creare una chiave composta in una colonna ausiliaria. Per esempio, concatenare ID e data con un separatore riconoscibile, quindi applicare CONTA.SE alla chiave. Il separatore riduce ambiguità: senza di esso, coppie diverse come 12 e 345 oppure 123 e 45 potrebbero produrre la stessa stringa concatenata.
Le colonne di supporto rendono esplicita la logica di confronto e facilitano l’audit: è possibile vedere quale criterio ha generato il risultato. Le formule non stabiliscono però se due record vadano davvero fusi o eliminati; quella valutazione dipende dal significato dei campi e dalle regole del processo.
Riconoscere duplicati apparenti: spazi, maiuscole e formati dei dati
Valori che sembrano uguali sullo schermo possono essere diversi per Excel. Uno spazio iniziale o finale, un carattere non stampabile o un tipo di dato incoerente possono impedire la corrispondenza; al contrario, funzioni standard di conteggio e confronto in Excel normalmente non distinguono tra maiuscole e minuscole. È quindi necessario capire quale normalizzazione sia corretta per il dato in questione.
Per individuare spazi superflui, creare una colonna temporanea con =ANNULLA.SPAZI(A2) e verificare i risultati normalizzati. La funzione rimuove gli spazi iniziali e finali e riduce le sequenze di spazi interni; non sempre elimina caratteri invisibili importati da altre applicazioni. Se sospetti caratteri non stampabili, =PULISCI(A2) può aiutare, ma è opportuno confrontare il valore trasformato con l’originale prima di sostituirlo.
Numeri memorizzati come testo e numeri veri possono richiedere una standardizzazione. Per codici con zeri iniziali, come 00127, non convertire automaticamente in numero: gli zeri potrebbero scomparire e cambiare il significato del codice. Stabilire se il campo è un identificatore testuale o un valore numerico, quindi rendere uniforme la rappresentazione. Per le date, verificare che le celle contengano date effettive e non stringhe visualmente simili in formati diversi.
In presenza di codici sensibili alle maiuscole, una regola ordinaria potrebbe trattare ABC e abc come corrispondenti. Se il caso distingue davvero due codici, serve un confronto case-sensitive, per esempio con la funzione IDENTICO, oppure una procedura di verifica dedicata. Normalizzare solo dopo aver definito le regole: una pulizia indiscriminata può cancellare differenze che hanno valore.
Come rimuovere i duplicati in sicurezza: backup, criteri e revisione delle righe
Il comando Dati > Rimuovi duplicati elimina le righe considerate ripetute in base alle colonne selezionate. Non è uno strumento di sola evidenziazione: l’operazione modifica la tabella, mantenendo una sola occorrenza secondo il comportamento di Excel. Prima di usarlo, preparare una copia del foglio o del file e verificare di poter ripristinare la versione originale. Salvare una copia con un nome riconoscibile consente di tornare ai dati di partenza anche dopo ulteriori modifiche.
La finestra di dialogo presenta le intestazioni e permette di scegliere i campi da confrontare. Se si seleziona soltanto Email, Excel può rimuovere righe con la stessa email anche quando nome, data o altri dettagli differiscono. Se si selezionano tutte le colonne, invece, saranno considerate duplicate soltanto le righe con gli stessi valori in ogni campo selezionato. La scelta corretta dipende dalla definizione del record, non dal numero di colonne disponibili.
Una procedura prudente è:
- Conservare l’originale e lavorare su una copia del foglio o del file.
- Definire i criteri indicando quali colonne identificano davvero un record.
- Segnalare e filtrare i duplicati con formattazione condizionale o formule, prima della rimozione.
- Confrontare le righe per individuare informazioni discordanti e decidere quale versione mantenere.
- Eseguire la rimozione soltanto sulla copia verificata e controllare il riepilogo fornito da Excel.
Il riepilogo indica quante voci sono state rimosse e quante restano, ma non sostituisce una revisione dei record coinvolti. Dopo l’operazione, confrontare i conteggi con quelli attesi, controllare campioni dei dati e verificare totali o indicatori rilevanti. In Power Query, inoltre, il confronto dei testi distingue tra maiuscole e minuscole; non è opportuno presumere che le regole siano identiche a quelle di altri strumenti di Excel.
Se le righe contengono informazioni complementari o in conflitto, rimuoverne una può comportare perdita di dati. In quel caso serve prima decidere come consolidare i campi — ad esempio mantenendo la data più recente o integrando note mancanti — e documentare la scelta. La deduplicazione automatica è adatta a record equivalenti secondo criteri certi, non a sostituire il giudizio sui dati.










