Seleccionar página

Qué es la deduplicación de identidades y cómo detectar identidades duplicadas

por | Tecnología

deduplicación de identidades

La deduplicación de identidades permite detectar si una misma persona aparece más de una vez en un sistema, incluso cuando sus datos no son exactamente iguales. Para hacerlo, se combinan técnicas de comparación de datos, búsqueda de similitudes y, en determinados casos, biometría.

¿Qué es la deduplicación de identidades?

La deduplicación de identidades es el proceso de detectar y unificar los registros que, aunque parezcan distintos, pertenecen a la misma persona física.

Cuando una organización gestiona miles o millones de personas, ya sean clientes, pacientes, beneficiarios de una ayuda o usuarios de una aplicación, es posible que un mismo sujeto termine con más de un registro en el sistema.

La deduplicación de identidades se encarga de encontrar esos registros repetidos y decidir si fusionarlos, marcarlos para revisión o impedir la creación de un nuevo registro. En otras palabras, decide qué hacer con ellos.

Conviene no confundirla con la deduplicación de datos en sentido amplio, un término que en informática también se utiliza para eliminar copias redundantes de archivos o bloques de almacenamiento. Aquí el objetivo no es el de ahorrar espacio, sino el de determinar si varios registros corresponden a una misma identidad.

¿Por qué se duplican las identidades?

Los duplicados pueden aparecer por errores de captura, cambios en los datos personales, registros realizados desde distintos canales o intentos deliberados de crear varias identidades.

Las causas más habituales son:

  • Errores de captura: una persona escribe su nombre de forma diferente, un empleado comete una errata o un formulario no valida correctamente los datos.
  • Cambios en los datos personales: alguien cambia de apellido, dirección o número de teléfono y el sistema no relaciona el nuevo registro con el anterior.
  • Altas por distintos canales: la misma persona se registra en una aplicación, una web y una oficina física, y cada canal genera un registro independiente.
  • Creación deliberada de varias identidades: una persona puede intentar generar varias cuentas para obtener determinados beneficios o para ocultar la relación entre diferentes registros.

Esta última situación es especialmente difícil de resolver utilizando únicamente reglas de texto, porque precisamente busca evitar que los datos de los distintos registros coincidan.

¿Qué diferencia hay entre un duplicado exacto y un duplicado difuso?

Un duplicado exacto presenta los mismos datos, mientras que un duplicado difuso corresponde a la misma persona aunque sus datos aparezcan escritos de forma diferente.

Esta distinción importa porque cada tipo necesita una técnica de detección diferente:

Tipo Cómo funciona Ejemplo
Duplicado exacto Los datos coinciden exactamente. Mismo DNI y mismos datos personales.
Duplicado difuso Los datos presentan pequeñas diferencias, pero pueden pertenecer a la misma persona. “María García López” frente a “Maria Garcia-Lopez”.
Duplicado biométrico Se compara una característica biométrica con las identidades existentes. Comparación facial 1:N.

Un caso real que ilustra bien esta diferencia es el del National Data Repository de Nigeria, donde se utilizó la huella dactilar para detectar posibles registros duplicados en el sistema nacional de historiales de VIH.

Entre 2021 y 2024 se analizaron más de 1,5 millones de registros, de los cuales 162.120 fueron identificados como potencialmente duplicados. El sistema distinguió además entre duplicados perfectos, en los que coincidían también otros datos personales, y duplicados imperfectos que requerían una revisión adicional.

El caso muestra cómo la biometría puede complementar la información demográfica para detectar que una misma persona aparece varias veces en una base de datos, incluso cuando sus registros no son idénticos.

¿Cómo se detectan las identidades duplicadas?

Se pueden combinar varias capas de detección como coincidencia exacta, fuzzy matching, modelos de machine learning o biometría.

La técnica adecuada depende del volumen de datos, la calidad de la información disponible y el nivel de precisión que necesita el sistema.

Coincidencia exacta o determinística

La coincidencia exacta compara campos concretos, como un DNI, un correo electrónico o un número de teléfono, y busca registros con valores idénticos.

Es una técnica rápida y sencilla, pero tiene la limitación de si un dato contiene una errata, aparece con un formato diferente o ha cambiado con el tiempo, puede no detectar que dos registros pertenecen a la misma persona.

Fuzzy matching o vinculación probabilística de registros

El fuzzy matching calcula una puntuación de similitud entre dos registros en lugar de exigir una coincidencia exacta.

Entre los algoritmos más utilizados encontramos:

  • Distancia de Levenshtein: calcula cuántas operaciones de edición, como insertar, eliminar o sustituir caracteres, separan dos cadenas de texto.
  • Jaro-Winkler: da mayor peso a determinadas coincidencias, especialmente al principio de las palabras, por lo que puede resultar útil para nombres.
  • Algoritmos fonéticos: como Soundex o Metaphone, permiten identificar palabras que pueden sonar de forma similar aunque se escriban de manera diferente.
  • Modelo de Fellegi-Sunter: utiliza un enfoque probabilístico para ponderar diferentes campos y determinar la probabilidad de que dos registros correspondan a la misma persona.

En la práctica, estas técnicas pueden combinarse para obtener una puntuación de similitud más completa.

Blocking o cómo escalar la deduplicación

Comparar cada registro con todos los registros existentes se vuelve rápidamente costoso cuando una base de datos alcanza millones de usuarios.

El blocking reduce este problema creando primero grupos de candidatos que comparten determinadas características, como un código postal, parte del apellido o una fecha de nacimiento. Después, la comparación detallada se realiza únicamente dentro de esos grupos.

De esta manera, el sistema reduce considerablemente el número de comparaciones necesarias sin tener que analizar todos los posibles pares.

Modelos de machine learning

Los modelos de machine learning pueden aprender a identificar patrones a partir de ejemplos previamente etiquetados como duplicados o no duplicados.

En lugar de establecer manualmente cuánto debe pesar cada campo, el modelo puede aprender qué combinaciones de características resultan más relevantes para determinar si dos registros corresponden a la misma persona.

Esta aproximación puede utilizarse, por ejemplo, para priorizar los casos que necesitan una revisión humana o para mejorar progresivamente la identificación de posibles duplicados.

Deduplicación biométrica (matching 1:N)

La deduplicación biométrica permite comparar una característica biométrica de una persona contra una base de datos de identidades para determinar si esa persona ya está registrada.

Los sistemas ABIS (Automated Biometric Identification Systems) utilizan desde hace años este principio con huellas dactilares y otras características biométricas. En un escenario 1:N, una muestra biométrica se compara con las identidades existentes para responder a una pregunta diferente de la verificación tradicional: ¿existe ya esta persona en el sistema?

Un estudio de 2024 publicado en TechRxiv por investigadores de Thoughtworks analiza precisamente este enfoque mediante embeddings faciales y búsqueda de similitud en una base de datos vectorial. El trabajo explora el uso de ArcFace para generar representaciones biométricas y Milvus para realizar búsquedas de similitud a gran escala.

En este tipo de arquitectura, una imagen facial se transforma en una representación matemática. En lugar de comparar directamente las imágenes, el sistema compara esas representaciones para determinar cuáles son suficientemente similares.

El estudio reporta en sus pruebas una exactitud del 99,79 %, un F1 del 89,44 % y un FPIR y FNIR del 0,1 %. Son resultados correspondientes a ese experimento concreto y a sus condiciones de evaluación, por lo que no deben interpretarse como valores universales para cualquier sistema de deduplicación.

Los autores también analizan cómo cambia el rendimiento al aumentar el número de muestras de referencia asociadas a una misma identidad. Sus resultados muestran una mejora de la exactitud cuando se utilizan más imágenes de referencia, lo que refleja la importancia de la calidad y cantidad de las muestras biométricas en este tipo de sistemas.

Clusterización: encontrar redes de duplicados

Cuando el objetivo no es comprobar un registro nuevo contra el histórico, sino analizar una base de datos completa para localizar duplicados que todavía no se han detectado, también pueden utilizarse técnicas de clusterización.

En lugar de analizar únicamente pares de registros, estas técnicas agrupan registros similares en conjuntos. Esto permite identificar relaciones entre varios registros y no únicamente duplicados aislados.

¿Qué papel juega la privacidad cuando se usa biometría para deduplicar?

La biometría permite identificar duplicados con un alto nivel de precisión, pero su uso debe acompañarse de mecanismos que garanticen la protección de la información biométrica durante todo el proceso.

En una deduplicación biométrica, una muestra, como un rostro o una huella, se compara con las identidades que ya existen en una base de datos para determinar si esa persona ya está registrada. Por eso, además de la precisión del matching, es importante definir cómo se almacenan, procesan y protegen los datos biométricos.

Un buen ejemplo es Janus, un sistema desarrollado por investigadores de EPFL, CISPA y el Comité Internacional de la Cruz Roja (CICR) y presentado en el IEEE Symposium on Security and Privacy de 2024. El proyecto aborda el caso de cómo evitar que una misma persona se registre varias veces para recibir ayuda humanitaria utilizando la biometría, sin necesidad de exponer las bases de datos biométricas durante el proceso de deduplicación.

Janus permite comprobar si una persona ya está registrada y devuelve únicamente un resultado binario: si existe o no una coincidencia, sin revelar información adicional sobre las identidades almacenadas. Para conseguirlo, el trabajo explora diferentes mecanismos de computación segura, entre ellos computación segura multiparte (SMC), un enfoque híbrido basado en cifrado homomórfico y SMC y entornos de ejecución confiables (TEE).

El caso de Janus muestra cómo la investigación actual no se centra únicamente en hacer que el matching biométrico sea más preciso, sino también en desarrollar arquitecturas que permitan aprovechar esa precisión manteniendo protegida la información biométrica.

Así, privacidad y biometría no son conceptos contrapuestos: la cuestión está en diseñar el proceso de deduplicación para que la información necesaria pueda utilizarse de forma segura y controlada.

El enfoque híbrido de Janus combina computación segura multiparte con cifrado homomórfico, una técnica que permite realizar determinadas operaciones sobre datos cifrados sin necesidad de descifrarlos previamente. Aplicado a la biometría, esto permite realizar parte del proceso de comparación manteniendo protegida la información utilizada.

En otras palabras, el sistema puede trabajar con datos protegidos y obtener el resultado de la operación sin tener que exponer directamente la información biométrica. El trabajo de Janus explora este enfoque junto con otras arquitecturas de computación segura para encontrar un equilibrio entre privacidad y rendimiento.

¿Qué sectores necesitan detectar identidades duplicadas?

Cualquier organización que gestione grandes volúmenes de identidades puede enfrentarse al problema de los registros duplicados.

Sector ¿Para qué se utiliza la deduplicación?
Banca y fintech Detectar registros duplicados durante procesos de alta y gestión de clientes.
Seguros Identificar posibles registros duplicados dentro de las bases de clientes y asegurados.
Gaming Comprobar si una persona ya está registrada en una plataforma.
Telecomunicaciones Detectar registros duplicados en procesos de alta y gestión de líneas o servicios.
Salud pública Evitar que una misma persona aparezca varias veces en sistemas de información sanitaria.
Administración pública Mantener registros de identidad coherentes y detectar posibles duplicidades.

¿Cómo se mide si un sistema de deduplicación funciona bien?

La métrica adecuada depende del tipo de deduplicación. En los sistemas biométricos 1:N, dos indicadores habituales son FPIR y FNIR.

  • FPIR (False Positive Identification Rate): mide con qué frecuencia el sistema identifica incorrectamente a una persona como coincidencia.
  • FNIR (False Negative Identification Rate): mide con qué frecuencia el sistema no identifica una coincidencia que realmente existe.

El umbral de decisión influye directamente en ambas métricas. Modificarlo puede reducir un tipo de error mientras aumenta el otro, por lo que debe establecerse teniendo en cuenta las características y riesgos del caso de uso.

El estudio de TechRxiv mencionado anteriormente obtuvo un FPIR y un FNIR del 0,1 % en sus pruebas. Como ocurre con cualquier resultado experimental, estas cifras deben interpretarse dentro de las condiciones concretas del estudio y no como una garantía aplicable a cualquier población o base de datos.

En otros escenarios de record linkage o deduplicación de datos también pueden utilizarse métricas como precision, recall o F1, especialmente cuando se trabaja con registros no biométricos.

 

Preguntas frecuentes sobre deduplicación de identidades

¿Cuál es la diferencia entre deduplicación y verificación de identidad?

La verificación de identidad suele responder a una pregunta 1:1: si una persona es quien dice ser. La deduplicación plantea una comparación 1:N: si esa persona ya existe entre las identidades registradas en un sistema.

¿Se puede hacer deduplicación utilizando biometría?

Sí. La biometría permite comparar una característica de una persona, como el rostro o la huella dactilar, con las identidades existentes en una base de datos. Este enfoque se conoce como matching biométrico 1:N y permite determinar si esa persona ya está registrada.

¿La deduplicación significa que una identidad duplicada es necesariamente fraudulenta?

No. Detectar dos registros que pueden pertenecer a la misma persona no significa necesariamente que exista fraude. Una duplicidad puede deberse a errores de introducción de datos, cambios en la información personal o registros realizados a través de diferentes canales. Por eso, el resultado de una deduplicación puede requerir una revisión adicional antes de tomar una decisión.

La biometría puede aportar una capa especialmente potente a la deduplicación de identidades, ya que permite comparar una característica biométrica de una persona con las identidades ya registradas para determinar si existe una coincidencia. En escenarios de gran escala, el matching biométrico 1:N permite abordar la deduplicación desde una perspectiva diferente, complementando la comparación de datos y ayudando a identificar coincidencias incluso cuando la información asociada a los registros presenta variaciones.

DOSIER PRODUCTO

Descubre nuestra solución de verificación de identidad

Verifica la identidad de tus clientes en segundos a través del escaneo y validación de documentos de identidad y matching biométrico facial con prueba de vida. 

Privacy by design en biometría

Privacy by design en biometría

​​Como en las viejas cartas escritas a mano, hay principios que nunca pasan de moda. Aquellas cartas guardaban sentimientos, promesas y secretos que...

mobbeel
Resumen de privacidad

Utilizamos cookies propias y de terceros para garantizar el funcionamiento de la web y analizar el uso que hacen los usuarios del sitio web a fin de mejorar nuestros servicios.

Rechazar cookies

¿Qué es una cookie?

Las cookies son archivos enviados desde un servidor web que obtienen información de los dispositivos de los usuarios, por ejemplo, sobre sus preferencias y pautas de navegación.

Las cookies son esenciales para el funcionamiento de internet, ya que ofrecen soluciones técnicas que permiten al usuario navegar por los distintos sitios web; no pueden dañar el equipo/dispositivo del usuario y pueden usarse para identificar y resolver posibles errores de funcionamiento del Sitio Web. También pueden ser utilizadas con finalidades publicitarias o analíticas.

Uso de cookies por Mobbeel

Concretamente, MOBBEEL utiliza cookies propias generadas directamente por este dominio y cookies de terceros generadas desde otros sitios web ajenos a MOBBEEL, pertenecientes a terceras empresas, para las finalidades concretas que a continuación se exponen. Si en un futuro MOBBEEL utilizase otras cookies con el propósito de otorgar más y mejores servicios, se informará al usuario de ello.