Reconocimiento facial: cómo entrenar modelos y seguir mejorando con el tiempo
Resumen ejecutivo
La tecnología de reconocimiento facial de Incode está diseñada para la identificación/verificación precisa y rápida de la identidad de una persona a partir de imágenes faciales, sin necesidad de comprobaciones físicas de documentos ni intervención humana. Garantiza una alta precisión de reconocimiento sin importar el género, la edad, la raza o las condiciones del entorno durante la captura.
A pesar de los desafíos relacionados con la calidad de imagen en los documentos debido a factores como el desgaste y los elementos de seguridad, la Tasa de Verdaderos Positivos (TPR) de Incode en comparaciones de selfie contra foto de documento alcanza el 98.53%, mientras que la Tasa de Falsos Positivos (FPR) se mantiene en 0.001%, lo que garantiza un alto nivel de seguridad.
Nuestra tecnología ha pasado por evaluaciones independientes y demuestra resultados excelentes:
En las
pruebas NIST FRVT, logramos un FNIR de 0.0038 en el conjunto de datos visa-border con un FPIR ≤ 0.003, colocándonos en el puesto #1 entre los proveedores de IDV, y en el top 15 de los mejores algoritmos de reconocimiento facial en general utilizados para diversos fines.
En la prueba RIVTD 2023 de DHS S&T, nuestra tecnología fue uno de los 3 sistemas que cumplieron los criterios con una tasa de fallo de extracción de documentos (FTXR) por debajo del 1%, usando un umbral conservador donde la Tasa de Falsas Coincidencias (FMR) fue tres veces menor que la esperada de 1:10,000 y con un FNMR por debajo del 1%.
Estos impresionantes reconocimientos independientes no son una coincidencia, sino el resultado de esfuerzos constantes por desafiar nuestro propio algoritmo con pruebas rigurosas:
Usamos conjuntos de datos
propietarios extensos y bien balanceados que contienen más de 40 millones de imágenes y más de 4.5 millones de identidades únicas, y trabajamos sin descanso para mejorar nuestros modelos de reconocimiento facial, empleando métodos avanzados y estrategias de entrenamiento efectivas, y actualizando y enriqueciendo regularmente los datos de entrenamiento.
En este documento, obtendrá una visión interna de qué es el reconocimiento facial y cuáles son los desafíos más apremiantes hoy en día, y aprenderá de nuestros expertos cómo entrenar y probar los procesos que construyen modelos de reconocimiento facial de alto rendimiento.
¿Qué es el reconocimiento facial?
El reconocimiento facial es una tecnología que permite identificar o verificar la identidad de una persona mediante el análisis de rasgos faciales únicos.
Se ha convertido en parte integral de nuestra vida diaria, integrándose en diversos sectores: el reconocimiento facial no solo puede mejorar la seguridad y prevenir el fraude, sino también simplificar el acceso a los servicios y hacerlos más personalizados.
Según los pronósticos, se espera que el mercado global de tecnologías de reconocimiento facial alcance volúmenes significativos en los próximos años, lo que refleja la creciente demanda de este tipo de tecnologías.

En el reconocimiento facial se distinguen dos tareas principales:
- Verificación 1:1: verificar si dos imágenes faciales pertenecen a la misma persona.

- Identificación 1:N: identificar a una persona dentro de una base de datos grande comparando una sola imagen facial (1) contra numerosas imágenes almacenadas (N) para encontrar la coincidencia correcta.

Durante la verificación en nuestro sistema, el usuario presenta un documento de identidad y toma una foto de su rostro. Cada una de las imágenes recibidas se envía a detección de rostro y evaluación de calidad. Es importante entender que la detección de rostro es solo el proceso de determinar la presencia de un rostro en una imagen y su ubicación, no su reconocimiento. Aunque este proceso puede parecer simple, el paso de detectar un rostro, evaluar su calidad y seleccionar la mejor imagen juega un papel crucial para lograr un reconocimiento efectivo y de alta calidad.
Si el rostro no se detecta, o si la calidad del rostro en la selfie o en la identificación es insuficiente para el reconocimiento posterior (por ejemplo, si la imagen está demasiado oscura o sobreexpuesta), se realiza una nueva captura y evaluación del siguiente cuadro.
Una vez que se detectan rostros de calidad suficiente tanto en la selfie como en las imágenes de la identificación, el sistema extrae características únicas: representaciones de alta dimensión de patrones faciales complejos y características únicas. Estas características se transforman en una representación numérica de los datos biométricos del rostro. Este vector representa una “firma facial” única, que permite distinguirlo de los rostros de otros usuarios.
En el sistema de verificación, el siguiente paso es comparar los embeddings faciales obtenidos de la selfie y del documento de identidad. Si el rostro de la selfie coincide con el rostro de la identificación presentada, y después de validar la selfie y el documento (esto se hace para prevenir el fraude; puede encontrar más detalles en los documentos correspondientes), los datos se ingresan al sistema y pueden usarse más adelante para la identificación del usuario.
El proceso de identificación del usuario en las etapas iniciales es similar a la verificación, excepto que solo se usa la selfie. En la etapa de comparación, el embedding del rostro capturado se compara con los embeddings registrados almacenados en la base de datos.
Todas las tecnologías utilizadas en nuestro sistema se basan en modelos avanzados de aprendizaje automático. Estas soluciones innovadoras brindan la máxima precisión y eficiencia en la detección de rostros y sus puntos de referencia, la extracción de embeddings faciales y la comparación de esos embeddings.
Este alto nivel de precisión no se logró de la noche a la mañana; los investigadores comenzaron a explorar la detección y el reconocimiento automáticos de rostros hace ya bastante tiempo.
La siguiente gráfica comienza a principios de los años noventa, aunque los primeros intentos de automatizar el proceso se realizaron a mediados del siglo XX. Los primeros enfoques, basados en conocimiento empírico de las imágenes faciales, funcionaban bien solo en condiciones estrictamente definidas. El aprendizaje automático clásico ayudó a resolver algunos de los problemas, pero aún no podía capturar la alta variabilidad de los rostros. Esta situación persistió hasta mediados de la década de 2010, cuando avances significativos en las redes neuronales hicieron posible aplicarlas de manera efectiva. Los métodos basados en redes neuronales demuestran hoy los niveles más altos de eficiencia.

El aprendizaje profundo ha superado muchas limitaciones de los métodos anteriores, brindando alta precisión y confiabilidad en el reconocimiento facial en diversas condiciones. Sin embargo, a pesar del progreso logrado, las tecnologías de reconocimiento facial aún enfrentan ciertos desafíos. Factores como las condiciones de captura, las características de la imagen y la similitud entre los rostros de parientes cercanos pueden afectar la calidad del reconocimiento. Por ello, los esfuerzos continuos se centran en mejorar los algoritmos para garantizar la máxima precisión y robustez en una amplia gama de escenarios de aplicación.
Desafíos clave del reconocimiento facial
El desarrollo de un algoritmo de reconocimiento facial efectivo, confiable y robusto nos presenta, como desarrolladores, una serie de desafíos técnicos. La calidad del reconocimiento puede verse influida por diversos factores, que van desde las condiciones de captura de la imagen y las características de las imágenes hasta la similitud de rostros entre parientes cercanos.
Condiciones de captura variables y características de la imagen
Por ejemplo, las condiciones de captura variables y las características de la imagen afectan la precisión de los modelos de reconocimiento facial. Las condiciones del mundo real rara vez son ideales: la iluminación puede ser deficiente o desigual, el ángulo puede desviarse de una vista frontal y las expresiones faciales pueden variar.

Las sombras, los reflejos y las áreas sobreexpuestas pueden ocultar o distorsionar rasgos faciales importantes. Una iluminación deficiente o desigual dificulta la extracción de estas características, lo que puede provocar errores de reconocimiento.

Cuando un rostro se captura en ángulo, la posición relativa de los rasgos faciales cambia. La falta de datos suficientes con distintos ángulos durante el entrenamiento hace que el modelo no pueda manejar adecuadamente ese tipo de imágenes.

Las distintas expresiones faciales pueden afectar la apariencia de arrugas y pliegues del rostro, alterando las características de textura que usa el modelo. Si el modelo no está entrenado con diversas expresiones faciales, puede percibir imágenes de la misma persona con distintas expresiones como rostros diferentes.
Todos esos factores pueden reducir significativamente la efectividad de los modelos si no están entrenados para manejar tales variaciones. Por lo tanto, es importante desarrollar modelos que puedan mantener una alta precisión de reconocimiento a pesar de la diversidad de factores externos.
Incluir imágenes con una amplia gama de condiciones externas en los conjuntos de datos de entrenamiento, así como usar modelos invariantes a la rotación y la escala, puede mejorar en gran medida la confiabilidad de los sistemas de reconocimiento. La aplicación de aumento de datos, normalización y preprocesamiento de las imágenes faciales también contribuye a crear un método de alta calidad.
Alta variabilidad en la apariencia facial
Otro factor que afecta la precisión del reconocimiento es la alta variabilidad en la apariencia facial. El uso de maquillaje, llevar barba o bigote, lentes o sombreros, y el envejecimiento natural pueden alterar significativamente la apariencia de una persona.

El maquillaje puede cambiar significativamente la percepción visual de un rostro, ocultar las características naturales de la textura de la piel y alterar la visibilidad de los contornos faciales.

Los accesorios, la barba y el bigote pueden ocultar partes del rostro que contienen rasgos importantes, cambiar el contorno facial y esconder el mentón y la línea de la mandíbula.

Las distintas expresiones faciales pueden afectar la apariencia de arrugas y pliegues del rostro, alterando las características de textura que usa el modelo. Si el modelo no está entrenado con diversas expresiones faciales, puede percibir imágenes de la misma persona con distintas expresiones como rostros diferentes.
Estos cambios pueden complicar significativamente las tareas de reconocimiento facial, ya que afectan las características clave que usan los modelos para la identificación. Por lo tanto, es esencial desarrollar métodos que permitan a los modelos manejar de manera efectiva la alta variabilidad facial.
Dificultad para comparar selfies con fotos de documentos de identidad
Otro factor que afecta la precisión del método de reconocimiento es la dificultad de comparar rostros de distintos dominios, específicamente el desafío de comparar selfies con fotos de documentos de identidad. Las identificaciones suelen contener elementos de seguridad diseñados para prevenir la falsificación del documento, lo que crea obstrucciones visuales para los sistemas de reconocimiento facial.

Los hologramas, las imágenes semitransparentes o los patrones aplicados sobre la fotografía pueden crear reflejos y distorsiones, reducir el contraste y la claridad de la foto, introducir ruido visual y ocultar detalles del rostro.

La superficie brillante del documento puede producir reflejos durante el escaneo o la fotografía, dificultando el reconocimiento.
Recopilación y etiquetado de conjuntos de datos grandes y diversos
Desarrollar modelos que funcionen de manera justa y garanticen precisión para todos los grupos demográficos, como edad, género y raza, es un requisito indispensable para los sistemas modernos que aspiran al liderazgo en el mercado global. Esto crea la necesidad de identificar y mitigar los sesgos que pueden surgir de distribuciones desbalanceadas o de la subrepresentación de ciertos grupos en los datos, lo que a su vez requiere el uso de conjuntos de datos grandes y diversos.
Desafortunadamente, usar conjuntos de datos abiertos no satisface por completo la necesidad de diversidad y completitud de los datos. Los conjuntos de datos abiertos suelen contener sesgos, ya que presentan predominantemente individuos de un solo grupo demográfico (p. ej., LFW), grupos de edad específicos (p. ej., MS-Celeb-1M) o tienen un número limitado de identidades (p. ej., DemogPairs). Además, los conjuntos de datos abiertos no siempre están disponibles para uso comercial.
Por lo tanto, la recopilación, preparación y etiquetado de conjuntos de datos propietarios es crítica para entrenar modelos de reconocimiento facial justos y precisos. Sin embargo, el proceso de recopilar, etiquetar y verificar la calidad de los datos para tareas de reconocimiento facial es intensivo en trabajo y a menudo requiere recursos humanos y de cómputo significativos. Un conjunto de datos pequeño no puede capturar toda la complejidad y diversidad de los rostros humanos; por ello, el conjunto de datos de entrenamiento debe contener millones de imágenes. Esto lleva a la necesidad de anotación automatizada, ya que se vuelve prácticamente imposible procesar manualmente volúmenes de datos tan grandes. La supervisión humana sigue siendo necesaria para verificar la exactitud de las anotaciones automatizadas, pero es más efectiva en las etapas finales o para el control de calidad.
Otro desafío en la recopilación de datos para el reconocimiento facial es el cumplimiento de leyes y regulaciones. El rostro humano se considera un dato biométrico, que en la mayoría de los países se clasifica como información sensible y está sujeto a una protección estricta. Durante la recopilación de datos, es esencial garantizar que no haya violaciones a las leyes del país donde se recopilan los datos, que los datos estén protegidos de forma segura y que el acceso a ellos esté cuidadosamente controlado. El incumplimiento de estas regulaciones puede provocar pérdidas reputacionales y financieras.
Diferenciación de rostros similares
Finalmente, el problema que requiere atención especial es distinguir entre gemelos o parientes cercanos, ya que comparten características biométricas similares. Esta es una tarea especialmente desafiante debido a los cambios naturales de apariencia ya mencionados, como el envejecimiento o el maquillaje. Al intentar mejorar la capacidad del modelo para diferenciar rostros, este puede comenzar a perder su capacidad de generalización para el rostro de una misma persona.
Observe la imagen de abajo. Las primeras dos fotografías muestran a hermanos gemelos fotografiados en 2005, y las siguientes dos muestran a los mismos gemelos unos años después. ¿Está seguro de que no intercambiamos a los hermanos en las fotos?


Estos son los mismos desafíos que enfrenta el modelo al intentar diferenciar gemelos. Desafortunadamente, la diferenciación de rostros similares sigue siendo un reto para los sistemas de reconocimiento facial. Aunque la evolución de la tecnología nos acerca cada vez más a resolver este problema, todavía no se ha encontrado una solución definitiva.
Tecnologías y procesos centrales
Todas las tecnologías utilizadas en nuestro sistema de verificación e identificación se basan en modelos avanzados de aprendizaje automático. Estas soluciones innovadoras garantizan la máxima precisión y eficiencia en la detección de rostros y puntos de referencia faciales, la extracción de embeddings faciales y la comparación de embeddings.
Detección de rostros y puntos de referencia faciales
La detección de rostros y de puntos de referencia faciales es un componente crítico del sistema. Es particularmente desafiante al lidiar con condiciones diversas como oclusión, iluminación variable y restricciones de tiempo real, especialmente considerando que la solución debe ser ligera y rápida sin comprometer la precisión.
Al usar enfoques avanzados de detección, junto con técnicas modernas de procesamiento de datos, logramos un equilibrio de eficiencia, robustez y precisión, lo que permite una integración fluida en aplicaciones de tiempo real.
Como resultado, el modelo de detección de rostros devuelve las coordenadas del recuadro delimitador que rodea cada rostro detectado, las coordenadas de puntos de referencia faciales como los ojos, la boca y la nariz, así como la puntuación de confianza de que el objeto detectado es efectivamente un rostro. Con base en esta información, Incode selecciona el rostro más prominente para su procesamiento posterior. Para los clientes que deseen trabajar ellos mismos con los rostros detectados, podemos proporcionar información sobre todos los rostros encontrados.
El rostro más prominente se envía entonces al modelo, que calcula el embedding facial y realiza la comparación.
Alineación del rostro
Antes de extraer el embedding facial, se realiza el procedimiento de alineación del rostro. Para la alineación se usan cinco puntos clave: las esquinas externas de los ojos, la punta de la nariz y las esquinas externas de la boca. La necesidad de alinear el rostro surge de la sensibilidad de los algoritmos de redes neuronales a las transformaciones afines, como la rotación y el escalado.
La transformación de similitud que usamos incluye escalado además de rotaciones y traslaciones. Este enfoque ayuda a mantener una apariencia más realista de los rostros, incluso cuando su tamaño cambia, aunque no preserva las distancias exactas entre los puntos.

Extracción y comparación de embeddings faciales
Para la extracción de embeddings faciales usamos técnicas de aprendizaje profundo, en particular redes neuronales convolucionales (CNN). Este enfoque ha demostrado un rendimiento de vanguardia en diversas tareas y está ampliamente adoptado tanto en la investigación académica como en aplicaciones de la industria. Se consideraron enfoques alternativos, como métodos tradicionales de aprendizaje automático o enfoques basados en características diseñadas a mano, pero resultaron menos efectivos para manejar la complejidad y variabilidad de los datos de rostros e identificaciones.
Después de la extracción, los embeddings faciales se comparan con el embedding de una persona específica (o con los embeddings de la base de datos).
Al final, el modelo de reconocimiento facial devuelve una puntuación entre 0 y 100, que representa la confianza de que el rostro de la selfie coincide con la foto del documento de identidad o con otra selfie. Un valor de 100 representa la máxima probabilidad de que las fotos sean de la misma persona, y un valor de 0 representa la mínima probabilidad de que las fotos sean de la misma persona. Una vez establecido un valor de umbral, el modelo se comporta como un clasificador binario.
Base de datos vectorial
Para almacenar los embeddings faciales, diseñamos nuestra propia Incode Vector Database. La Incode Vector Database está diseñada para ofrecer una forma confiable y eficiente de almacenar y gestionar grandes conjuntos de vectores faciales, permitiendo un reconocimiento facial rápido y preciso. La base de datos está diseñada para almacenar grandes cantidades de datos y puede escalar para acomodar volúmenes crecientes sin comprometer el rendimiento ni la confiabilidad.
Con la Vector Database, los usuarios pueden almacenar y gestionar fácilmente sus datos de vectores faciales y realizar diversas operaciones, incluidas la búsqueda y la indexación. La base de datos está optimizada para la búsqueda y recuperación rápidas de vectores faciales, lo que permite a los usuarios comparar rostros contra un conjunto de datos grande de manera rápida y precisa.
Cómo entrenar el reconocimiento facial para un alto rendimiento
El éxito del entrenamiento de modelos profundos depende de varios factores: la arquitectura, las funciones de pérdida, los datos de entrenamiento, las estrategias de muestreo y muchos otros.
Arquitectura del modelo
Se eligieron redes convolucionales profundas como nuestra arquitectura; representan el enfoque de vanguardia actual en tareas de reconocimiento facial. Sin embargo, nos gustaría destacar una característica específica del entrenamiento que permite manejar eficientemente un gran número de identidades.
El modelo que entrenamos no resuelve una tarea binaria de comparar dos rostros, sino la tarea de obtener embeddings faciales. El entrenamiento del modelo se organiza como una tarea de clasificación multiclase, donde cada clase representa una identidad única (durante el entrenamiento, cada rostro se considera una clase separada). De esta manera, el modelo aprende a distinguir entre muchas identidades diferentes.
Si visualizamos el proceso, podría parecer que durante el entrenamiento intentamos colocar los rostros sobre una esfera imaginaria, donde los rostros de una misma persona están cerca unos de otros, y los rostros de personas diferentes se ubican lejos entre sí.

Conjuntos de datos de entrenamiento
Además de una arquitectura, los modelos capaces de representar un gran número de identidades requieren enormes cantidades de datos. Los principales conjuntos de datos usados en la industria, junto con sus características clave, se pueden encontrar en la siguiente tabla.
Nombre del conjunto de datosNúmero de imágenesNúmero de identidadesCaracterísticas claveVGGFace2~3 300 000~9 000Conjunto de datos de reconocimiento facial a gran escala. Las etiquetas de identidad originales se obtienen automáticamente de páginas web. Este conjunto de datos ha sido retirado y no debe usarseIMDb-Face~1 700 000~59 000Un conjunto de datos para reconocer rostros a través de poses y edades. Los autores señalan que la distribución de identidades en el conjunto VGG-Face puede no ser representativa de la población humana globalMS-Celeb-1M~10 000 000100 000Conjunto de datos de reconocimiento facial a gran escala. Las etiquetas de identidad originales se obtienen automáticamente de páginas web. Este conjunto de datos ha sido retirado y no debe usarseWebFace260M~260 000 000~4 000 000Imágenes obtenidas del sitio web IMDb. El conjunto de datos se limpia manualmente a partir de 2.0 millones de imágenes sin procesarWebFace42M~42 000 000~ 2 000 000Versión depurada de WebFace260MGlint360~17 000 000~360 000El conjunto de datos de reconocimiento facial más grande y limpio
El uso de conjuntos de datos abiertos, desafortunadamente, no cubre por completo la necesidad de diversidad y complejidad de los datos. Los conjuntos abiertos suelen contener un número limitado de rostros, pocas variaciones de condiciones y sesgos. Además, no siempre están disponibles para uso comercial y pueden no alinearse con el dominio del mundo real.
Para resolver esto, Incode ha construido su propio conjunto de datos, que refleja escenarios reales de uso de nuestros productos y cubre una amplia gama de grupos de edad, géneros y razas. Las imágenes del conjunto de datos se capturaron bajo diversas condiciones de iluminación, con diferentes fondos, ángulos y expresiones faciales. Adicionalmente, al usar nuestros propios datos, no solo garantizamos su calidad y relevancia, sino también el cumplimiento de todos los estándares legales y éticos.
El conjunto de datos de entrenamiento contiene ~41,000,000 de imágenes correspondientes a ~4,600,000 identidades. Este enorme conjunto de datos se extrajo del entorno de producción, usando datos de clientes que firmaron el consentimiento de aprendizaje automático (‘ML Consent’). Para el etiquetado de datos se usaron algoritmos propietarios de agrupamiento y limpieza.
Estrategia de muestreo
Sin embargo, el entrenamiento efectivo del modelo depende no solo de los datos en sí, sino también de las estrategias de muestreo. Para optimizar el proceso de entrenamiento, usamos una estrategia de selección de ejemplos negativos difíciles (aquellos que el modelo confunde con positivos), lo que impulsa al modelo a diferenciar mejor entre rostros similares.
Todos estos métodos permiten a los modelos generalizar la información de manera más efectiva, evitar el sobreajuste y distinguir con precisión incluso rostros similares, lo cual es especialmente importante en escenarios del mundo real.
Aspectos clave de las pruebas del modelo
Métricas de error clave
Tasa de Falsos Negativos (FNR)
La Tasa de Falsos Negativos (FNR) define la proporción de casos en los que el sistema no logra reconocer a un usuario registrado. La FNR es una de las métricas clave para evaluar el rendimiento de los modelos de reconocimiento facial. En distintos escenarios de prueba, esta métrica puede recibir nombres diferentes: en tareas 1:1, a menudo se llama Tasa de Falsas No Coincidencias (FNMR), y en tareas 1:N se conoce como Tasa de Falsa No Identificación (FNIR). Sin embargo, en esencia, es la misma métrica que evalúa la capacidad del sistema para identificar correctamente un rostro registrado.
La FNR se calcula como:

donde
FN (Falso Negativo): el número de rechazos falsos en los que el sistema no logra reconocer a un usuario registrado; el número de comparaciones genuinas por debajo del umbral.
TP (Verdadero Positivo): el número de reconocimientos correctos, en los que el sistema identifica correctamente a un usuario registrado; el número de comparaciones genuinas en o por encima del umbral.
Cuanto menor sea la FNR, menos probable es que un usuario legítimo enfrente problemas de identificación, lo que ayuda a mantener la satisfacción del cliente. Una FNR alta puede provocar tiempos de atención al cliente más largos, menor confianza en el sistema y mayores costos por revisiones manuales. Por lo tanto, minimizar la tasa de falsos negativos es esencial al desarrollar un sistema de reconocimiento facial.
Tasa de Falsos Positivos – FPR
La Tasa de Falsos Positivos (FPR) define la proporción de casos en los que el sistema identifica incorrectamente a un usuario no registrado como registrado. La FPR es crucial para garantizar la seguridad y la confianza de un sistema de reconocimiento facial, ya que una tasa alta de falsos positivos puede provocar accesos no autorizados. La FPR también puede recibir nombres diferentes según el escenario de prueba: Tasa de Falsas Coincidencias Positivas (FPMR) en tareas 1:1 y Tasa de Falsa Identificación Positiva (FPIR) en tareas 1:N.
La FPR se calcula como:

Donde:
FP (Falso Positivo): el número de aceptaciones falsas en las que el sistema identifica incorrectamente a un usuario no registrado como registrado; el número de comparaciones impostoras en o por encima del umbral.
TN (Verdadero Negativo): el número de rechazos correctos, en los que el sistema correctamente no reconoce un rostro no registrado; el número de comparaciones no genuinas por debajo del umbral.
Una FPR alta puede provocar accesos no autorizados, lo cual es particularmente peligroso en aplicaciones de control de acceso y seguridad. Además, los falsos positivos frecuentes pueden reducir la confianza de los clientes en el sistema y hacer que dejen de usarlo. Por lo tanto, minimizar el número de falsos positivos es crítico al desarrollar un sistema de reconocimiento facial.
En última instancia, es esencial encontrar un umbral óptimo que equilibre ambas métricas: la Tasa de Falsos Negativos y la Tasa de Falsos Positivos.
Selección del umbral
En nuestro caso particular, para todos nuestros modelos elegimos umbrales en los puntos donde FPR=0, lo que significa que el modelo no tiene ninguna tolerancia a falsos positivos, y luego los desplazamos aproximadamente un 5% para asegurarnos de que funcionen con datos nuevos que el modelo no ha visto antes; por ejemplo, si el umbral es 0.5, pondremos 0.525 como umbral.
Para hacer un sistema más seguro, el umbral puede desplazarse aún más alto si una mayor tasa de falsos negativos no representa un problema. Recomendamos encarecidamente no mover los umbrales sin la aprobación de Incode, porque la dependencia TPR/FPR no es lineal (las curvas ROC lo muestran) y sus valores dependen en gran medida de los datos de entrada. Además, no debe considerar el umbral como una probabilidad; por ejemplo, un umbral de 0.3 para el modelo de reconocimiento no significa que la probabilidad de un reconocimiento exitoso sea 0.3. El umbral es solo un número que ayuda a clasificar los datos de entrada.
Representación visual del rendimiento del modelo
Para seleccionar el umbral y evaluar el rendimiento general de los modelos de reconocimiento facial, a menudo se usan representaciones visuales del rendimiento del modelo. Las más utilizadas son las curvas ROC (Receiver Operating Characteristic) y las curvas DET (Detection Error Tradeoff). La curva ROC muestra la relación entre la TPR (Tasa de Verdaderos Positivos, la proporción de comparaciones genuinas en o por encima del umbral) y la FPR (Tasa de Falsos Positivos) en distintos valores de umbral, lo que permite evaluar visualmente el equilibrio entre falsos positivos y verdaderos positivos. Cuanto más se acerque la curva ROC al punto (0, 1), mejor separa las clases el algoritmo.
Las curvas DET se usan para visualizar el equilibrio entre dos métricas de error clave: la Tasa de Falsos Negativos (FNR) y la Tasa de Falsos Positivos (FPR), lo que brinda una comprensión más clara de cómo los cambios en el umbral de reconocimiento afectan el número de errores. Cuanto más se acerque la curva DET al punto (0, 0), mejor separa las clases el algoritmo.
Tanto las curvas DET como las ROC suelen usar escalas logarítmicas para mostrar la FPR. Esto las hace más informativas para analizar el rendimiento en condiciones de bajo error, lo cual es especialmente útil en sistemas de reconocimiento facial, donde incluso pequeños cambios en las tasas de error pueden tener implicaciones críticas.
A continuación se muestran ejemplos de curvas ROC y DET para dos modelos abstractos. Las gráficas muestran que el modelo azul demuestra un mejor rendimiento, manteniéndose más cerca del punto cero en la curva DET y más cerca del punto (0, 1) en la curva ROC.


Protocolo de pruebas
Para probar y evaluar el rendimiento de los modelos, y compararse con los competidores, Incode realiza pruebas en sus propias bases de datos y participa en competencias abiertas de evaluación de tecnología de proveedores de reconocimiento facial.
Pruebas internas
Para las pruebas internas, Incode tomó una muestra de ~2M de imágenes únicas de ~800 mil identidades únicas de producción (correctamente distribuidas por países, dispositivos, etc.). A partir de esas imágenes, formamos ~5,000,000 de pares genuinos y ~2,000,000,000,000 de pares impostores.
Luego, se seleccionaron aleatoriamente ~2M de pares genuinos y ~2.4M de los pares impostores más difíciles (aquellos con la mayor confianza) para la comparación de selfies, y un número similar de pares para la comparación de selfie contra identificación. Esto formó un conjunto de datos de ~4,000,000 de pares selfie contra selfie y ~5,500,000 de pares selfie contra identificación en total. Esto se hizo principalmente para acelerar nuestro proceso de pruebas sin comprometer la calidad de la prueba.
Para el análisis, usamos la Tasa de Falsos Positivos (FPR, la proporción de casos en los que el sistema identifica incorrectamente a un usuario no registrado como registrado) y la Tasa de Falsos Negativos (FNR, la proporción de casos en los que el sistema no logra reconocer a un usuario registrado).
Evaluación por el NIST
Los algoritmos de reconocimiento facial de Incode han sido probados por el NIST desde 2018. Las Evaluaciones de Tecnología Facial del NIST (FRTE) son un proceso enfocado específicamente en evaluar la precisión, seguridad y rendimiento de las tecnologías de reconocimiento facial.
Hay dos pistas principales: la Evaluación de Tecnología de Reconocimiento Facial (FRTE) Verificación 1:1, que evalúa la precisión, confiabilidad y eficiencia de los algoritmos de reconocimiento facial para verificar si dos imágenes faciales pertenecen a la misma persona, y la Evaluación de Tecnología de Reconocimiento Facial (FRTE) Identificación 1:N, que evalúa el rendimiento de los algoritmos de reconocimiento facial para identificar a una persona dentro de una base de datos grande comparando una sola imagen facial (1) contra numerosas imágenes almacenadas (N) para encontrar la coincidencia correcta.
El NIST usa los siguientes conjuntos de datos para las pruebas:
- Las imágenes de visa (6.2M de imágenes) se refieren a fotografías recopiladas como parte de solicitudes de visa.
- Las imágenes de fichas policiales (1.4M de imágenes) se recopilan en Estados Unidos durante los procesos rutinarios de registro posteriores a un arresto.
- Las imágenes de solicitud (1.1M de imágenes) se recopilan durante entrevistas presenciales en oficinas de inmigración de EE. UU.
- Las imágenes de cruce fronterizo (2.6M de imágenes) se toman con una cámara web, orientada por un oficial de inmigración hacia un sujeto cooperante.
- Las imágenes de kiosco (1M de imágenes) se toman en kioscos equipados con cámaras diseñadas para capturar un rostro centrado (escenario no cooperativo).
Para 1:1, las métricas usadas son la FMR (Tasa de Falsas Coincidencias, que se refiere a la frecuencia con la que un sistema biométrico hace coincidir incorrectamente la entrada biométrica de una persona con el embedding almacenado de otra persona; esencialmente, mide la tasa de falsos positivos) y la FNMR (Tasa de Falsas No Coincidencias, que mide la frecuencia con la que un sistema biométrico no logra reconocer a un usuario legítimo, identificándolo incorrectamente como no coincidente; esto corresponde a los falsos negativos).
Para 1:N, las métricas usadas son la FNIR (Tasa de Falsa No Identificación, el porcentaje de casos en los que el algoritmo no logra identificar a un sujeto registrado) y la FPIR (Tasa de Falsa Identificación Positiva, el porcentaje de casos en los que el algoritmo identifica incorrectamente a un sujeto no registrado).
Prueba RIVTD Track 2 (reconocimiento facial) de DHS Science & Technology
Los algoritmos de reconocimiento facial de Incode participaron en la prueba RIVTD Track 2 (reconocimiento facial) de DHS Science & Technology. La Demostración de Tecnología de Validación Remota de Identidad (RIVTD) de 2023 es la prueba independiente del gobierno de EE. UU. Incluye una evaluación de 18 sistemas de validación remota de identidad con base en la precisión de coincidencia entre selfie y documento, las tasas de fallo de extracción y la equidad demográfica.
Las tecnologías de validación remota de identidad permiten a las personas acreditar su identidad en línea sin acudir a una ubicación física. RIVTD mide el rendimiento de estos sistemas y el grado en que pueden reducir el fraude manteniendo el acceso a los servicios.
RIVTD se dividió en tres pistas para tres pasos diferentes del proceso de validación remota de identidad. La primera pista, validación de documentos, probó sistemas que determinan si una identificación es genuina o no. La segunda pista, coincidencia con el documento, probó sistemas que determinan si la persona de una selfie es la misma persona retratada en un documento de identidad. La tercera pista, detección de ataques de presentación, probó subsistemas que determinan si una presentación proviene de un usuario legítimo o fraudulento, como alguien que usa una máscara para suplantar a otra persona.
Un total de 1,633 voluntarios participaron en la pista 2 de Remote Identity Validation Tech (RIVTD) a lo largo de dos recopilaciones de datos: Maryland Test Facility (MdTF), en mayo de 2023, y una recopilación remota, en septiembre de 2023. Cada voluntario usó cada teléfono inteligente para proporcionar una imagen de selfie controlada y una no controlada. El personal del equipo de pruebas usó cada teléfono para capturar una imagen controlada del documento (solo se usó el frente del documento).
Para las pruebas se usaron las siguientes métricas:
- Selfie FTXR (Tasa de Fallo de Extracción en Selfie) mide el porcentaje de veces que un sistema no logra extraer datos biométricos útiles de una selfie
- Document FTXR (Tasa de Fallo de Extracción en Documento) mide el porcentaje de veces que un sistema no logra extraer datos biométricos útiles de la imagen de un documento
- FNMR (Tasa de Falsas No Coincidencias) mide la probabilidad de que un sistema determine incorrectamente que fotos coincidentes de una selfie y un documento de identidad no pertenecen a la misma persona.
Había tres opciones para la configuración del umbral: E (Esperado): la FMR (Tasa de Falsas Coincidencias) es de 1:10,000, garantizando que solo ocurra una coincidencia incorrecta por cada 10,000 intentos; P (Permisivo): la FMR es tres veces mayor que la esperada de 1:10,000; y C (Conservador): la FMR es tres veces menor que la esperada de 1:10,000.
Una FMR esperada de 1:10,000 se refiere a establecer el umbral de la Tasa de Falsas Coincidencias en 1 de cada 10,000 comparaciones, garantizando que solo ocurra una coincidencia incorrecta por cada 10,000 intentos.
Ventajas clave de nuestra tecnología
Uso de conjuntos de datos propietarios grandes y balanceados
El uso de nuestros conjuntos de datos propietarios grandes y balanceados es un factor clave para garantizar que nuestros modelos sean precisos, justos y capaces de funcionar bien bajo una amplia gama de condiciones externas e internas.
Dado que los procesos de recopilación, limpieza y etiquetado de datos están totalmente bajo nuestro control, garantizamos alta calidad, representatividad y diversidad en nuestros datos, lo cual es crucial para mantener el liderazgo en la industria y ofrecer a nuestros clientes tecnologías de reconocimiento facial confiables y efectivas.
Durante la recopilación de datos, prestamos especial atención a incluir una amplia gama de grupos de edad, géneros, etnias y razas. Esto garantiza que nuestros modelos funcionen con precisión y equidad para todos los usuarios. Además, nuestros conjuntos de datos incluyen imágenes capturadas bajo diversas condiciones de iluminación, con diferentes fondos, ángulos y expresiones faciales. En cuanto a las imágenes de identificaciones, nuestros conjuntos de datos cubren una amplia variedad de tipos de identificación. Esto hace que los modelos sean más robustos a las variaciones y mejora su confiabilidad en escenarios del mundo real.
Al usar nuestros datos propietarios, podemos garantizar su calidad, relevancia y cumplimiento de todos los estándares legales y éticos, ya que recopilamos datos de clientes que firmaron el consentimiento de aprendizaje automático (‘ML Consent’).
Tenemos dos grandes conjuntos de datos internos:
- El primer conjunto de datos se usa para entrenamiento y contiene ~41M de imágenes únicas de ~4.6M de identidades únicas.
- El segundo conjunto de datos se usa para pruebas y contiene ~2M de imágenes únicas de ~800 mil identidades únicas.
Ambos conjuntos de datos incluyen datos de selfies y de identificaciones.
Para garantizar la calidad de los datos, aplicamos métodos de etiquetado semiautomatizados usando nuestros algoritmos propietarios de agrupamiento y limpieza, que nos permiten procesar y estructurar eficientemente cantidades masivas de datos. Esto nos ha permitido crear conjuntos de datos que no solo son enormes en tamaño, sino también diversos, cubriendo una amplia gama de rostros y reflejando escenarios reales de uso de nuestros productos.
Precisión sobresaliente al comparar selfies con fotos de documentos de identidad
Gracias a que nuestros datos reflejan escenarios reales de uso de nuestros productos, logramos una precisión sobresaliente al comparar selfies contra documentos de identidad, superando significativamente a nuestros competidores.
Nuestro modelo está entrenado para reconocer rostros incluso en presencia de hologramas, marcas de agua y otros elementos de seguridad que crean interferencia visual en las fotos de los documentos.
Nuestras pruebas internas confirman que en la tarea general de comparar selfies con selfies, todos los proveedores muestran un rendimiento comparable, con una precisión de alrededor del 99.5–99.9%. Sin embargo, en la tarea críticamente importante de la verificación de identidad —comparar selfies con fotos de documentos—, nuestra tecnología supera significativamente a los competidores, alcanzando una precisión del 98.5%, mientras que el competidor más cercano logra solo el 90%.
La siguiente curva ROC demuestra la superioridad de nuestro modelo sobre los competidores en distintos niveles de Tasa de Falsos Positivos.

A continuación se muestran ejemplos que resolvimos con éxito, a diferencia de nuestros competidores, lo que demuestra claramente nuestras ventajas.


Las fotos de los documentos suelen contener elementos de seguridad que crean interferencia. Además, tomamos en cuenta factores como la iluminación, el ángulo del rostro y la calidad de la imagen al desarrollar modelos robustos a estas variaciones. Nuestra tecnología procesa con precisión ese tipo de imágenes. En el ejemplo de la izquierda, identificamos correctamente a dos personas diferentes, mientras que los competidores se equivocaron. En el ejemplo de la derecha, reconocimos con precisión a una sola persona, mientras que los competidores las identificaron incorrectamente como individuos diferentes.
Posiciones de liderazgo en los rankings de NIST y DHS S&T RIVTD Track 2
Nuestros sistemas de reconocimiento facial demuestran resultados sobresalientes en pruebas oficiales realizadas por organizaciones líderes como el Instituto Nacional de Estándares y Tecnología (NIST) y el Departamento de Seguridad Nacional de EE. UU. (DHS S&T). Estos logros confirman nuestro liderazgo en el mercado de tecnologías de reconocimiento facial y destacan la alta calidad de nuestras soluciones.
Evaluaciones de Tecnología Facial del NIST (FRTE)
Incode demuestra resultados sobresalientes y respetables en las métricas FNIR y FPIR. Incode se ubicó entre los mejores participantes, y los valores de las métricas están dentro del rango aceptable para algoritmos de reconocimiento facial altamente efectivos.
En la primera métrica (Tasas de Falsa No Identificación (FNIR) para el caso donde se establece un umbral que limita la Tasa de Falsa Identificación Positiva (FPIR) a 0.003), tenemos 0.0038 en visa-border, y estamos en el top 15 en todos los conjuntos de datos, excepto en Mugshot/Profile y Mugshot/Mugshot ΔT ≥ 12 AÑOS.
GalleryMugshotMugshotMugshotVisaVisaProbeMugshotMugshotWebcamBorderKioskN12M16M16M16M16Mincode-006 FNIR T >00.00230.00140.00960.00380.0681
En la segunda métrica (Tasas de Falsa No Identificación (FNIR) para el caso donde el umbral se establece en cero y el algoritmo devuelve un número fijo (50) de candidatos), tenemos 0.0025 de FNIR en visa-border (16M), y ocupamos el puesto 13 en Mugshot/Mugshot y el 14 en Border/Border ΔT ≥ 10 AÑOS.
GalleryMugshotMugshotMugshotVisaVisaProbeMugshotMugshotWebcamBorderKioskN12M16M16M16M16Mincode-006 FNIR Rank 1, T=00.00130.00110.00800.00250.0536
Además, el tamaño de la población registrada prácticamente no afecta el rendimiento de Incode.
Demostración de Tecnología de Validación Remota de Identidad (RIVTD) 2023
Se postularon 18 proveedores. Solo 16 fueron aceptados. Los resultados son anónimos y no sabemos quiénes fueron los demás proveedores ni cómo se desempeñó cada uno individualmente. Incode demuestra resultados distinguidos. Incode fue 1 de solo:
- 6 que documentaron una “tasa de fallo de extracción” (FTXR) por debajo del 1%;
- 5 que tienen un umbral conservador (C) con una FMR (Tasa de Falsas Coincidencias) tres veces menor que la esperada de 1:10,000
- 9 que tuvieron una FNMR por debajo del 1%
- 3 para los cuales todo lo anterior es cierto
Estos resultados confirman la ventaja de nuestra tecnología en la tarea críticamente importante de la verificación de identidad, donde comparar selfies con documentos de identidad requiere alta precisión y robustez ante las variaciones en las condiciones de captura.
Alta eficiencia en casos de uso del mundo real
Nuestra tecnología de reconocimiento facial demuestra alta eficiencia en condiciones del mundo real, donde se requiere una identificación precisa y rápida. Nuestros clientes reportan que el sistema de Incode comete menos errores en comparación con los competidores, permite una identificación rápida del usuario y funciona eficazmente en condiciones de poca luz, en diversos ángulos e incluso con elementos de seguridad presentes en los documentos.
Líderes de diversas industrias confían en Incode:

Nada demuestra mejor la confiabilidad y precisión de nuestra tecnología que ejemplos reales de su uso. En los siguientes ejemplos, mostraremos cómo nuestro sistema mejora la seguridad en los estadios y aumenta el rendimiento promedio durante el registro de pasajeros en los aeropuertos.
Caso de estudio 1: entre a los partidos de forma segura con Fan ID
Antes del evento en Querétaro, la inseguridad y la violencia ya habían impactado a la Liga MX, con varios incidentes que pusieron en riesgo la seguridad de aficionados, jugadores y oficiales. Sin embargo, el incidente más notorio fue la pelea masiva en el Estadio Corregidora en 2022, durante un partido entre Querétaro y Atlas, que resultó en sanciones severas, cierres de estadios y un llamado urgente a mejorar la seguridad en los eventos deportivos. Estos incidentes llevaron a la implementación de medidas como el FAN ID para controlar el acceso y reforzar la seguridad en los estadios.
La Federación Mexicana de Fútbol (FMF) y la Liga MX, junto con sus 18 clubes, se asociaron con Incode para implementar el sistema FAN ID en todos los partidos de la Liga MX y de la Selección Nacional Mexicana. Este sistema busca mejorar la seguridad de los estadios al permitir una identificación biométrica eficiente de los aficionados y controlar el acceso de una manera más segura y organizada, creando un entorno más seguro para todos los asistentes. Este sistema eleva los niveles de seguridad en los estadios al detectar rápidamente a las personas vetadas del evento (visitantes previamente involucrados en actividades delictivas e incluidos en la lista negra).




Desde su implementación en enero de 2023, se han generado más de 3 millones de registros de FAN ID por parte de aficionados usando más de 150 tipos de identificación (INE, pasaportes, licencias de conducir), incluyendo a ciudadanos extranjeros.
La adaptación cultural ha mejorado constantemente, y el impacto de esta implementación parece reflejarse en el aumento de asistencia a los partidos de la Liga MX al comparar distintos torneos:
- Clausura (torneo de primavera):
- 3.08 millones de personas asistieron en 2022
- 4.1 millones de personas asistieron en 2023 (se usó FAN ID)
- 4.16 millones de personas asistieron en 2024 (se usó FAN ID)
- Apertura (torneo de otoño):
- 3.57 millones de personas asistieron en 2022
- 3.78 millones de personas asistieron en 2023 (se usó FAN ID)
Comentarios de visitantes y personal:
“Cuando comenzamos a aplicar mayor presencia policial en los estadios, FAN ID, y redujimos la presencia de grupos de animación visitantes, comenzamos a ver una correlación con el aumento de asistencia a los estadios.”
— Mikel Arriola, Presidente de la Liga MX
“Buscábamos que la solución estuviera diseñada pensando en la comodidad del aficionado; la realidad es que es un proceso digital, en línea, muy sencillo, que debería tomar dos o tres minutos completar.”
— Germán Elvira, Director de Marketing Digital de la Liga MX
Caso de estudio 2: registro acelerado en aeropuertos
En los aeropuertos modernos, el proceso de registro y control de pasajeros debe ser lo más rápido y confiable posible. Viva Aerobus —una de las aerolíneas más grandes de México—, que opera a través del Aeropuerto Internacional de la Ciudad de México (AICM) y el Aeropuerto Internacional de Monterrey, implementó junto con Incode un sistema de registro sin contacto mediante reconocimiento facial, eliminando la necesidad de pases de abordar en papel y de comprobaciones manuales de documentos por parte del personal. Esto mejoró significativamente tanto la comodidad de los pasajeros como la eficiencia operativa del aeropuerto.
.jpg)

.jpg)
Antes de implementar nuestro sistema, el proceso de abordaje era más tardado y propenso a errores humanos. Después de desplegar el sistema, no solo se redujeron significativamente el tiempo de procesamiento y los errores, sino que también se reforzaron las medidas de seguridad.
En el AICM, donde el sistema cruza la información entre la identificación, el pase de abordar y el rostro del pasajero, el tiempo de procesamiento se reduce en un 55-60%, disminuyendo la verificación de 8-9 segundos a solo 3-4 segundos, a la vez que se eliminan los errores asociados con la verificación humana.
El Aeropuerto Internacional de Monterrey solo verifica que el pasajero tenga un pase de abordar válido y, aunque el proceso de abordaje puede tomar un poco más de tiempo, el sistema mejora la seguridad al garantizar que la persona correcta esté presentando su pase de abordar.
En ambos casos, los pasajeros se benefician de una experiencia de abordaje fluida usando su biometría.
Comentarios de pasajeros y personal del aeropuerto
No pudimos registrar los nombres de los pasajeros porque habría interrumpido el proceso de abordaje, pero escuchamos varios comentarios.
“Esto se siente como en los aeropuertos de Estados Unidos”
“Qué bueno que ya no tenemos que mostrar los documentos todo el tiempo. Mucho más rápido”
“Es como lo que vi en Estados Unidos/Europa, me sorprende verlo aquí.”
Mejoras continuas del modelo
Realizamos regularmente experimentos con diversas arquitecturas modernas y enfoques de entrenamiento, explorando oportunidades de mejora. Como parte de estos estudios, analizamos la efectividad de distintas funciones de activación y funciones de pérdida, experimentamos con enfoques modernos como los transformers y examinamos métodos de muestreo y aumento de datos. Además, seguimos de cerca las tendencias tecnológicas y exploramos la posibilidad de integrarlas para mejorar la funcionalidad de nuestros sistemas.
Actualizamos y ampliamos regularmente nuestros conjuntos de datos, lo cual es uno de los factores clave para mantener y mejorar la calidad del rendimiento de nuestros modelos. La recopilación continua de datos nuevos permite a nuestros modelos adaptarse a condiciones cambiantes y garantizar una alta precisión de reconocimiento en diversos escenarios. Los datos nuevos permiten a los modelos manejar condiciones en evolución, como la aparición de nuevos tipos de documentos con elementos de seguridad mejorados que impactan la calidad general de las imágenes faciales.
Además de la recopilación de datos, experimentamos con aumentar la diversidad de los datos generando datos sintéticos mediante modelos generativos. Esto permite ampliar los conjuntos de datos sin comprometer la privacidad, garantizando al mismo tiempo una cobertura más amplia de diversos grupos demográficos.
Las mejoras de precisión de nuestro algoritmo a lo largo del tiempo en el conjunto de datos Mugshot-to-Mugshot del NIST demuestran que, a pesar de los excelentes valores absolutos de FNMR, seguimos mejorando continuamente la eficiencia de nuestros modelos.

¿Preguntas o comentarios? Contáctenos:
