Comparación de escenarios de aplicación de algoritmos hash para imágenes y vídeo-pHash-PDQ-TMK+PDQF

Análisis comparativo de las características técnicas y los escenarios de aplicación de tres algoritmos hash principales: pHash, PDQ y TMK+PDQF.

Aug 29, 2025 11:34 145 lecturas Unas 398 palabras Unos 1 min de lectura

Primero, la conclusión: pHash es más adecuado para la deduplicación y la búsqueda de similitud a nivel de imagen; PDQ es una huella digital de imagen de alto número de bits orientada a imágenes; TMK+PDQF (y su implementación vPDQ) es un algoritmo de huella digital orientado a vídeo que incluye información temporal.

La documentación oficial también proporciona interfaces de audio y vídeo, pero la parte de vídeo devuelve una secuencia de hashes a nivel de fotograma; en esencia, se trata de “hashes de imagen fotograma a fotograma”, sin codificación temporal explícita, y normalmente se usa para cribados ligeros más que para una coincidencia de vídeo robusta.

pHash

pHash es una biblioteca de hash perceptual de código abierto, utilizada durante mucho tiempo para la búsqueda de similitud de imágenes, y ofrece implementaciones de hash de imagen como DCT y wavelets de Marr, adecuadas para escenarios de deduplicación de imágenes y búsqueda de casi duplicados.

PDQ

PDQ es un algoritmo de “photo-hashing” de código abierto de Meta, que genera una huella digital de imagen de 256 bits, diseñado para coincidencias rápidas y con umbrales sobre contenido de imágenes, y se utiliza ampliamente en la gestión de riesgos de contenido y en bibliotecas compartidas entre plataformas.

En escenarios de vídeo, PDQ puede utilizarse como componente para “tomar huellas digitales fotograma a fotograma”, pero la solución de vídeo oficial recomienda combinarlo con modelado temporal (véase TMK+PDQF/vPDQ).

TMK+PDQF (incluido vPDQ)

TMK+PDQF es un algoritmo de similitud de vídeo: tras calcular para cada fotograma características PDQF (la versión de coma flotante de PDQ), construye dos capas de descriptores de longitud fija mediante un núcleo temporal, de modo que, durante la recuperación, primero se compara la capa global y luego la capa temporal para mejorar la solidez de la coincidencia a nivel de vídeo.

Los benchmarks y la documentación del sector sitúan a TMK+PDQF (y al posterior vPDQ) como una solución de huella digital de vídeo de código abierto, orientada a la detección de casi duplicados de vídeo y coincidencias a nivel de segmento bajo recodificación y cambios de resolución y bitrate.