การเปรียบเทียบสถานการณ์การใช้งานอัลกอริทึมแฮชรูปภาพและวิดีโอ-pHash-PDQ-TMK+PDQF

วิเคราะห์เปรียบเทียบลักษณะทางเทคนิคและสถานการณ์การใช้งานของอัลกอริทึมแฮชหลัก 3 แบบ ได้แก่ pHash, PDQ และ TMK+PDQF

Aug 29, 2025 11:34 อ่าน 139 ครั้ง ประมาณ 32 คำ อ่านประมาณ 1 นาที

สรุปก่อน: pHash เหมาะกว่าสำหรับการลบรูปภาพซ้ำและการค้นหารูปภาพที่คล้ายกันในระดับภาพ; PDQ คือฟิงเกอร์พรินต์ภาพบิตสูงสำหรับรูปภาพ; TMK+PDQF (รวมถึงการใช้งาน vPDQ) คืออัลกอริทึมฟิงเกอร์พรินต์สำหรับวิดีโอที่มีข้อมูลลำดับเวลา

เอกสารทางการยังมีอินเทอร์เฟซสำหรับเสียงและวิดีโอ แต่ส่วนวิดีโอจะส่งคืนลำดับแฮชระดับเฟรม โดยพื้นฐานคือ “แฮชภาพทีละเฟรม” ซึ่งขาดการเข้ารหัสลำดับเวลาอย่างชัดเจน จึงมักใช้สำหรับการคัดกรองแบบเบา มากกว่าการจับคู่วิดีโอที่มีความทนทานสูง

pHash

pHash เป็นไลบรารีแฮชเชิงรับรู้แบบโอเพนซอร์ส ใช้มาอย่างยาวนานในการค้นหารูปภาพที่คล้ายกัน และมีการใช้งานแฮชภาพ เช่น DCT และ Marr wavelet เหมาะสำหรับสถานการณ์การลบรูปภาพซ้ำและการค้นหารูปภาพที่เกือบซ้ำกัน

PDQ

PDQ เป็นอัลกอริทึม “photo-hashing” แบบโอเพนซอร์สของ Meta ซึ่งให้ฟิงเกอร์พรินต์ภาพ 256 บิต ออกแบบมาเพื่อการจับคู่เนื้อหารูปภาพที่รวดเร็วและกำหนดค่า threshold ได้ ใช้อย่างแพร่หลายในงานควบคุมความเสี่ยงด้านเนื้อหาและคลังข้อมูลที่แชร์ข้ามแพลตฟอร์ม

ในสถานการณ์วิดีโอ PDQ สามารถใช้เป็นคอมโพเนนต์สำหรับ “สร้างฟิงเกอร์พรินต์ทีละเฟรม” ได้ แต่โซลูชันวิดีโอทางการแนะนำให้ใช้ร่วมกับการสร้างแบบจำลองลำดับเวลามากกว่า (ดู TMK+PDQF/vPDQ)

TMK+PDQF (รวม vPDQ)

TMK+PDQF เป็นอัลกอริทึมความคล้ายกันของวิดีโอ: หลังจากคำนวณฟีเจอร์ PDQF (PDQ เวอร์ชันจุดลอยตัว) สำหรับแต่ละเฟรมแล้ว จะสร้างคำอธิบายความยาวคงที่สองชั้นผ่าน time kernel เพื่อให้ในการค้นหาสามารถเปรียบเทียบชั้นทั่วโลกก่อน แล้วจึงเปรียบเทียบชั้นลำดับเวลา เพื่อเพิ่มความทนทานของการจับคู่ระดับวิดีโอ

มาตรฐานเปรียบเทียบและเอกสารในอุตสาหกรรมจัดให้ TMK+PDQF (รวมถึง vPDQ รุ่นถัดมา) เป็นโซลูชันฟิงเกอร์พรินต์วิดีโอแบบโอเพนซอร์ส สำหรับการจับคู่วิดีโอที่เกือบซ้ำกันและการจับคู่ระดับช่วงวิดีโอภายใต้การเข้ารหัสใหม่ รวมถึงการเปลี่ยนแปลงความละเอียดและบิตเรต