Анализ технологий обнаружения повторяющегося и заимствованного контента на видеоплатформах

Подробный анализ того, как эти видеоплатформы определяют дублирование видео и перенос чужого контента, обзор используемых алгоритмических технологий и подробное объяснение принципов их работы на конкретных примерах.

Aug 29, 2025 11:40 148 прочтений Около 170 слов Около 1 мин чтения

Платформы коротких видео, такие как Douyin, TikTok, YouTube и другие, сталкиваются с вызовом огромного объема пользовательского контента, среди которого обнаружение повторяющихся видео и заимствованного контента стало ключевой технической задачей управления контентом на платформах. В этом отчете подробно анализируется, как такие видеоплатформы определяют дублирование видео и случаи переноса контента, рассматриваются используемые алгоритмические технологии, а также на конкретных примерах подробно объясняются принципы их работы.

Блок-схема технологии обнаружения повторов на видеоплатформах

Основные методы обнаружения повторов на видеоплатформах

Технология хеш-сравнения

Первым методом, который используют видеоплатформы, является технология хеш-сравнения. Это самый базовый, но и самый быстрый способ обнаружения. Платформа генерирует для каждого загруженного видео несколько типов хеш-значений:

MD5-хеш — самый простой метод: он определяет полностью одинаковые файлы путем вычисления MD5-значения видеофайла. Когда пользователь напрямую загружает видео без изменений, система может за миллисекунды обнаружить повторяющийся контент по совпадению MD5-значения. Однако этот метод не способен выявлять видео, подвергшиеся какому-либо редактированию: даже простое преобразование формата или сжатие создаст совершенно другое MD5-значение.

Технология перцептивного хеширования более продвинута и позволяет обнаруживать видео, визуально похожие, но технически разные. Система извлекает ключевые кадры видео и с помощью DCT (дискретного косинусного преобразования) или других алгоритмов генерирует хеш-код фиксированной длины. Сходство между перцептивными хешами двух видео вычисляется по расстоянию Хэмминга; если расстояние Хэмминга меньше заданного порога, контент признается повторяющимся.

Технология аудиоотпечатков

Технология аудиоотпечатков — важный инструмент видеоплатформ для обнаружения заимствованного контента; наиболее известным примером является технология распознавания аудио на основе алгоритма Shazam. Она анализирует спектральные характеристики аудиосигнала и создает уникальный «аудиоотпечаток», позволяющий распознавать одинаковый или похожий аудиоконтент.

Процесс создания аудиоотпечатка включает следующие шаги: сначала аудио дискретизируется с частотой 44.1kHz, затем с помощью **кратковременного преобразования Фурье (STFT)** формируется спектрограмма. Система извлекает из спектрограммы пиковые точки, представляющие наиболее выраженные частотные компоненты аудиосигнала. Далее алгоритм объединяет эти пиковые точки в пары, формируя «созвездие»; каждая пара содержит два значения частоты и разницу во времени между ними: Constellation(P1,P2,Δt)=(f1,f2,Δt).

Анализ визуальных признаков

Современные видеоплатформы широко используют технологии извлечения визуальных признаков на основе глубокого обучения. С помощью моделей глубокого обучения, таких как сверточные нейронные сети (CNN), система может извлекать высокоуровневые семантические признаки видеокадров, которые отражают суть содержания видео, а не поверхностную информацию о пикселях.

Преимущество этого метода заключается в способности обнаруживать видео после сложного редактирования, например цветокоррекции, обрезки, добавления водяных знаков, изменения скорости воспроизведения и т. д. Даже если видео значительно изменилось на уровне пикселей, его глубинные семантические признаки часто остаются относительно стабильными.

Сравнение алгоритмов обнаружения повторов видео

Проверка временной согласованности

Анализ временной согласованности — еще одно важное измерение для выявления переноса видео. Эта технология распознает дублирующийся контент, анализируя временные связи между кадрами видео и непрерывность действий. Двухуровневый метод обнаружения (Dual-level Detection) стал важным прорывом в этой области и включает два уровня: обнаружение видеомонтажа (VED) и обнаружение сцен в кадрах (FSD).

Модуль обнаружения видеомонтажа сначала определяет, подвергалось ли видео редактированию. Для неотредактированных видео система использует случайный вектор в качестве дескриптора, чтобы экономить вычислительные ресурсы. Для отредактированных видео система выполняет более глубокий покадровый анализ, включая проверку наличия склеек нескольких сцен в видео.

Подробный разбор ключевых алгоритмических технологий

Семейство алгоритмов перцептивного хеширования

Алгоритм pHash (перцептивное хеширование) — широко используемая технология в обнаружении дубликатов видео. Алгоритм генерирует хеш-значение следующим образом: сначала изображение масштабируется до стандартного размера 32×32 пикселя, затем применяется дискретное косинусное преобразование (DCT) для извлечения частотных характеристик изображения. Далее алгоритм сохраняет область 8×8 в левом верхнем углу коэффициентов DCT (низкочастотную часть), вычисляет среднее значение этих коэффициентов и, наконец, генерирует 64-битный двоичный хеш-код путем сравнения каждого коэффициента со средним значением.

Алгоритм dHash (разностное хеширование) использует другую стратегию: он масштабирует изображение до 9×8 пикселей, а затем вычисляет различия между соседними пикселями. Если определенный пиксель ярче соседа справа, в хеш-код записывается 1, в противном случае — 0. Этот метод более чувствителен к горизонтальным изменениям изображения и лучше улавливает его структурные характеристики.

Глубокий анализ алгоритмов аудиоотпечатков

Подробный рабочий процесс алгоритма аудиоотпечатков Shazam

Суть алгоритма Shazam заключается в технологии сопоставления созвездий. Сначала алгоритм с помощью быстрого преобразования Фурье (FFT) преобразует аудиосигнал из временной области в частотное представление:

STFT(t,f)=n=0N1x(t+n)ej2πfn

где x(t+n) обозначает аудиосэмплы во временном окне, а ej2πfn — комплексная экспоненциальная функция.

Процесс извлечения пиков выявляет значимые характерные точки на спектрограмме путем задания порогового значения:

STFT(t,f) & \text{если} STFT(t,f) > threshold \\ 0 & \text{иначе} \end{cases}$$ Построение созвездия является ключевым этапом алгоритма. Система объединяет извлеченные пиковые точки в пары; каждая пара содержит два значения частоты и разницу во времени между ними. Такой способ формирования пар обеспечивает алгоритму высокую устойчивость к шуму и незначительным искажениям аудио.[4] Процесс генерации хэша преобразует информацию созвездия в компактный цифровой отпечаток: $$Hash(P1, P2, \Delta t) = Hash(f1, f2, \Delta t)$$ Это хэш-значение хранится в базе данных как уникальный идентификатор аудиофрагмента и используется для последующего быстрого сопоставления.[4] ### Извлечение признаков с помощью глубокого обучения

Технология самоконтролируемого видеохэширования (SSVH) представляет собой одно из новейших применений глубокого обучения в обнаружении дубликатов видео. Она использует архитектуру иерархического бинарного автоэнкодера, включающую энкодер и три декодера: прямой иерархический бинарный декодер, обратный иерархический бинарный декодер и глобальный иерархический бинарный декодер.

Энкодер использует структуру бинарной LSTM (BLSTM), которая способна напрямую генерировать бинарные хэш-коды без этапов постобработки. Поток данных BLSTM следует схеме стандартной LSTM, но в конце добавляется знаковая функция bt=sgn(ht) для получения бинарного вывода.

Чтобы решить NP-трудную задачу бинарной оптимизации, алгоритм использует приближенную знаковую функцию:

-1 & \text{когда} h < -1 \\ h & \text{когда} -1 \leq h \leq 1 \\ 1 & \text{когда} h > 1 \end{cases}$$ Этот приближенный метод позволяет градиентам проходить через знаковую функцию в процессе обратного распространения, благодаря чему всю сеть можно обучать сквозным образом.[9] ### Алгоритм анализа временной согласованности

Алгоритм перераранжирования по временной согласованности является ключевой технологией для локализации видеофрагментов. Сначала алгоритм извлекает признаки на уровне изображения с помощью агрегации ключевых точек и глубокого обучения, а затем использует структуру из нескольких k-d деревьев для эффективного KNN-поиска, получая набор кандидатных видеофрагментов.

Инновация алгоритма заключается в этапе отсечения по временной согласованности: за счет анализа информации о временных метках и ID последовательностей кандидатных фрагментов он точно выявляет совпадающие фрагменты и их временное положение в последовательности. Этот метод позволяет выполнять запрос по одному кадру в базе данных из 1 миллиона кадров за 83,96 миллисекунды, а время запроса в базе данных из 4,5 миллиона кадров составляет 462,59 миллисекунды.

Анализ конкретных примеров реализации

Система YouTube Content ID

Система YouTube Content ID — одна из самых зрелых технологий обнаружения нарушений авторских прав в отрасли. Она использует многоуровневую стратегию проверки:

Первый уровень — сопоставление аудиоотпечатков. Система генерирует аудиоотпечаток для каждого загружаемого видео и сравнивает его с крупной эталонной базой данных. Даже если в аудио изменена тональность, скорректирована скорость или добавлен фоновый шум, система все равно может обнаружить совпадающий контент с помощью спектрального анализа.

Второй уровень — анализ визуального контента. Система использует модели глубокого обучения для анализа визуальных признаков видео, включая распределение цветов, текстурные паттерны, распознавание объектов и т. д. Эти признаки кодируются в многомерные векторы, а сходство видео определяется путем вычисления косинусной близости.

Третий уровень — сопоставление метаданных. Система сравнивает метаданные видео, такие как заголовок, описание и теги, и принимает комплексное решение с учетом результатов указанных выше технологий.

Двойной механизм проверки TikTok/抖音

抖音 и TikTok используют двойной механизм проверки, чтобы учитывать специфику коротких видео:

Проверка в реальном времени: во время загрузки видео пользователем система в реальном времени вычисляет перцептивный хэш видео и аудиоотпечаток. Благодаря быстрому сравнению с существующей базой данных система может за несколько секунд выявить очевидно дублирующийся контент.

Глубокий офлайн-анализ: для видео, прошедших проверку в реальном времени, система выполняет более глубокий анализ в фоновом режиме. Модель CNN используется для извлечения семантических признаков и анализа оригинальности содержания видео. Для видео с обнаруженными незначительными изменениями система рассчитывает показатель сходства; контент, превышающий пороговое значение, помечается как потенциально скопированный.

Данные о фактической эффективности обнаружения

Согласно исследовательским данным, современные технологии аудиоотпечатков в идеальных условиях могут достигать 100% точности распознавания:

  • Аудиофрагмент 1 секунда: точность распознавания 60%

  • Аудиофрагмент 2 секунды: точность распознавания 95.6%

  • 5 секунд и более: точность распознавания 100%

Для обнаружения видео двухуровневый метод обнаружения достиг полноты 98.8% на наборе данных FIVR-200K и 94.1% на наборе данных VCSL.

Показатели производительности технологии перцептивного хеширования:

  • Скорость обработки: время обработки одного кадра менее 1 миллисекунды

  • Эффективность хранения: для каждого видеокадра требуется всего 8 байт для хранения хеша

  • Точность обнаружения: для слегка измененных видео точность обнаружения может достигать 85-90%

Проблемы и тенденции технологического развития

Противодействие состязательным атакам

На фоне глобального взлета популярности коротких видео распространители скопированного контента постоянно совершенствуют способы обхода обнаружения. Состязательные атаки — одна из главных текущих проблем. Злоумышленники добавляют в видео небольшие сигналы-возмущения или используют специальные приемы редактирования, пытаясь обмануть системы обнаружения.

Чтобы справиться с этими вызовами, платформы разрабатывают более устойчивые алгоритмы обнаружения. Например, технология топологических отпечатков анализирует топологическую структуру аудиосигнала с помощью теории персистентной гомологии; такой метод обладает более высокой устойчивостью к растяжению по времени и изменению высоты тона.

Мультимодальное объединенное обнаружение

Современные системы обнаружения видео все чаще используют стратегии мультимодального объединения. Одновременно анализируя визуальное содержание видео, аудиопризнаки, текстовую информацию (например, субтитры и заголовки) и модели распространения в социальных сетях, система может создавать более полный цифровой отпечаток контента.

Преимущество этого подхода в том, что даже если одна модальность намеренно изменена, признаки других модальностей по-прежнему могут предоставлять эффективные сигналы для обнаружения. Например, даже если видеоряд существенно изменен, его аудиопризнаки и модель распространения могут все равно выдать факт копирования.

Оптимизация периферийных вычислений

В будущем обнаружение видео будет развиваться в сторону работы в реальном времени и облегченных решений. В новых алгоритмах основное внимание уделяется:

Вычислительной эффективности: разработке легких алгоритмов обнаружения, которые могут работать на мобильных устройствах и сокращают зависимость от облачных сервисов.

Работе в реальном времени: реализации обнаружения непосредственно во время загрузки видео, а не в традиционном режиме постобработки.

Защите конфиденциальности: обнаружению контента при сохранении конфиденциальности пользователей и предотвращении утечки исходного видеоконтента.

Сравнение производительности алгоритмов

Разные алгоритмы обнаружения имеют свои преимущества и подходящие сценарии применения:

Хеш MD5 подходит для обнаружения полностью идентичных файлов, отличается чрезвычайно высокой скоростью и точностью, но не способен обрабатывать какие-либо изменения.

Перцептивное хеширование обеспечивает хороший баланс между скоростью и устойчивостью, подходит для обнаружения слегка измененного контента и является предпочтительной технологией для большинства платформ.

Аудиоотпечатки обеспечивают очень высокую точность обнаружения аудиоконтента и сохраняют хорошую производительность даже при наличии фонового шума, однако обладают относительно высокой вычислительной сложностью.

Методы глубокого обучения способны понимать семантическое содержание видео и обладают мощными возможностями обнаружения при сложном редактировании, но требуют значительных вычислительных ресурсов и обучающих данных.

Временной анализ хорошо подходит для обнаружения склейки и рекомбинации видеофрагментов, но имеет относительно низкую скорость обработки и обычно используется как средство вторичной проверки.

В практическом применении видеоплатформы обычно используют стратегию объединения нескольких алгоритмов и динамически выбирают наиболее подходящую комбинацию алгоритмов в зависимости от характеристик видео и требований к обнаружению. Такая многоуровневая архитектура обнаружения обеспечивает полноту проверки, одновременно учитывая вычислительную эффективность и контроль затрат.

В заключение

К текущим основным технологическим направлениям относятся перцептивное хеширование, аудиоотпечатки, извлечение признаков с помощью глубокого обучения и анализ временной согласованности; каждая технология имеет свои уникальные преимущества и сценарии применения. По мере постоянного развития технологий искусственного интеллекта будущие системы обнаружения станут более интеллектуальными, быстрыми и точными, при этом также потребуется найти лучший баланс между технологическим прогрессом и пользовательским опытом.