Исследователи представили GraphVid — систему генерации видео, которая снижает показатель Fréchet Inception Distance на 39,9 % и Fréchet Video Distance на 37,6 % по сравнению с предыдущими моделями. Повышение реализма и точности передачи движения имеет огромное значение для всех, кто занимается созданием симуляторов робототехники, комплексов для обучения беспилотного вождения или компьютерной анимации.

Почему существующие методы оказываются недостаточно эффективными

Современные управляемые генераторы видео полагаются на два типа входных данных. Текстовые подсказки (промпты) дают лишь расплывчатое описание, но не позволяют точно задать траекторию объекта. Инструменты построения траекторий заставляют пользователей прорисовывать путь на уровне пикселей для каждого участника сцены, что становится невозможным, когда в кадре присутствует множество взаимодействующих объектов или происходят перекрытия (окклюзии). В итоге инженеры тратят гораздо больше времени на исправление ошибок в траекториях, чем на создание задуманного движения.

Подход GraphVid на основе графа взаимодействий

GraphVid заменяет нарисованные вручную пути высокоуровневым графом взаимодействий. Вместо попиксельного картирования пользователь определяет взаимосвязи: «объект А приближается к объекту Б», «объект В следует за объектом Г», «объект Д сталкивается с объектом Е». Модель считывает граф как чертеж и преобразует сигналы о взаимосвязях в согласованное движение и внешний вид. Благодаря фокусу на семантике, а не на «сырых» координатах, система отслеживает объекты, даже когда они скрываются за другими объектами.

Команда разработала специализированный набор данных для обучения — GraphVid-Bench, который сопоставляет видеоклипы со структурированными реляционными данными. Этот датасет показывает модели, как несколько объектов движутся вместе при различных сценариях взаимодействия, формируя «словарь движений», который она может комбинировать во время инференса.

Прирост производительности

Метрика Предыдущие модели GraphVid
Fréchet Inception Distance (FID) ↓ 39,9 %
Fréchet Video Distance (FVD) ↓ 37,6 %
Peak Signal-to-Noise Ratio (PSNR) 9,87 15,98
Structural Similarity Index (SSIM) 0,38 0,61

Более низкие значения FID и FVD означают, что сгенерированные видео выглядят более реалистично, а движение между кадрами становится более плавным. Скачок показателей PSNR и SSIM указывает на более четкие текстуры и лучшее сохранение структуры. В совокупности эти цифры доказывают, что GraphVid создает видео, заметно более близкие к реальным съемкам.

Эффективность и практическая значимость

GraphVid достигает таких результатов, используя меньше параметров и меньший объем обучающих данных, чем предыдущие подходы. Модель анализирует структуру сцены, а не просто заучивает динамику на уровне пикселей. Для AI-инженеров рабочий процесс смещается от кропотливого рисования путей к проектированию реляционных данных — этот подход масштабируется естественным образом при увеличении количества объектов.

Потенциальные сферы применения:

  • Робототехника — симулируемые среды теперь могут отражать реалистичные взаимодействия объектов без ручного написания скриптов траекторий.
  • Беспилотное вождение — сценарии дорожного движения с множеством автомобилей, пешеходов и велосипедистов могут генерироваться на основе высокоуровневых правил взаимодействия, что ускоряет процессы аугментации данных.
  • Анимация — художники могут сосредоточиться на повествовательных связях, в то время как система берет на себя физику движения.

Вывод: Рассматривая взаимосвязи объектов как основной управляющий сигнал, GraphVid делает генерацию видео более интуитивно понятной для авторов и более достоверной с точки зрения реального движения, задавая новое направление в области управляемого синтеза.