Ретаргетинг з веб-камери на VRM у реальному часі
Чи може браузер керувати 3D-аватаром лише за допомогою веб-камери?
Я протестував MediaPipe Holistic, щоб перевірити, чи може він оцінювати рухи тіла, обличчя та рук для керування аватаром VRM 1.0 у реальному часі. Я проводив цей тест на Apple M1 Max, використовуючи CPU та WASM.
Результати показують, що стандартна веб-камера може керувати 3D-аватаром без дорогого обладнання для захоплення руху (motion capture).
Результати тестування:
• Обладнання: Apple M1 Max • Вхідні дані: потік з веб-камери 1280x720 • Ефективна швидкість: 17,3 FPS • Середній час інференсу: 49,17 мс • Успіх: усі 141 виявлені кадри пози оновили скелет VRM
Як це працює:
Система використовує багатоетапний конвеєр (pipeline) для відстеження 553 точок:
- 33 точки для пози тіла
- 478 точок для сітки обличчя (включаючи райдужну оболонку)
- 21 точка для кожної руки
Процес складається з таких етапів:
- MediaPipe виявляє опорні точки (landmarks) з веб-камери
- Координати конвертуються у простір Three.js
- Дані відображаються на 34 кістки та вирази VRM
- Алгоритми згладжування зменшують тремтіння (jitter) шляхом інтерполяції рухів
Ретаргетинг працює шляхом узгодження напрямку між двома опорними точками з напрямком кістки VRM. Наприклад, він зіставляє плече з ліктем, щоб встановити поворот руки. Коефіцієнти обличчя безпосередньо відображаються на вирази аватара, такі як кліпання очима або відкриття щелепи.
Обмеження:
- Швидкість: 17,3 FPS підходить для демо-версій, але недостатньо плавно для професійного захоплення руху при 60 FPS.
- Поворот: це приблизне визначення напрямку. Воно не вирішує проблему точного скручування передпліч або щиколоток.
- Складність: через коротку тривалість тестування не вдалося підтвердити стабільне одночасне відстеження обличчя та обох рук.
Ця конфігурація забезпечує легкий спосіб створення браузерних демо-версій аватарів та жестових інтерфейсів.
