DeepMind превращает 7500 синтетических клипов в мультизадачную модель компьютерного зрения с 14 млрд параметров
Модель, построенная на архитектуре Wan2.1 от Alibaba, обучается определять глубину, нормали, сегментацию и 3D-позу на основе крошечного набора данных, отрендеренных в Blender, — она не уступает специализированным системам, а иногда и превосходит их, используя лишь малую часть обучающих данных.