- Es un enfoque que aplica un prior en el espacio de imagen del movimiento de una escena a una sola imagen fija para convertirla en un video en bucle o en una escena dinámica e interactiva
- Para el entrenamiento se usan trayectorias de secuencias de video reales que contienen movimientos oscilatorios naturales, como árboles, flores, velas o ropa que se balancea con el viento
- El modelo maneja movimientos de larga duración en el dominio de Fourier y, a partir de una sola imagen de entrada, predice un volumen espectral mediante muestreo por difusión con ajuste de frecuencia
- El volumen espectral predicho se convierte en una textura de movimiento para todo el video y se utiliza tanto para generar videos en bucle como para la interacción de objetos dentro de fotos reales
- La demo requiere un navegador compatible con WebGL2 y, para mayor velocidad, usa mesh-warping en lugar del modelo de renderizado de alta calidad del artículo
Crear escenas dinámicas a partir de imágenes fijas
- Generative Image Dynamics es un método para modelar un prior en el espacio de imagen sobre el movimiento de una escena
- La entrada es una sola imagen fija y la salida es un video que se repite suavemente o una escena dinámica con la que el usuario puede interactuar
- Se pueden consultar el paper, arXiv y el material suplementario
- Este trabajo recibió el CVPR 2024 Best Paper Award
Prior de movimiento y método de renderizado
- Los datos de entrenamiento son conjuntos de trayectorias de movimiento extraídas de secuencias de video reales
- Se usan como ejemplos movimientos naturales y oscilatorios, como árboles, flores, velas o ropa movida por el viento
- El modelo aprende un prior denso y de largo alcance del movimiento en el dominio de Fourier
- Dada una sola imagen, predice un volumen espectral mediante muestreo por difusión con ajuste de frecuencia
- El volumen espectral puede transformarse en una textura de movimiento para todo el video
- Al combinarse con un módulo de renderizado basado en imágenes, permite varias aplicaciones
- Convierte una imagen fija en un video que se repite suavemente
- Al interpretar el volumen espectral como una base modal en el espacio de imagen, puede hacer que objetos dentro de fotos reales interactúen de forma realista
- La respuesta dinámica de los objetos ante estímulos del usuario se simula usando el análisis modal de Davis et al.
Demo y usos adicionales
- La demo muestra cómo se mueve la escena al hacer clic, arrastrar y soltar un punto sobre la imagen
- El navegador debe ser compatible con WebGL2
- Para mayor velocidad, usa mesh-warping en lugar del modelo de renderizado de alta calidad presentado en el paper
- Ajustando la amplitud de la textura de movimiento, se puede reducir o aumentar el movimiento de la animación
- Al interpolar la textura de movimiento predicha, se puede generar video en cámara lenta
- Entre los trabajos relacionados están Animating Pictures with Stochastic Motion Textures, Image-space Modal Bases for Plausible Manipulation of Objects in Video, Visual Vibration Analysis
1 comentarios
Opiniones de Hacker News
El truco de un cinemagraph de 10 puntos es que cuanto más sutil, mayor impacto. Es mejor lograr que la persona que lo ve primero piense que es una foto fija y que luego el cerebro se dé cuenta tarde: “un momento, algo está raro; esto no es una foto, es un video”.
También es interesante que la cantidad de movimiento sea distinta entre la primera y la segunda foto, y podría deberse a que considera la densidad alrededor del puntero. Los ejemplos de movimiento lento son realmente relajantes de ver.
Parece que podría convertirse en una función predeterminada de los fondos de pantalla de escritorio y celular. Si también puede manejar movimientos suaves del agua o las nubes, parece útil para aplicarlo selectivamente a fotos en lugares como documentales históricos.