2 puntos por GN⁺ 2023-09-18 | 1 comentarios | Compartir por WhatsApp
  • Es un enfoque que aplica un prior en el espacio de imagen del movimiento de una escena a una sola imagen fija para convertirla en un video en bucle o en una escena dinámica e interactiva
  • Para el entrenamiento se usan trayectorias de secuencias de video reales que contienen movimientos oscilatorios naturales, como árboles, flores, velas o ropa que se balancea con el viento
  • El modelo maneja movimientos de larga duración en el dominio de Fourier y, a partir de una sola imagen de entrada, predice un volumen espectral mediante muestreo por difusión con ajuste de frecuencia
  • El volumen espectral predicho se convierte en una textura de movimiento para todo el video y se utiliza tanto para generar videos en bucle como para la interacción de objetos dentro de fotos reales
  • La demo requiere un navegador compatible con WebGL2 y, para mayor velocidad, usa mesh-warping en lugar del modelo de renderizado de alta calidad del artículo

Crear escenas dinámicas a partir de imágenes fijas

  • Generative Image Dynamics es un método para modelar un prior en el espacio de imagen sobre el movimiento de una escena
  • La entrada es una sola imagen fija y la salida es un video que se repite suavemente o una escena dinámica con la que el usuario puede interactuar
  • Se pueden consultar el paper, arXiv y el material suplementario
  • Este trabajo recibió el CVPR 2024 Best Paper Award

Prior de movimiento y método de renderizado

  • Los datos de entrenamiento son conjuntos de trayectorias de movimiento extraídas de secuencias de video reales
    • Se usan como ejemplos movimientos naturales y oscilatorios, como árboles, flores, velas o ropa movida por el viento
  • El modelo aprende un prior denso y de largo alcance del movimiento en el dominio de Fourier
    • Dada una sola imagen, predice un volumen espectral mediante muestreo por difusión con ajuste de frecuencia
    • El volumen espectral puede transformarse en una textura de movimiento para todo el video
  • Al combinarse con un módulo de renderizado basado en imágenes, permite varias aplicaciones
    • Convierte una imagen fija en un video que se repite suavemente
    • Al interpretar el volumen espectral como una base modal en el espacio de imagen, puede hacer que objetos dentro de fotos reales interactúen de forma realista
    • La respuesta dinámica de los objetos ante estímulos del usuario se simula usando el análisis modal de Davis et al.

Demo y usos adicionales

1 comentarios

 
GN⁺ 2023-09-18
Opiniones de Hacker News
  • Realmente genial. Hace tiempo que me gustan los cinemagraphs y, ya sea en marketing o en filmaciones, he intentado incorporar esa sensación sutil de quietud, así que esto parece algo que podría convertirse en una herramienta de uso frecuente.
    El truco de un cinemagraph de 10 puntos es que cuanto más sutil, mayor impacto. Es mejor lograr que la persona que lo ve primero piense que es una foto fija y que luego el cerebro se dé cuenta tarde: “un momento, algo está raro; esto no es una foto, es un video”.
  • Si arrastras desde los bordes, los árboles tienen mucha distorsión. Aun así, es una idea interesante.
    • Probablemente habría que combinar esto con segmentación y relleno generativo para la capa de fondo. Por suerte, eso también ha avanzado bastante.
  • En la rosa roja de la primera foto, las flores del fondo también se mueven; me pregunto por qué no se ve el mismo efecto en el árbol de la tercera foto.
    También es interesante que la cantidad de movimiento sea distinta entre la primera y la segunda foto, y podría deberse a que considera la densidad alrededor del puntero. Los ejemplos de movimiento lento son realmente relajantes de ver.
    • No sé por qué, pero el ejemplo de la rosa me pareció un poco inquietante.
  • Da gusto ver que los investigadores de Google sigan publicando papers abiertos junto con demos. No voy a repetir otra vez lo de que Google falla al convertir la investigación en IA en productos o al publicarla como open source.
  • Realmente genial. No va a cambiar el mundo ni a aumentar la productividad, pero igual es muy bueno.
    Parece que podría convertirse en una función predeterminada de los fondos de pantalla de escritorio y celular. Si también puede manejar movimientos suaves del agua o las nubes, parece útil para aplicarlo selectivamente a fotos en lugares como documentales históricos.
  • Usaron WebGL en la demo. Bien.
    • Sería increíble en videojuegos. Podrías caminar entre arbustos y que las plantas se enganchen al cuerpo.
  • Esto, al igual que EbSynth, tiene la limitación de requerir movimientos vectoriales bajos.
    • Creo que el logro aquí está principalmente en la generación de la dinámica de la imagen. Por ejemplo, si hay un gato en la imagen, el modelo entiende que el gato debería respirar y genera el movimiento de contracción de los pulmones, y el paper parece tratar sobre cómo convertir esa dinámica de la imagen y la imagen original en un video fluido. Podría estar equivocado.
  • Se siente como si faltara un paso para que una foto estática se convierta en una foto enmarcada al estilo Harry Potter.
  • Wow, se ve surrealista. Tengo ganas de probarlo pronto cuando lo integren en Photoshop.