2 puntos por GN⁺ 2025-07-05 | 1 comentarios | Compartir por WhatsApp
  • Netflix está expandiendo a nivel mundial los streams de Film Grain Synthesis (FGS) de AV1 para reducir el uso de datos de streaming manteniendo la textura del grano de película
  • FGS no comprime el grano tal cual; envía el video sin grano y los parámetros del modelo de grano, y vuelve a sintetizarlo por bloques durante la reproducción
  • En el ejemplo de They Cloned Tyrone, AV1 FGS usa 2804 kbps frente a 8274 kbps de AV1 normal, mostrando una reducción de bitrate de alrededor de 66% en escenas con grano de película intenso
  • En una evaluación de unos 300 títulos, para 1080p o superior el bitrate promedio se redujo 36%, pero por debajo de 1080p el efecto se quedó cerca de 10% porque el downscaling reduce el ruido
  • En pruebas A/B antes del rollout se observaron reducciones de 24% en el bitrate inicial, 31.6% en el bitrate promedio, 10% en rebuffering y 10% en latencia de inicio; se está aplicando a gran escala en dispositivos compatibles desde marzo de 2025

Expansión de AV1 Film Grain Synthesis de Netflix

  • Netflix aplicó recientemente de forma más amplia los streams con AV1 Film Grain Synthesis (FGS) para sus miembros en todo el mundo
  • FGS está incluido desde las primeras etapas del estándar AV1, pero cuando Netflix hizo su lanzamiento inicial del códec AV1 en 2021, solo estaba habilitado para una cantidad limitada de títulos
  • El objetivo de esta expansión es aumentar la eficiencia de datos preservando la integridad artística del grano de película
  • El grano de película es un elemento que aporta textura, realismo y nostalgia a las películas clásicas, pero por su alta aleatoriedad, en la compresión tradicional obligaba a hacer concesiones entre reducir el tamaño de archivo y conservar el grano
  • El video digital también puede incluir ruido del sensor de la cámara o grano agregado intencionalmente en posproducción, lo que vuelve más difícil su tratamiento durante la compresión

Cómo AV1 FGS procesa el grano

  • En lugar de comprimir directamente el grano, AV1 FGS primero codifica un denoised video en el que se eliminó el grano del video original
  • Los parámetros que modelan la forma y la intensidad del grano se transmiten junto con los datos de video comprimido y se vuelven a sintetizar durante la reproducción
  • El estándar AV1 no especifica el método de eliminación de grano en sí, por lo que el usuario puede elegir el denoiser que prefiera
  • En la etapa de reproducción, el grano de película se restaura con un método basado en bloques optimizado para funcionar de forma fluida en dispositivos de consumo
  • Se puede consultar una explicación más detallada en el paper original

Modelo de patrón e intensidad del grano

  • Film Grain Pattern

    • Un modelo autorregresivo (auto-regressive model) replica el patrón del grano de película
    • Los parámetros clave son los coeficientes AR, que pueden estimarse a partir del residuo entre el video fuente y el denoised video
    • Este modelo captura la correlación espacial entre las muestras de grano y mantiene las características de ruido del original
    • Al ajustar los coeficientes AR {ai}, la forma del grano puede hacerse más gruesa o más fina
    • Con estos coeficientes se genera una plantilla de ruido de 64x64 y, durante la reproducción, se extraen parches aleatorios de 32x32 que se suman al video decodificado
  • Film Grain Intensity

    • Una función de escalado controla la apariencia del grano según las condiciones de brillo
    • Esta función se estima durante la codificación y modela la relación entre los valores de píxel y la intensidad del ruido como una función lineal por tramos
    • Ajusta la intensidad del grano según el brillo y el color del video para reproducir una apariencia más cercana a la del video original

Mejora de calidad y reducción de bitrate

  • Netflix compara AV1 normal y AV1 FGS usando como ejemplo un frame de They Cloned Tyrone
  • AV1 normal usa 8274 kbps y AV1 FGS 2804 kbps, lo que representa una reducción de bitrate de alrededor de 66%
  • En este ejemplo con grano de película intenso, AV1 normal puede mostrar ruido distorsionado con patrones similares a DCT, mientras que la versión FGS conserva la integridad del grano incluso con un bitrate más bajo
  • El ruido sintetizado puede enmascarar artefactos de compresión y crear una mejor experiencia visual
    • En el stream AV1 normal y en el stream AV1 FGS sin ruido sintetizado se ven artefactos de compresión
    • El stream AV1 FGS con síntesis de grano oculta algunos artefactos de compresión mediante el enmascaramiento de contraste del sistema visual humano

Límites de la medición de calidad y evaluación del catálogo

  • Netflix actualmente no tiene un modelo de calidad dedicado para la síntesis de grano de película
  • Como el ruido del video fuente y del video decodificado aparece en posiciones de píxel distintas, los métodos de comparación píxel a píxel como PSNR o VMAF pueden asignar puntuaciones de calidad más bajas
  • En evaluaciones internas se confirmó una mejora de la calidad visual y valor técnico
  • Se seleccionaron unos 300 títulos con distintos niveles de grano para evaluar el impacto de AV1 FGS
    • En resoluciones de 1080p o superiores, el bitrate promedio se redujo 36%
    • En resoluciones inferiores a 1080p, la reducción de bitrate fue de alrededor de 10%
    • La razón de que el efecto sea menor en resoluciones bajas probablemente es que el ruido se filtra durante el proceso de downscaling
    • Al activar la herramienta de codificación FGS, se agrega continuamente overhead de sintaxis al bitstream

Impacto en streaming observado en pruebas A/B

  • Antes del rollout, Netflix evaluó mediante pruebas A/B el impacto de habilitar AV1 FGS en el streaming en general
  • Los resultados de las pruebas derivaron en una QoE más fluida y estable
  • Las mejoras observadas fueron las siguientes
    • El bitrate al iniciar la reproducción se redujo 24% y el bitrate promedio 31.6%, reduciendo los requisitos de ancho de banda de red y la necesidad de almacenamiento para streams descargados
    • La tasa de errores de reproducción se redujo alrededor de 3%
    • La cantidad de rebuffering se redujo 10% y la duración del rebuffering 5%
    • La latencia de inicio se redujo 10%, posiblemente porque el menor bitrate permitió que los dispositivos alcanzaran más rápido el nivel de búfer objetivo
    • Las caídas notorias de bitrate se redujeron 10%, y el tiempo en que los usuarios ajustan la posición de reproducción también se redujo 10%
    • En dispositivos compatibles con 4K, alrededor de 0.7% del tiempo de visualización pasó de 1080p o menos a 2160p
    • Este cambio de resolución se debe a que la reducción de bitrate en el punto de transición facilitó alcanzar la resolución máxima durante la sesión

Estado del rollout y próximos planes

1 comentarios

 
GN⁺ 2025-07-05
Opiniones de Hacker News
  • Se está pasando por alto que el ruido sintetizado podría no contener el detalle y la información que había en el ruido original.
    Al ver una codificación de alta calidad con ruido real, la resolución aumenta de forma sorprendente al pasar de una imagen fija al video. El ruido parece bailar sobre la señal, y a 24 fps la señal detrás de él sigue viéndose con claridad.
    En cambio, si se descarta el ruido fotograma por fotograma y luego se vuelve a aplicar un ruido artificial “estéticamente” similar, el detalle original no se puede recuperar y, al verlo a 24 fps, se vuelve fundamentalmente más borroso. En películas viejas con mucho ruido, la diferencia de detalle puede llegar a ser de hasta 2 veces.
    Si H.265 o AV1 miran varios fotogramas anteriores y posteriores considerando el movimiento y generan un fotograma con “reducción de ruido”, en teoría podrían encontrar y codificar la señal de todo el detalle a lo largo del eje temporal, pero no sé si realmente lo hacen. Me gustaría saberlo si estoy equivocado.
    El punto clave es que la comparación entre reducción de ruido y síntesis no debe hacerse con imágenes fijas. Para ver si el detalle se descarta o se conserva, hay que comparar videos reales lado a lado. El ruido no es solo ruido: también es detalle.

    • El grano de película es independiente en cada fotograma, así que no se mueve junto con los objetos de la escena. Si no se trata de un video ya codificado de manera extraña, creo que una comparación de fotogramas fijos también está bien, siempre que el ruido sintetizado no tenga patrones temporales notorios.
      Desde el punto de vista estético, parece que el grano sintetizado de AV1 no toma en cuenta el tamaño de partícula del video original. Por eso, el grano grueso que viene de los grandes cristales de haluro de plata de las películas antiguas puede aparecer en la síntesis como grano fino y resultar extraño. Un buen reductor de ruido de película podría mitigar esto.
      Además, no modela correctamente los componentes de color separados de la película, pero dicen que no es un gran problema porque las fuentes de video de Netflix muchas veces ya tienen submuestreo de croma: https://norkin.org/pdf/DCC_2018_AV1_film_grain.pdf
      Solo he leído un poco sobre este campo, así que podría estar equivocado.
    • Muy buen punto.
      Para explicar el aspecto temporal, basta pensar en un proyector de cine tradicional. Entre cada fotograma se ve oscuridad total durante un instante muy breve. Podrías llamar “ruido” a esa oscuridad, y si te quedaras en ese momento no verías en absoluto la señal original.
      Pero como nuestro sistema visual hace cierto promedio temporal, casi no notamos ese parpadeo (https://en.wikipedia.org/wiki/Flicker_fusion_threshold). El ruido y el grano parecen percibirse de forma similar, y resultan menos notorios que las partes estables de la señal/imagen.
      Así como los astrofotógrafos apilan imágenes ruidosas para obtener una imagen con alta relación señal-ruido, creo que el cerebro hace algo parecido en cierta medida. No significa que alucine detalles inexistentes, sino que el ruido registrado vuelve a su promedio con el tiempo y ese promedio representa la señal real con mayor claridad. Por supuesto, no es perfecto por el ruido sistemático/no aleatorio, pero por lo general eso importa menos.
      Los algoritmos de reducción de ruido que procesan solo fotogramas individuales no tienen este contexto, por lo que pierden detalle o intentan corregirlo por inferencia. AV1 no impone un algoritmo específico, así que en teoría un algoritmo inteligente podría usar el contexto temporal para conservar detalle adicional.
    • El ruido no contiene señal, no baila sobre ella y no es detalle. Es simplemente variación aleatoria pura añadida a la señal.
      Si se promedian algunos fotogramas estáticos, la señal que no cambia se mantiene y el ruido aleatorio se cancela, mejorando la relación señal-ruido. Preservar el ruido en sí no es útil.
      El efecto que se ve puede ser una preferencia estética por el comportamiento del grano original, o puede surgir de comparar contenido de bajo ancho de banda con artefactos fuertes de compresión, como suavizado/filtrado pasa bajos, contra una versión de alto ancho de banda que conserva todo el detalle. Eso es independiente del grano añadido encima.
    • Me gusta este concepto. Cuando hablo de machine learning, suelo usar un ejemplo parecido: comparo la forma en que una persona analiza video de una cámara nocturna con la forma en que un algoritmo de machine learning puede detectar como features elementos que una persona no imaginaría, incluso artefactos del sensor. El ruido rara vez es solo ruido.
    • Algunos discos 4K nuevos usan DNR, y en el proceso de reducción de ruido a veces desaparecen los poros de los rostros de las personas, haciendo que las caras de los actores parezcan de cera.
  • El valor de agregar ruido puede debatirse filosóficamente, pero el problema del ejemplo aquí es que el proceso de eliminación de ruido vuelve todo demasiado borroso, de modo que tanto la versión sin ruido como la imagen con grano sintetizado se ven notablemente menos nítidas que el original.
    El grano en sí también parece demasiado un ruido básico, y no un verdadero grano de película.

    • A la misma tasa de bits, salvo que se vaya a una tasa muy alta, el original comprimido normalmente se ve peor y menos nítido. Es porque se gastan demasiados bits intentando codificar el grano original.
      Como resultado, el grano original se “esparce” por áreas más amplias y se ve turbio, y al intentar codificar el grano definido se termina perdiendo también nitidez de la escena real.
      La síntesis de grano de película tiene sentido en streaming con ancho de banda limitado. Dicho eso, coincido en que el grano sintetizado del ejemplo no se ve muy parecido al grano. Y, según la cantidad y el método de eliminación de ruido, los detalles de la escena pueden quedar borrosos.
    • Desde los primeros días del cine, los editores han incorporado todo tipo de trucos en posproducción.
      Sería bueno que ofrecieran una opción para activar y desactivar la simulación de película.
      Una de mis películas favoritas, The Holdovers, hizo muy bien la simulación de película. Está ambientada en los años 70 y busca verse como una película de esa época.
      A mis ojos se veía excelente, pero un verdadero fanático del cine en film seguramente notaría muchas partes inexactas.
      En un futuro cercano, Netflix quizá procese algunos efectos de posproducción en el cliente. Si tenés daltonismo, podrías usar un modo adecuado para eso; si no te gusta el grano falso, podrías desactivarlo.
    • AV1 tiene un nivel FGS ajustable y, a mis ojos, aquí parece estar un poco alto. Sin embargo, hay un trade-off. A ciertas tasas de bits, el desenfoque + re-ruido se ve mucho mejor que otros artefactos visuales, así que puede dar ganas de dejarlo así de alto.
      Hay algunas cosas a tener en cuenta.
      Los fotogramas estáticos no son una muy buena forma de evaluar la calidad de video.
      Incluso un filtro de eliminación de ruido teóricamente perfecto[1] siempre se verá menos detallado que la fuente original. Esto se debe a que el sistema cerebro/ojo genera más detalle a partir de una imagen con ruido que de una imagen borrosa.
      [1] Perfecto aquí significa que preserva el 100% de los detalles que no son grano, no que recupera mágicamente los detalles perdidos por el ruido.
    • Una película que trata este tema es Blowup, de Antonioni: https://en.wikipedia.org/wiki/Blowup
    • El ruido/grano que vemos hoy en el resultado final muchas veces se agrega en posproducción. Idealmente, los estudios deberían proporcionar a las distribuidoras una fuente sin ruido junto con los parámetros de síntesis de grano.
      Como bonus, muchos espectadores agradecerían una opción para desactivarlo.
  • La verdadera historia aquí es la parte de “aplicación a gran escala”. La síntesis de grano de película ya existía desde hace un tiempo en los codificadores AV1 comunes, pero para evitar problemas requería cierto ajuste manual.
    Por eso, en entornos de producción se usaba solo con catálogos muy limitados o títulos especialmente importantes. Aquí no explican en detalle cómo superaron ese problema, pero es buena noticia que se distribuya más ampliamente.

    • Hoy existen variantes adaptativas, lo que hace mucho más fácil automatizarlo.
  • Sobre quienes odian el grano: todo tiene naturalmente cierto grado de ruido o grano. Está en los mejores sensores digitales, e incluso en nuestros ojos.
    Tiene utilidad más allá de un simple efecto estético. Aumenta la nitidez percibida y tiende a ocultar defectos como el banding de color o los artefactos de compresión.
    Eso no significa que todo ruido y grano sea bueno. Puede ser inevitable por limitaciones técnicas, resultado de una mala decisión creativa, o simplemente distraer.
    Pero creo que la alternativa de aplicar eliminación de ruido a todo es mucho peor. Hoy muchas cámaras hacen eso por defecto y, a mis ojos, el suavizado provocado por la eliminación de ruido a menudo se ve poco realista y mucho más molesto.

    • El grano de los sensores digitales modernos es incomparablemente menor que el que se agrega a una película promedio.
    • Mi preocupación es que el grano puede ser algo bueno si responde a una decisión creativa del creador del contenido. No debería decidirlo un grupo de nerds que comprimen ceros y unos.
    • Un caso representativo es la animación de intro de HBO. Usa interferencia de la vieja era analógica, y se ve pésima incluso en 4K. El ruido aleatorio es imposible de comprimir sin la estrategia descrita aquí: eliminarlo y luego renderizarlo más tarde.
  • No entiendo eso de “grano = realismo”. Mis ojos en realidad no tienen grano.
    Aun así, reconozco el papel del grano como herramienta artística, así que esta tecnología en sí sigue siendo interesante.

    • El artículo señala el efecto de enmascaramiento del grano, es decir, su capacidad para ocultar artefactos de compresión que parecen falsos, y también los aspectos de familiaridad/nostalgia. Quisiera sumar una explicación más.
      Si uno mira alrededor, casi todas las superficies tienen algún tipo de textura fina y no son visualmente uniformes. Cuando eso se registra en video, la textura fina se reduce por la óptica de la cámara, la resolución limitada y el suavizado de la compresión. El grano de película aporta parte de esos estímulos visuales de alta frecuencia perdidos.
      A nuestros ojos y cerebro les gustan esos estímulos de alta frecuencia, y no son exigentes con que se reproduzca exactamente el patrón de ruido de la escena original. Por eso el codificador x265, que produce video H.265, no tiene síntesis de grano, pero sí el parámetro psy-rd. Esto se acerca a “haz que el video comprimido se vea con tanta ‘energía’ como el original, aunque esa energía no esté exactamente en los mismos lugares”, y psy-rdoq se acerca a “prefiere una energía más alta en general”.
      Ajustar estos parámetros puede hacer que un video comprimido se vea mejor sin almacenar más datos.
    • Incluso los ojos reales claramente tienen grano en una noche oscura. Con luz tenue aparece una especie de “brillo” o “estática”.
      Por suerte, nuestros ojos son mucho más sensibles que una cámara. Pero aquí el “realismo” viene de la forma en que se capturaba con la tecnología de la época. No es distinto del ruido de un fonógrafo o de cómo se degrada una señal CRT. Es “real” respecto de la tecnología que usó el director y de la forma en que ellos sabían que el público vería la película.
      Es como las pinceladas de Van Gogh: eran reales para sus cuadros. Uno no querría lijar una pintura al óleo para dejarla plana. Es la realidad del medio original. Por eso, también en una copia digital de una película, dan ganas de conservar al máximo la realidad del original.
    • La gente siempre intenta racionalizar y justificar sus gustos estéticos. La profundidad y los matices con que uno entiende algo cambian la forma en que percibe sus variaciones. Pasa igual con las maderas tonales de una guitarra, los estilos musicales, los tipos de pintura, el sabor de la cerveza y el grano de película.
      Cuando uno sabe mucho de un tema, puede leer mucha historia en ese objeto, y eso también cambia la emoción.
      Un niño que mira un sketch de Buster Keaton conteniendo el aliento y riéndose, y un crítico de cine que sabe qué película y qué cámara se usaron, qué significa la abstracción de la escena e incluso qué tipo de tela tiene el vestuario de Keaton, tienen experiencias estéticas subjetivas distintas ante el mismo medio.
      El gusto estético subjetivo pertenece al terreno de la cognición. Haría falta una teoría formal de la inteligencia mapeada al cerebro humano, y estos fenómenos subjetivos al final se reducen al procesamiento personalizado de datos y a condiciones iniciales.
      El grano de película, en contraste con una animación cel limpia, también puede facilitar que la gente suspenda la incredulidad. Porque aprendió a asociar la ausencia de grano con animación irreal, ciertos medios y CGI. Como en los videos caseros y las noticias había grano y baja calidad, el grano terminó correlacionándose con lo “real”.
      A mi parecer, no hay nada más profundo que eso. Somos producto de nuestra época. Dentro de 40 años, el medio puede cambiar y el grano de película podría asociarse con lo surrealista, o eliminarse por completo porque en el fondo es ruido.
    • A mi parecer, el grano hace que las películas parezcan más detalladas de lo que son, y también puede ocultar artefactos de compresión y desenfoque.
      No conozco bien la psicología visual detrás de eso. Tal vez agrega las altas frecuencias que la compresión barre, o quizá funciona como una especie de dithering.
      Sobre los ojos, por física cuántica probablemente sea correcto decir que también tienen grano. Solo que el cerebro lo filtra y por eso no lo percibimos. No sé bien cómo interactúa eso con el grano de película.
    • Me recuerda a poner falsos travesaños en ventanas modernas. Son solo tiras añadidas para que parezca que hay varios paneles pequeños de vidrio, pero la gente está acostumbrada a ese aspecto y le “suena bien”.
      Imagino que los antiguos fabricantes de vidrio se habrían fascinado enormemente con poder hacer paneles grandes y uniformes como los de ahora, pero nosotros imitamos el compromiso que ellos se vieron obligados a aceptar solo porque nos resulta familiar.
  • Decir que “al ver películas clásicas, el movimiento sutil del grano de película añade autenticidad y nostalgia a cada escena” me parece que solo agrega ruido visual que tapa los detalles de la escena real.
    La nostalgia también puede adherirse a pistas visuales más evidentes, como actores antiguos o viejos recuerdos de la primera vez que uno la vio.
    Decir que “contribuye al realismo de la película” también es más bien lo contrario, porque en la realidad no hay grano.
    Aun así, me alegra que AV1 siga avanzando y tenga un mecanismo de reemplazo algorítmico en vez de desperdiciar bitrate codificando basura visual. Así también será más fácil desactivarlo.

    • Un documental puede preocuparse por representar la realidad con precisión. Pero en todos los demás géneros cinematográficos, la “autenticidad” no es un objetivo esencial.
      Si el grano de película forma parte de la visión del director, es tan válido como la decisión de poner música dramática no diegética detrás de una escena. Eso es muy poco auténtico, pero muy efectivo para provocar emociones, y ese es el propósito del arte.
    • En realidad, la iluminación es inherentemente aleatoria, así que cualquier forma de capturar una escena con un límite de tiempo, incluidos los ojos, está afectada por ruido de disparo: https://en.wikipedia.org/wiki/Shot_noise
    • Creo que el autor no vendió de forma convincente las ventajas del grano de película. No sé muy bien qué quería decir, pero el grano de película aumenta la nitidez percibida y el detalle percibido de la imagen. Aunque sea una ilusión óptica.
      El director de fotografía Steve Yedlin lo describe como darle a los ojos del público algo a lo que “aferrarse”.
    • ¿Acaso oculta más detalle que las técnicas modernas de compresión de video? Qué es ruido en una película es, hasta cierto punto, subjetivo.
  • En las llamadas de celular, el códec AMR-WB captura nominalmente de 50 Hz a 7000 Hz. Pero eso solo ocurre con el bitrate más alto seleccionable, 23.85 Kbps.
    En el más común, 12.65 Kbps, solo llega hasta 6400 Hz, y de 6400 a 7000 Hz lo sintetiza con frecuencias bajas y ruido. Porque suena mejor con ruido que sin él.

  • El grano de película debería desaparecer. Su época ya pasó. Las fotos sepia y las películas mudas de 16 fps reproducidas a 24 fps ya murieron, y lo siguiente es el grano de película.
    El Eastman Business Park de Rochester también fue demolido.
    Y ojalá dejen de poner polvo y rayones en los videos de YouTube.

    • El grano de película falso puede que sí, pero decir que todo grano de película debería desaparecer es como decir que deberían desaparecer las pinceladas de una pintura al óleo.
    • Pero ¿por qué tendría que desaparecer el grano de película?
  • Me resulta un poco frustrante que primero se grabe el video, luego en posproducción se elimine el ruido, se vuelva a agregar ruido, durante la codificación se elimine otra vez el ruido y, al decodificar, se vuelva a agregar ruido

    • No hay que preocuparse demasiado. Todo es falso. Incluso lo que uno considera “material filmado” probablemente sea una composición de muchas capas provenientes de varias fuentes
      Iluminación falsa, sombras falsas, cielo falso, etc.
    • Solo molesta cuando uno conoce el proceso; el 99.9% de quienes consumen contenido de video no lo sabe. Desde el punto de vista del espectador, salvo que le importe el bitrate como costo, es simplemente un detalle de implementación sin importancia
  • Ahora todo es falso. Quiero una tecnología que funcione con escaneos de película originales. Preferiría algo que ni siquiera use compresión JPEG, que ya es el primer paso en la pérdida de detalle
    La detección de movimiento, los key frames y los delta frames están bien, pero debería ser video sin pérdida. Claro, sería para ponerlo en Blu-ray; el streaming no me preocupa demasiado

    • Si codificas una película 4K/24p en Apple ProRes 4444 XQ, aun sin ser ProRes RAW, son 716 GB por hora. Para ver una película de 2 horas, tendrías que cambiar un total de 30 discos Blu-ray cada 4 minutos
    • Me pregunto cuánto se ganaría con una tecnología así. Si fuera video 4K realmente sin comprimir, una película de 90 minutos ocuparía varios terabytes, mucho más que el Blu-ray 4K más grande. Con compresión sin pérdida se reduciría, pero ¿lo suficiente como para que tenga sentido?