3 puntos por chessire 3 시간 전 | Aún no hay comentarios. | Compartir por WhatsApp

Es un pipeline para crear shorts de presentación de perros usando solo videos crudos grabados con el teléfono. Si se le dan varios videos raw del teléfono y un párrafo con una solicitud en lenguaje natural, unos 4 minutos después genera un video vertical 9:16 con subtítulos y narración. Fue diseñado para que todo el proceso, desde la detección hasta el TTS, funcione localmente en una sola MacBook.

Video de demostración

No es difícil lanzar un video a un LLM y sacar una demo más o menos convincente. En cambio, el objetivo fue responder dos preguntas: si mañana se puede volver a generar exactamente lo mismo, y si no se mezclan las cosas inventadas por la IA con lo que configuró una persona.

Estructura

  • El LLM solo interpreta; la ejecución es determinista. Gemma (local) se encarga únicamente de juicios semánticos como nombres de acciones, descomposición de solicitudes de edición y observación de escenas, mientras que Python/OpenCV/ffmpeg manipulan todos los píxeles, frames y tiempos. Con la misma entrada, sale la misma salida.
  • La detección y el seguimiento usan YOLO11 + ByteTrack; la reidentificación de múltiples perros usa embeddings de DINOv2 + fotos ancla del cuidador; y la clasificación de movimiento/quietud depende por completo de la medición del residuo de ROI compensando el movimiento de la cámara. Los ejes que un LLM estructuralmente no puede ver, como el movimiento en una sola imagen fija, no se le delegan al LLM.
  • El TTS se sintetiza localmente con Qwen3-TTS (mlx-audio) y se valida con una compuerta CER de ida y vuelta con Whisper.
  • Los subtítulos inventados por el LLM se descomponen en afirmaciones fácticas y se contrastan con el registro de observación del video; si no hay evidencia, se reescriben. Los subtítulos escritos directamente por el usuario no se revisan.

Forma de decisión

  • Todos los cambios de modelo y parámetros se decidieron mediante evaluación sobre un golden set etiquetado manualmente.
  • Mejoras que parecían obviamente buenas fueron rechazadas dos veces en la evaluación del golden set.

Números

  • 148 pruebas unitarias, exactitud de 1.00 en la clasificación grupal de movimiento sobre M4
  • Reducción del tiempo de generación de 8 minutos a 4 minutos en el ciclo de vida completo.

Limitaciones
El golden set tiene 5 a 9 videos, un solo dominio y fue desarrollado por una sola persona. Es rigor metodológico, no una validación de escala.

El proceso de desarrollo fue publicado por entregas en el blog.
Tiene licencia MIT. Son bienvenidas las preguntas sobre cómo llevar esta metodología a otros dominios o sobre cada una de las decisiones.

Aún no hay comentarios.

Aún no hay comentarios.