MIT 6.S184: Introducción a flow matching y modelos de difusión
(diffusion.csail.mit.edu)- La versión 2026 de MIT 6.S184 es un curso introductorio para aprender, con teoría y práctica, modelos de difusión y modelos de flujo usados en varios tipos de datos, como imágenes y video
- Las clases abarcan ecuaciones diferenciales estocásticas, la ecuación de Fokker-Planck, flow matching, score matching, classifier-free guidance, espacios latentes y modelos de difusión discretos
- Cada clase incluye una práctica para que los estudiantes puedan implementar flow matching y modelos de difusión desde cero, paso a paso
- En la parte final del curso se construye directamente un modelo de difusión latente (latent diffusion model), y está diseñado para que las herramientas de análisis probabilístico también puedan aplicarse a otros campos
- Se recomienda experiencia en probabilidad y deep learning; como conocimientos previos se requiere experiencia en álgebra lineal, cálculo multivariable, probabilidad básica, Python y PyTorch
Estructura del curso y objetivos de aprendizaje
- Flow Matching and Diffusion Models — 2026 Version es un curso diseñado para que estudiantes e investigadores comprendan con mayor profundidad los modelos de difusión y de flujo
- Los modelos que se cubren son métodos de IA generativa para imágenes, video y muchos otros tipos de datos
- Está estructurado como un recorrido que va desde las bases matemáticas hasta la implementación
- Ecuaciones diferenciales estocásticas
- Ecuación de Fokker-Planck
- Explicación paso a paso de los componentes de cada modelo
- Implementación guiada mediante prácticas por clase
- Al final se construye un modelo de difusión latente desde cero
- La formación recomendada es experiencia en probabilidad y deep learning, y los conocimientos previos son álgebra lineal, cálculo multivariable, probabilidad básica, Python y PyTorch
Apuntes y materiales de clase
- Los apuntes son el material central del curso y explican todo el contenido de las clases de forma autocontenida
- Información para citar los apuntes
Introduction to Flow Matching and Diffusion Models- Peter Holderrieth, Ezra Erives
- 2026
- arXiv eprint:
2506.02070
-
Lista de clases
- Clase 1: Flow and Diffusion Models
- Clase 2: Flow Matching
- Clase 3-A: Score Functions and Score Matching
- Clase 3-B: Classifier-free Guidance
- Clase 4: Latent Spaces and Neural Network Architectures
- Clase 5: Discrete Diffusion Models
Modalidad de prácticas
- El curso incluye un total de 3 prácticas (labs) y ofrece experiencia de implementación mediante ejercicios provistos junto con las clases
- Las prácticas consisten en construir flow matching y modelos de difusión desde cero, paso a paso
- Procedimiento
- Revisar las instrucciones en el enlace de la práctica
- Descargar el notebook
.ipynbdesde GitHub - Ejecutarlo en un entorno de Jupyter Notebook; Google Colab también puede usarse como opción
- Después de completar todas las preguntas, exportar el notebook como PDF y enviarlo a Gradescope de Canvas
- No se deben borrar las salidas de las celdas, porque eso dificulta la calificación
- Si te atoras, puedes consultar las soluciones
1 comentarios
Comentarios en Hacker News
La clase de MIT "6.S184: Introduction to Flow Matching and Diffusion Models" ya está disponible en YouTube
Cubre algoritmos modernos de IA generativa para imágenes, video, proteínas, etc., junto con las herramientas matemáticas necesarias para entenderlos
Flow matching y los modelos de difusión son matemáticamente complejos, así que muchas clases se quedan en el nivel intuitivo, pero esta busca ofrecer una introducción rigurosa y autocontenida para principiantes en IA
Fuente: https://x.com/peholderrieth
[1] https://ocw.mit.edu/courses/2-71-optics-spring-2009/resource...
Ambos tienen valor, pero es difícil encontrar lo segundo en medio de un mar de material introductorio que solo da intuición
Los flujos normalizantes condicionales me parecen de las soluciones más elegantes que he visto para problemas de diseño inverso, siempre que tengas los datos para entrenarlos
La idea de empujar y jalar la masa de probabilidad de una distribución base mediante una función biyectiva para deformarla con cuidado hasta el lugar deseado es realmente elegante, y la construcción de esa función biyectiva en sí también es muy ingeniosa
Era complicado aplicarlo cuando parte del objetivo era continuo y otra parte categórica, pero aun así me parece un método buenísimo, y además tiene un nombre muy bien puesto
Se ve como una gran clase y quiero verla pronto. Parece estar enfocada estrictamente en espacios continuos, pero también están pasando cosas interesantes del lado de la difusión discreta
Me pregunto si hay planes para una continuación. Noté que Peter también acaba de publicar un paper sobre difusión discreta
https://x.com/peholderrieth/status/1891846309952282661
https://github.com/kuleshov-group/awesome-discrete-diffusion...
Me pregunto si existe alguna colección de clases abiertas sobre técnicas modernas de IA
https://github.com/luspr/awesome-ml-courses
https://github.com/owainlewis/awesome-artificial-intelligenc...
De verdad agradezco materiales de clases abiertas como MIT OCW. Los he usado como material complementario para mis cursos de la carrera, y aprender el mismo tema de dos maneras distintas ayuda mucho, especialmente en contenidos difíciles de entender
Qué gusto ver esta clase aquí. Parece que los LLM le han quitado mucha atención a esta técnica tan increíblemente útil
Ojalá alguien familiarizado con el tema pudiera explicar en pocas palabras sus usos principales y la impresión general
Estos modelos se entrenan para empujar poco a poco una muestra de ruido puro hacia la distribución de los datos de entrenamiento. Como se entrenan con versiones de los datos a las que se les mezcla ruido, durante el proceso de eliminación de ruido pueden explorar y aprovechar mejor las regiones cercanas a la distribución real de los datos
Uno de los grandes problemas de las GAN es un fenómeno llamado colapso de modos [2]
[1] https://www.physicalintelligence.company/blog/pi0
[2] https://en.wikipedia.org/wiki/Mode_collapse
Los últimos 10 años han sido una edad de oro para la educación en deep learning. Me gusta ver que compitan por publicar gratis contenido de aprendizaje cada vez mejor
Es excelente que MIT publique gratis contenido tan oportuno y relevante
Me pregunto qué otras clases de OCW hay sobre IA moderna