Generación de Imágenes
Guía didáctica: Modelos de Difusión
Cómo las redes neuronales crean imágenes a partir de texto
🌀
El Proceso de Difusión
Los modelos de difusión como **Stable Diffusion** funcionan en base a dos procesos:
- Difusión directa (Forward): Añade ruido gaussiano de forma controlada a una imagen de entrenamiento hasta que se convierte en puro ruido.
- Difusión inversa (Reverse/Denoising): Una red neuronal (U-Net) aprende a predecir exactamente cuánto ruido se añadió en cada paso para poder restarlo.
🌌
El Espacio Latente
Para hacer viable el cálculo en computadoras domésticas, los modelos operan en un **Espacio Latente** comprimido (usualmente 8 veces más pequeño que los píxeles reales) gracias a un Autoencoder Variacional (VAE). La generación ocurre en este espacio matemático abstracto y luego el VAE la decodifica en una imagen de píxeles reales.

