Logo Gota AquatechAquatech IA
Generación de Imágenes

Guía didáctica: Modelos de Difusión

Cómo las redes neuronales crean imágenes a partir de texto

🌀

El Proceso de Difusión

Los modelos de difusión como **Stable Diffusion** funcionan en base a dos procesos:
  1. Difusión directa (Forward): Añade ruido gaussiano de forma controlada a una imagen de entrenamiento hasta que se convierte en puro ruido.
  2. Difusión inversa (Reverse/Denoising): Una red neuronal (U-Net) aprende a predecir exactamente cuánto ruido se añadió en cada paso para poder restarlo.
Al generar una imagen desde cero, el modelo parte de una matriz de ruido aleatorio puro y aplica el proceso de eliminación de ruido secuencialmente durante 20-50 pasos guiado por el texto.
🌌

El Espacio Latente

Para hacer viable el cálculo en computadoras domésticas, los modelos operan en un **Espacio Latente** comprimido (usualmente 8 veces más pequeño que los píxeles reales) gracias a un Autoencoder Variacional (VAE). La generación ocurre en este espacio matemático abstracto y luego el VAE la decodifica en una imagen de píxeles reales.