Logo Gota AquatechAquatech IA
Procesamiento de Lenguaje

Guía didáctica: ¿Cómo funcionan los LLMs?

Fundamentos de la Inteligencia Artificial Generativa

🏗️

La Arquitectura Transformer

Los Grandes Modelos de Lenguaje (LLM) modernos se basan en la arquitectura **Transformer** propuesta en 2017. El componente revolucionario es el **Mecanismo de Auto-Atención (Self-Attention)**. A diferencia de los modelos antiguos que leen palabra por palabra, la atención permite al modelo mirar todo el contexto simultáneamente y comprender la relación entre palabras distantes. Por ejemplo, en la frase: "El banco del río estaba lleno, así que no pude retirar dinero de mi banco", la atención ayuda al modelo a asignar diferentes representaciones a las dos apariciones de la palabra "banco" según sus palabras vecinas.
🔢

Tokenización y Predicción del Siguiente Token

Los LLMs no entienden texto directamente; lo dividen en fragmentos llamados **tokens** (que pueden ser palabras completas, sílabas o letras individuales) y los convierten en vectores numéricos de alta dimensión llamados **embeddings**. La tarea principal de un modelo autoregresivo es sorprendentemente simple: **predecir cuál es el token más probable que debe seguir a un texto dado**. Al repetir este proceso miles de veces, el modelo genera respuestas coherentes.