Procesamiento de Lenguaje
Guía didáctica: ¿Cómo funcionan los LLMs?
Fundamentos de la Inteligencia Artificial Generativa
🏗️
La Arquitectura Transformer
Los Grandes Modelos de Lenguaje (LLM) modernos se basan en la arquitectura **Transformer** propuesta en 2017. El componente revolucionario es el **Mecanismo de Auto-Atención (Self-Attention)**.
A diferencia de los modelos antiguos que leen palabra por palabra, la atención permite al modelo mirar todo el contexto simultáneamente y comprender la relación entre palabras distantes.
Por ejemplo, en la frase: "El banco del río estaba lleno, así que no pude retirar dinero de mi banco", la atención ayuda al modelo a asignar diferentes representaciones a las dos apariciones de la palabra "banco" según sus palabras vecinas.
🔢
Tokenización y Predicción del Siguiente Token
Los LLMs no entienden texto directamente; lo dividen en fragmentos llamados **tokens** (que pueden ser palabras completas, sílabas o letras individuales) y los convierten en vectores numéricos de alta dimensión llamados **embeddings**.
La tarea principal de un modelo autoregresivo es sorprendentemente simple: **predecir cuál es el token más probable que debe seguir a un texto dado**. Al repetir este proceso miles de veces, el modelo genera respuestas coherentes.

