LLMs
Cómo funcionan los LLM: De la Tokenización al Transformer
Por Pablo Cubides
Ingeniero Químico · M. Sc. en Ingeniería Ambiental · Docente universitario · Desarrollador en IA, redes neuronales y optimización
Publicado el 14 de abril de 2024
18 min de lectura

Los Modelos de Lenguaje Grandes (LLMs) como GPT-4, Claude o LLaMA han transformado radicalmente la manera en que interactuamos con la tecnología. Sin embargo, detrás de la ilusión de la 'comprensión', existe una arquitectura matemática robusta y elegante: el Transformer. En este artículo, desentrañaremos paso a paso el viaje que recorre una frase desde que la escribes hasta que el modelo emite su respuesta.
1. Tokenización: El lenguaje de los algoritmos
Las redes neuronales no procesan palabras, procesan números. Antes de que cualquier modelo pueda analizar texto, este debe ser convertido en vectores numéricos. La tokenización es el proceso de fragmentación del texto en sub-unidades (tokens). Algoritmos como Byte-Pair Encoding (BPE) garantizan que palabras comunes sean un solo token, mientras que palabras raras se desarmen en fragmentos más pequeños.
Gracias a este proceso, los LLM pueden lidiar con cualquier palabra nueva en cualquier idioma sin colapsar. La eficiencia de un tokenizador define directamente cuántos recursos consumirá el modelo en su inferencia.
Gracias a este proceso, los LLM pueden lidiar con cualquier palabra nueva en cualquier idioma sin colapsar. La eficiencia de un tokenizador define directamente cuántos recursos consumirá el modelo en su inferencia.

2. El Mecanismo de Auto-Atención
En arquitecturas antiguas como las RNNs, la IA leía el texto palabra por palabra, olvidando el principio de la frase al llegar al final. La gran innovación del Transformer es el mecanismo de Self-Attention.
El modelo calcula matrices vectoriales (Query, Key, Value) para permitir que cada token 'preste atención' a todos los demás tokens simultáneamente. Así, si la frase es 'El banco estaba cerrado, así que me senté en otro banco', la auto-atención sabe perfectamente que el primer banco es una institución financiera y el segundo es un asiento.
El modelo calcula matrices vectoriales (Query, Key, Value) para permitir que cada token 'preste atención' a todos los demás tokens simultáneamente. Así, si la frase es 'El banco estaba cerrado, así que me senté en otro banco', la auto-atención sabe perfectamente que el primer banco es una institución financiera y el segundo es un asiento.
💡
El Origen de Todo
El famoso ensayo de Google de 2017, 'Attention is All You Need', introdujo esta arquitectura, demostrando que al prescindir totalmente de la recurrencia y apoyarse únicamente en la atención, los modelos podían paralelizarse masivamente en GPUs.
3. La Predicción Autorregresiva
Una vez que el modelo ha contextualizado la pregunta a través del Transformer, comienza el proceso de generación. Un LLM es, en esencia, una calculadora de probabilidades masiva: su único objetivo es predecir matemáticamente cuál es la palabra (token) más probable que sigue en la secuencia.
Una vez que elige el siguiente token, lo añade al historial (contexto) y repite todo el proceso para el siguiente token. Esto se conoce como generación autorregresiva, un ciclo continuo hasta que emite un token de terminación.
Una vez que elige el siguiente token, lo añade al historial (contexto) y repite todo el proceso para el siguiente token. Esto se conoce como generación autorregresiva, un ciclo continuo hasta que emite un token de terminación.
Experimenta la Arquitectura
Comprender la teoría es solo el comienzo. Hemos preparado una herramienta interactiva donde puedes visualizar y experimentar cómo interactúan estos componentes internamente al inyectar tu propio texto.
✅
Herramienta Activa
Conclusión
Entender que los LLM son motores probabilísticos con arquitecturas de atención profunda desmitifica la IA, ayudándonos a crear prompts mucho más efectivos y anticipar las limitaciones de estos sistemas.
#Transformer#Tokenización#IA#LLM#Atención

