Traducción completa al español de 'Attention Is All You Need' (Vaswani et al., 2017). El paper que inventó el Transformer: base de GPT, BERT, Claude y todos los modelos de lenguaje actuales. Incluye análisis editorial y contexto histórico.
En 2017, el campo del procesamiento del lenguaje natural (PLN) estaba dominado por arquitecturas recurrentes (RNN, LSTM) y convolucionales (CNN) para tareas de transducción de secuencias, como la traducción automática. Estos modelos enfrentaban limitaciones fundamentales: las RNN sufrían de computación secuencial, lo que impedía paralelización eficiente, mientras que las CNN requerían operaciones crecientes para capturar dependencias distantes. Aunque los mecanismos de atención ya se usaban como complemento —destacando en trabajos como Neural Machine Translation by Jointly Learning to Align and Translate (Bahdanau et al., 2015)—, seguían acoplados a estructuras recurrentes. La comunidad buscaba alternativas que combinaran la capacidad de modelar dependencias de largo alcance con eficiencia computacional. Propuestas como ByteNet y ConvS2S exploraron convoluciones dilatadas, pero mantenían restricciones en la captura de relaciones arbitrarias entre tokens. En este escenario, el Transformer surgió como una apuesta radical: eliminar por completo la recurrencia y la convolución, reemplazándolas con atención auto-referencial (self-attention) multi-cabeza. La hipótesis subyacente era que los mecanismos de atención puros podrían superar las limitaciones de los enfoques existentes, ofreciendo paralelización nativa y escalabilidad. El Transformer no solo validó su premisa inicial, sino que redefinió el PLN. Su arquitectura demostró ser escalable (como confirmaron luego modelos como BERT y GPT), y su diseño se mantiene como base de sistemas actuales. La atención multi-cabeza y las codificaciones posicionales siguen siendo componentes esenciales, aunque con adaptaciones: por ejemplo, RoPE (Rotary Positional Embeddings) mejora la generalización a secuencias largas. Sin embargo, aspectos del trabajo han envejcido. La eficiencia en memoria y cómputo para secuencias muy largas —un problema que el paper subestimó— llevó a desarrollos como atención dispersa (Longformer, BigBird) o mecanismos recurrentes híbridos (Transformer-XL). Además, la afirmación de que la atención pura basta para cualquier tarea se matizó: vision transformers (ViT) requieren ajustes como patch embedding para imágenes, y en audio surgieron variantes como Conformer que reintroducen convoluciones. Críticamente, el paper no anticipó el costo ecológico y económico de escalar estos modelos, ni los sesgos en datos a gran escala —problemas centrales en debates actuales sobre IA ética. Pese a esto, su núcleo conceptual permanece intacto: la atención como mecanismo primario para dependencias globales es un principio ahora incuestionable. --- Los modelos dominantes de transducción de secuencias se basan en redes neuronales recurrentes o convolucionales complejas que incluyen un codificador y un decodificador. Los modelos de mejor rendimiento también conectan el codificador y el decodificador a través de un mecanismo de atención. Proponemos una nueva arquitectura de red simple, el Transformer, basada únicamente en mecanismos de atención, prescindiendo por completo de la recurrencia y las convoluciones. Los experimentos en dos tareas de traducción automática muestran que estos modelos son superiores en calidad, además de ser más paralelizables y requerir significativamente menos tiempo de entrenamiento. Nuestro modelo alcanza 28.4 BLEU en la tarea de traducción de inglés a alemán de WMT 2014, mejorando los mejores resultados existentes, incluyendo conjuntos, en más de 2 BLEU. En la tarea de traducción de inglés a francés de WMT 2014, nuestro modelo establece un nuevo state of art en BLEU de 41.8 para un solo modelo, después de entrenar durante 3.5 días en ocho GPUs, una fracción pequeña del costo de entrenamiento de los mejores modelos de la literatura. Demostramos que el Transformer se generaliza bien a otras tareas al aplicarlo con éxito al análisis de constituyentes en inglés, tanto con grandes como con limitados datos de entrenamiento. Las redes neuronales recurrentes, en particular la memoria de corto plazo a largo plazo [13] y las redes neuronales recurrentes con compuerta [7], se han establecido firmemente como enfoques de estado de la técnica en problemas de modelado y transducción de secuencias, como el modelado de lenguaje y la traducción automática [35, 2, 5]. Numerosos esfuerzos han continuado empujando los límites de los modelos de lenguaje recurrentes y las arquitecturas codificador-decodificador [38, 24, 15]. Los modelos recurrentes típicamente factorizan el cálculo a lo largo de las posiciones de los símbolos en las secuencias de entrada y salida. Alineando las posiciones con pasos en el tiempo de cálculo, generan una secuencia de estados ocultos h_t, como una función del estado oculto anterior h_{t-1} y la entrada para la posición t. Esta naturaleza inherentemente secuencial impide la paralelización dentro de los ejemplos de entrenamiento, lo que se vuelve crítico en longitudes de secuencia más largas, ya que las limitaciones de memoria restringen …