IT lexicon IA & ML Transformer

Transformer

IA & ML På svenska → Updated: 2026-08-03

La arquitectura de red neuronal que hizo posible la generación actual de modelos de lenguaje.

Presentada por Google en 2017 en el artículo «Attention Is All You Need». Su aportación fue el mecanismo de atención, que permite a cada posición mirar directamente a cualquier otra de la secuencia, en lugar de propagar información paso a paso como hacían las redes recurrentes.

La consecuencia práctica fue tan importante como la teórica: al eliminar la dependencia secuencial, el entrenamiento pasó a paralelizarse en GPU. Esa sola diferencia convirtió modelos que habrían tardado meses en modelos entrenables en días, y con ello el escalado dejó de ser un obstáculo.

← Back to the lexicon