¿Cómo está cambiando la inteligencia artificial los modelos de lenguaje modernos?
Hoy en día, los modelos de lenguaje basados en inteligencia artificial (IA), como los transformadores, son la vanguardia en procesar cantidades inmensas de datos. Sin embargo, existen desafíos intrínsecos en su funcionamiento que están llevando a los investigadores a explorar nuevos caminos y arquitecturas. Pero antes de adentrarnos en esos avances, echemos un vistazo a los problemas actuales que enfrentan estos modelos y las soluciones que están surgiendo para superarlos.
El desafío de los tokens y la eficiencia
Los modelos de lenguaje con transformadores, como los que encontramos en las arquitecturas de IA más avanzadas, se enfrentan a un problema crítico: la atención. Este proceso permite que el modelo «reflexione» sobre los tokens anteriores cada vez que genera uno nuevo. Imagina la cantidad de operaciones matemáticas necesarias para ello cuando la secuencia de tokens se extiende en millones, que como puedes adivinar, supone una carga computacional enorme.
Por ejemplo, generar el token número 128.001 de una secuencia requiere comparaciones con todos los tokens anteriores. Este tipo de cálculos se vuelven tan complejos que gigantes como Google aumentan su precio para procesar más allá de determinados umbrales de tokens.
Innovaciones en la optimización de la IA
Afortunadamente, hay un ejército de investigadores dedicados a mejorar este aspecto. Tomemos el caso de FlashAttention, desarrollado por el científico de la computación Tri Dao y su equipo, que optimiza las operaciones de memoria, reduciendo el tiempo invertido en mover datos y mejorando significativamente el rendimiento.
Otra estrategia es Ring Attention, que distribuye las tareas de atención en múltiples GPUs, organizándolo todo de forma que cada elemento interactúe con todos los demás de manera eficiente. Sin embargo, la atención individual sigue siendo costosa, y es aquí donde entra en juego la arquitectura Mamba.
Mamba: la nueva promesa en IA
Mamba, a diferencia de los transformadores convencionales, no se basa en la atención para su funcionamiento. En su lugar, utiliza un estado oculto que actúa como memoria, lo cual no incrementa el coste por token con mensajes más largos. Esto plantea un interesante contraste respecto a los métodos tradicionales, pues busca combinar la eficiencia de las redes neuronales recurrentes (RNN) con el rendimiento de los transformadores.
En experimentos realizados por Nvidia, se encontró que una arquitectura híbrida de 24 capas de Mamba con capas de atención era más eficiente que los modelos puros de transformadores o Mamba.
El modelo Jamba: eficiencia y rendimiento
AI21, una startup israelí, lanzó su modelo Jamba 1.5 Large, una avanzadilla en cuanto a eficiencia. Con un uso significativamente menor de memoria que modelos comparables de Meta, requiere tan solo 9GB para gestionar 256.000 tokens de contexto, haciéndolo accesible para equipos menos potentes.
Aunque Jamba logra un puntaje MMLU de 80 en comparación con el 86 del modelo Llama 3.1 70B de Meta, sigue siendo una solución prometedora para aquellos interesados en la eficiencia y reducción de costes.
Reflexiones sobre el futuro de la IA y los modelos de lenguaje
Mientras que extender los contextos de tokens promete grandes beneficios, el camino para lograrlo eficazmente no está del todo claro. Puede que avancemos utilizando optimizaciones de eficiencia y escala, o, como podría ser el caso de Mamba, que veamos un auge en arquitecturas sin atención. También es posible que alguien descubra una arquitectura completamente nueva que deje obsoletos a los transformadores actuales.
En cualquier caso, seguiremos de cerca estas innovaciones porque, está claro, la IA está transformando no solo cómo funcionan estos modelos, sino también nuestra comprensión del potencial de estas tecnologías. Si te interesa saber más sobre estas temáticas y cómo la inteligencia artificial se está integrando en nuestras vidas, asegúrate de seguir las novedades continuas en el mundo de la IA.


