Durante buena parte de la carrera por la inteligencia artificial , la respuesta a casi cualquier problema de capacidad parecía ser la misma: más GPUs, más servidores y centros de datos más grandes. Sin embargo, hay un límite evidente a esa estrategia. Alimentar toda esa infraestructura cuesta cada vez más dinero. Y las propias empresas están empezando a notarlo.
McKinsey estima que el 89% de las organizaciones ya utiliza IA regularmente en al menos una función , pero también encontró una señal menos cómoda: alrededor de una de cada cinco limita su utilización debido a los costes operativos, incluidos los tokens que consumen los modelos. Eso está convirtiendo una vieja disciplina informática en algo mucho más importante: hacer que el software necesite menos máquina para conseguir el mismo resultado. El nuevo objetivo de la IA es aprender a hacer más con menos © Unsplash / Alex Shuper. La eficiencia puede aparecer en lugares sorprendentemente básicos .
Uno de ellos es la precisión numérica. Un modelo no necesariamente necesita realizar todos sus cálculos utilizando números representados con enorme precisión. Técnicas como el entrenamiento en FP16, BF16 o FP8 permiten reducir la cantidad de memoria y operaciones necesarias frente a formatos de mayor precisión. La clave consiste en decidir dónde esa pérdida de precisión puede aceptarse y dónde no.
Un sistema que recomienda una película, por ejemplo, tiene un margen de error completamente distinto al de una aplicación médica. Pero hay muchas más posibilidades. Los desarrolladores pueden reutilizar modelos ya entrenados, reducir parámetros, destilar modelos grandes en otros más pequeños, cuantizarlos o diseñar arquitecturas que directamente eviten realizar cálculos innecesarios. Ahí aparece una de las técnicas que mejor representa esta nueva carrera: Mixture of Experts (MoE) .
En lugar de activar todo el modelo cada vez que llega una consulta, esta arquitectura divide parte de la red neuronal en distintos «expertos» y activa solamente los necesarios para procesar cada token. DeepSeek-V3 es un buen ejemplo. Tiene 671.000 millones de parámetros, pero aproximadamente 37.000 millones se activan para cada token. Su informe técnico asegura además que el entrenamiento completo necesitó unos 2,788 millones de horas de GPU H800.
El truco, en otras palabras, no consiste únicamente en construir una máquina más potente. También en evitar encender partes de ella cuando no hacen falta. DeepSeek convirtió una necesidad en una ventaja © Unsplash / Taylor Vick. La llegada de DeepSeek a la primera línea de la IA dejó precisamente esa lección .
Su arquitectura combina MoE con otras técnicas destinadas a reducir memoria y cómputo, incluido entrenamiento de baja precisión FP8. Investigaciones posteriores sobre su infraestructura describieron precisamente el proyecto como un ejemplo de codiseño entre hardware y software, donde ambos se optimizan conjuntamente en lugar de tratarse como piezas independientes. No significa que exista una solución mágica . Los modelos MoE también introducen problemas de comunicación, memoria y distribución de las cargas entre expertos.
De hecho, investigaciones recientes siguen buscando maneras de reducir incluso el número de expertos que deben activarse durante la inferencia. Pero económicamente el incentivo es enorme. Cada operación que desaparece significa menos tiempo de GPU. Menos GPU significa menos electricidad.
Y menos electricidad significa una factura menor por cada millón (o miles de millones) de tokens procesados. El problema es que la IA no deja de crecer Toda esa eficiencia llega justo cuando la infraestructura empieza a convertirse en un problema energético. La Agencia Internacional de la Energía calculó que los centros de datos consumieron alrededor de 415 TWh de electricidad en 2024, aproximadamente el 1,5% del total mundial. Su escenario central proyecta alrededor de 945 TWh para 2030, aunque estimaciones actualizadas sitúan la cifra cerca de los 950 TWh.
Eso supone prácticamente duplicar el consumo en pocos años. La paradoja es que los modelos pueden volverse muchísimo más eficientes mientras el consumo total sigue aumentando . Cuanto más baratos son, más lugares encuentran para utilizarlos: chatbots, programación, buscadores, generación multimedia y, cada vez más, agentes capaces de ejecutar cadenas enteras de tareas. Por eso la carrera por el «algoritmo verde» tiene algo de económico antes que ecológico.
La industria necesita descubrir cuánto cómputo puede eliminar sin que el usuario note la diferencia. Durante años, la competición de la IA consistió en descubrir quién podía construir el modelo más grande. La siguiente podría decidir quién consigue evitar que todo ese modelo tenga que trabajar cada vez que alguien hace una pregunta.