• 3 min de lectura
El verdadero problema de costes de la IA comienza después de la llamada al modelo
Un ejecutivo de Cast AI sostiene que la mayor parte del gasto excesivo en IA empresarial proviene de la infraestructura y el enrutamiento, no solo de las facturas de los modelos.

Imagen: TechRadar
Las facturas de IA empresarial están aumentando más rápido de lo que muchas empresas esperaban, pero el precio de los modelos es solo parte de la historia. En este artículo de TechRadar Pro Perspectives, Laurynas Biveinis, cofundador y presidente de Cast AI, sostiene que los factores que más encarecen suelen estar detrás de escena: la infraestructura, la orquestación, los reintentos, las GPU inactivas, las ventanas de contexto sobredimensionadas y decisiones de enrutamiento deficientes.
Su advertencia es contundente: para cuando los equipos ven la factura, las decisiones que la conformaron se tomaron semanas antes en las políticas de escalado automático, las configuraciones de Kubernetes, el diseño de prompts y la arquitectura de los flujos de trabajo.
Las tres capas detrás de los costes de la IA
Biveinis afirma que las empresas a menudo solo supervisan una parte de un problema de tres capas:
- Producción: la infraestructura usada para generar tokens, incluidos los clústeres de GPU, los nodos de inferencia y las políticas de escalado
- Consumo: cómo los prompts, el almacenamiento en caché, los reintentos, las ventanas de contexto y el enrutamiento de modelos afectan lo que se gasta
- Valor: si ese gasto en tokens se traduce en resultados empresariales
Según el artículo, la mayoría de las organizaciones se sienten cómodas midiendo el valor, pero carecen de suficiente visibilidad sobre la producción y el consumo para gobernar los costes correctamente.

Recomendado
El auge de los centros de datos en el Reino Unido choca con la realidad del agua
En FinOps X en San Diego, Biveinis señala una proyección de Goldman Sachs mostrada en el escenario principal: el consumo actual de tokens por parte de empresas a nivel mundial es de aproximadamente seis cuatrillones de tokens, con una proyección a tres años de 120 cuatrillones. También señala el lanzamiento de la Tokenomics Foundation, un organismo neutral respecto a proveedores dentro de la Linux Foundation centrado en la economía del consumo de tokens de IA.
Por qué importan el enrutamiento y la automatización
Una de las tesis centrales del artículo es que muchas empresas abusan del uso de modelos de vanguardia. Según las observaciones de Biveinis, solo alrededor del 15% de las tareas de desarrollo de software necesitan realmente esos modelos de primer nivel, mientras que el 85% restante de trabajo rutinario —como programación, resumen, clasificación y recuperación— puede ser manejado por sistemas más pequeños y económicos.
Sostiene que la selección manual de modelos no escala. En su lugar, las organizaciones necesitan una infraestructura que pueda, de forma automática:
- identificar la tarea
- dirigirla al nivel de modelo adecuado
- evaluar la calidad de la salida
- escalar cuando sea necesario
Eso se vuelve más urgente a medida que los sistemas de IA pasan de asistentes a agentes autónomos. Una vez que los sistemas pueden planear, ejecutar, evaluar e iterar sin un humano en cada paso, la economía cambia drásticamente. Una sola solicitud puede ramificarse en docenas de llamadas a modelos, cada una facturada por separado, mientras que las ineficiencias se escalan continuamente en segundo plano.
La conclusión de Biveinis es que las empresas necesitan más que paneles de control. Necesitan control en la propia capa de infraestructura: gestión autónoma de cargas de trabajo de GPU e inferencia, dimensionamiento continuo y la capacidad de mover el cómputo entre proveedores cuando sea necesario. En su opinión, la próxima fase de la IA empresarial estará definida menos por quién puede acceder a los modelos y más por quién puede desplegarlos de forma eficiente.
Enterprise Editor
Marcus follows the money. He covers enterprise software, cloud architecture, and the tectonic shifts in Big Tech strategy. He translates dense earnings calls and complex M&A activity into actionable insights about where the industry is actually heading. If a tech giant makes a silent pivot, Marcus is usually the first to notice.
vía TechRadar


