Microsoft plantea medir la infraestructura de IA por la inteligencia útil que genera

Microsoft propone ampliar el concepto de rendimiento de los semiconductores a toda la infraestructura de IA, desde los centros de datos y la memoria hasta los modelos y los sistemas agénticos.

Hardware
Microsoft plantea medir la infraestructura de IA por la inteligencia útil que genera

Microsoft sostiene que la próxima etapa de la IA debe evaluarse por la cantidad de inteligencia útil que produce a partir de la infraestructura disponible, y no solo por el número de chips, tokens o centros de datos construidos. La compañía presentó este enfoque el 1 de septiembre de 2026 en una publicación firmada por Rani Borkar, President, Azure Hardware Systems and Infrastructure.

La empresa utiliza el concepto de «yield», tradicionalmente empleado por la industria de semiconductores para medir cuántos chips utilizables se obtienen de cada oblea, como referencia para analizar el rendimiento de toda la cadena de IA. Según Microsoft, esta evaluación debe incluir el capital invertido, la energía, la capacidad de fabricación, los centros de datos, el silicio, la memoria, las redes, los modelos y las herramientas que coordinan los flujos de trabajo agénticos.

Microsoft afirma que una tarea agéntica puede utilizar más de 3.400 veces más tokens que una interacción de chat típica. A medida que estos sistemas incorporan razonamiento, planificación, uso de herramientas y ejecuciones prolongadas, la compañía identifica restricciones crecientes en la energía, la memoria y la densidad de los paquetes y racks.

La propuesta combina una vía evolutiva, basada en mejorar la eficiencia, la utilización y la economía de las arquitecturas actuales, con otra transformadora, centrada en nuevas arquitecturas, materiales y enfoques para el diseño de sistemas y modelos. Microsoft considera que los principales avances requieren trabajar de forma coordinada entre las distintas capas de la infraestructura.

En el caso de la memoria, la compañía señala que el límite no es únicamente un problema de suministro o de componentes. La arquitectura de los modelos, la compresión, la gestión de jerarquías de memoria, la optimización del silicio, los compiladores y la colocación de los datos cerca del cómputo pueden reducir el impacto de la memoria, incluido el KV cache utilizado para conservar el contexto durante la generación. Microsoft pone como ejemplo su plataforma Azure Maia.

La empresa también describe la red como un elemento que debe diseñarse junto con el silicio y el software del sistema. En clústeres formados por miles de chips, factores como la gestión de la congestión, la recuperación ante fallos, la asignación de cargas y la complejidad de programación determinan si el cómputo disponible produce inteligencia o permanece inactivo. Microsoft afirma que, al diseñar Maia, partió del objetivo de lograr una inferencia eficiente a escala de flota.

Fuente: Microsoft.

Compartir

WhatsApp X Telegram Email