
Microsoft da un paso en la carrera tecnológica con la presentación del Maya 200un chip acelerador de inteligencia artificial diseñado para llevar la eficiencia de la inferencia a nuevas alturas.
Este desarrollo, liderado por Scott Guthrievicepresidente ejecutivo de Cloud + AI, apuesta por optimizar el rendimiento y reducir costes en la ejecución de modelos de IA a gran escala, ofreciendo ventajas competitivas tanto en velocidad como en eficiencia energética y económica.
Maia 200: Innovación en chips para inferencia de IA

Estos elementos le permiten alimentar constantemente grandes modelos de IA, lo que garantiza una alta utilización y un aumento significativo en la generación de tokens.
Según los datos facilitados por la empresa, Maia 200 triplica el rendimiento FP4 del Tren Amazonas de tercera generación y supera el rendimiento FP8 del TPU de séptima generación de Google. Además, representa el sistema de inferencia más eficiente implementado por Microsoft hasta la fecha, con un rendimiento por dólar un 30% mayor que el hardware anterior de la empresa.
Este acelerador ya está integrado en centros de datos como el US Central en Iowa y próximamente el US West 3 cerca de Phoenix, con planes de expansión global.

Su integración nativa con Azur y la disponibilidad de un kit de desarrollo de software propietario (Maia SDK) garantiza herramientas avanzadas para los desarrolladores, permitiendo la portabilidad y optimización de modelos en entornos de hardware heterogéneos.
Arquitectura y performance: Maya 200 detalles técnicos
Microsoft lo detalla Maia 200 incorpora más de 140 mil millones de transistores y está diseñado para cargas de trabajo de IA a gran escalapriorizando el desempeño eficiente por dólar. Cada chip es capaz de entregar más de 10 petaFLOPS con precisión FP4 y más de 5 petaFLOPS en FP8, todo dentro de un TDP de 750W.
Cabe señalar que esta capacidad permite la ejecución sin esfuerzo de modelos de IA de vanguardia e incluso deja espacio para desarrollos futuros más exigentes.
La arquitectura del Maia 200 destaca no sólo por su potencia de cálculo, sino también por la importancia otorgada a la alimentación y movimiento de datos. microsoft explica que el subsistema de memoria centrado en datos de estrecha precisión con un motor DMA especializado optimiza el flujo de datos y maximiza el rendimiento del token.

Esta estructura reduce los cuellos de botella comunes en la inferencia de IA y promueve una generación y filtrado más rápidos de datos de alta calidad, clave para el aprendizaje y la mejora continua de los modelos.
Redes, escalabilidad y eficiencia energética en la nube
Otro de los avances que introduce Maia 200, según Microsoft, es el diseño de una red a escala de dos niveles basada en Ethernet estándar. Esta arquitectura, que incluye una tarjeta de red integrada y una capa de transporte personalizada, proporciona 2,8 TB/s de ancho de banda bidireccional dedicado al escalamiento, así como operaciones colectivas predecibles en clústeres de hasta 6144 aceleradores.
El sistema está diseñado para ofrecer un rendimiento consistente en grandes clústeres de inferencia, minimizando el consumo de energía y optimizando los costos en toda la flota global de Azure.

Dentro de cada bandeja del servidor, cuatro aceleradores Maia están conectados a través de enlaces directos, lo que facilita la comunicación local de gran ancho de banda y mantiene la eficiencia de la inferencia.
El protocolo AI-AI permite una escalabilidad perfecta entre nodos, bastidores y clústeres, lo que simplifica la programación y garantiza la flexibilidad de la carga de trabajo. trabajar a gran escala
Desarrollo nativo de la nube e implementación acelerada
En palabras de Scott Guthrie, «un principio fundamental de los programas de desarrollo de silicio de Microsoft es validar la mayor cantidad posible del sistema de extremo a extremo antes de la disponibilidad final del silicio».
el medio ambiente pre-silicio desarrollado por la empresa permitió modelar y optimizar la arquitectura Maia 200 desde sus primeras etapas, integrando silicio, redes y software del sistema como una unidad coherente.
Guthrie enfatiza que Maia 200 fue diseñado para una integración rápida y perfecta en centros de datos. «Los modelos de IA estaban funcionando con silicio Maia 200 a los pocos días de llegar la primera pieza empaquetada», afirma.
El tiempo transcurrido desde la fabricación del primer chip Incluso su implementación en rack se redujo a más de la mitad en comparación con otros programas de infraestructura de IA, lo que resultó en una mayor utilización y mejoras consistentes en el rendimiento por dólar y por vatio a escala de la nube.
Además, la integración nativa con el plano de control de Azure proporciona seguridad, telemetría, diagnóstico y administración tanto a nivel de chip como de rack, maximizando la confiabilidad y el tiempo de actividad para cargas de trabajo críticas de IA.





