2 min de lectura

AMD y Cerebras apuntan a Nvidia con inferencia más rápida

AMD y Cerebras combinan GPUs Instinct con aceleradores SRAM para una inferencia de IA más rápida y de menor latencia, con un lanzamiento de Cerebras Cloud previsto para finales de año.

Imagen: The Register

AMD está combinando sus GPUs Instinct con los aceleradores basados en SRAM de Cerebras Systems en una plataforma desagregada diseñada para reducir la latencia en cargas de trabajo de IA agentiva. Las empresas anunciaron la colaboración en el escenario durante el discurso Advancing AI de la CEO de AMD, Lisa Su, el jueves.

Cómo dividirán AMD y Cerebras las cargas de inferencia

El sistema propuesto asigna el procesamiento de prompts intensivo en cómputo a las GPUs Instinct de AMD, mientras que los motores a escala de oblea (WSE, por sus siglas en inglés) de Cerebras se encargan de la generación de tokens intensiva en memoria. Cerebras utiliza SRAM en chip en lugar de HBM4, lo que dota a sus aceleradores de una velocidad de memoria sustancialmente mayor y ayuda a la compañía a alcanzar tasas de salida que a menudo superan los 2.000 tokens por segundo.

Las compañías no proporcionaron cifras de rendimiento concretas, pero dijeron que la combinación podría aumentar los tokens generados por vatio hasta 5 veces. El objetivo es mejorar la interactividad sin sacrificar el rendimiento (throughput) ni aumentar los costes.

«Con Instinct y el rack Helios tienes al líder en rendimiento y capacidad de memoria. Y lo combinas con nuestro Wafer Scale Engine, que es el líder en SRAM y en ancho de banda de memoria, y esa combinación nos permite ofrecer una solución incomparable.»

Andrew Feldman, CEO y cofundador de Cerebras

La asociación cubre un vacío en el portfolio de AMD que contribuyó a impulsar la adquisición de Groq por 20.000 millones de dólares por parte de Nvidia en diciembre. Los aceleradores de Cerebras desempeñan un papel similar al de las LPUs Groq 3, o unidades de procesamiento de lenguaje (Language Processing Units), que Nvidia anunció junto a sus racks Vera Rubin en el GTC en marzo.

Recomendado

AMD desafía a Nvidia con los racks de IA Helios

Para un modelo de un billón de parámetros, como Kimi K2.5, según informes Nvidia necesita el equivalente a 2.000 LPUs Groq en SRAM. AMD y Cerebras dicen que su enfoque requeriría como mucho unas pocas docenas de aceleradores.

Disponibilidad de Cerebras Cloud

La oferta combinada está prevista para llegar a Cerebras Cloud a finales de este año. La asociación de AMD con Cerebras también podría ampliarse más allá de esta plataforma inicial.

«Hay muchas maneras de lograr una aceleración específica para cargas de trabajo, y creo que Cerebras tiene una tecnología muy interesante. Funciona muy bien con Helios. La idea de nuestro ecosistema abierto es, francamente, que trabajaremos con varias empresas diferentes que puedan tener tecnologías que resulten útiles.»

Lisa Su, CEO de AMD

Su añadió: «Pueden esperar que vamos a realizar más desagregación de cargas de trabajo en el futuro.»

Ava Chen

AI Editor

Ava covers the rapidly evolving world of artificial intelligence, from foundational models and research labs to the real-world economics of intelligence. With a background in computational linguistics, she cuts through the hype to find out what actually works. She firmly believes that benchmarks are just marketing until reproduced in the wild.

vía The Register

/ Sigue leyendo