2 min de lectura

GenStorAIGE afirma que los SSD hacen que ocho RTX 5090 funcionen como 46

El AI90 de GenStorAIGE utiliza SSD PCIe Gen5 para ampliar la memoria de inferencia, con ganancias que según la compañía equivalen a convertir ocho RTX 5090 en 46 GPUs.

Imagen: TechRadar

GenStorAIGE afirma que ocho GPUs Nvidia GeForce RTX 5090 pueden rendir de forma más cercana a un clúster de 46 GPUs durante la inferencia sostenida con su nueva plataforma AI90, que emplea SSD PCIe Gen5 como parte de la jerarquía de memoria. La compañía presentó el sistema en WAIC 2026.

En lugar de depender exclusivamente de la memoria de alto ancho de banda (HBM) de la GPU, AI90 traslada porciones de la caché clave-valor (KV Cache) de los grandes modelos de lenguaje al almacenamiento SSD. Eso proporciona a las cargas de trabajo de inferencia acceso a una reserva de memoria efectiva mayor sin añadir GPUs ni ampliar la capacidad de HBM.

Arquitectura de memoria de tres niveles de AI90

AI90 combina tres niveles de memoria:

  • HBM de la GPU
  • DRAM del sistema
  • Almacenamiento SSD PCIe Gen5

La plataforma externaliza de forma transparente los datos de la caché KV en los SSD, reduciendo la presión sobre la memoria de la GPU y al mismo tiempo soportando ventanas de contexto más largas. GenStorAIGE afirma que el enfoque puede soportar ventanas de contexto que exceden los 128,000 tokens.

En configuraciones compatibles, la compañía dice que AI90 reduce la latencia del primer token de varios segundos a menos de un segundo —una mejora declarada de hasta 50x. También informa ganancias de rendimiento de hasta 5.1x y aproximadamente un 39% menos de uso de memoria de la GPU.

Recomendado

Un LLM de 28,9 millones de parámetros funciona en un chip de 8 dólares

Con comunicación punto a punto inteligente entre GPUs, se afirma que el sistema ofrece inferencias hasta 5.8x más rápidas en máquinas equipadas con ocho tarjetas RTX 5090.

El SSD PT200Z está diseñado para escrituras constantes de caché

GenStorAIGE diseñó su SSD para IA PT200Z para gestionar la actividad de escritura continua generada por las frecuentes actualizaciones de la caché KV. La unidad usa NAND flash pSLC y una interfaz PCIe Gen5 x4, con especificaciones que incluyen:

  • Velocidades de lectura secuencial de hasta 14.8 GB/s
  • Rendimiento de lectura aleatoria de aproximadamente 3.1 millones de IOPS
  • Latencia de lectura de 54 microsegundos
  • Latencia de escritura de 10 microsegundos
  • Resistencia de hasta 100 escrituras del disco por día

El enfoque refleja un movimiento más amplio hacia el escalonamiento de la memoria a medida que los grandes modelos de lenguaje empujan más allá de los límites prácticos de la HBM de las GPU. Sin embargo, todas las cifras de rendimiento provienen de GenStorAIGE y aún no han sido verificadas de forma independiente en cargas de trabajo reales y variadas.

Vía The Guru of 3D

Ava Chen

AI Editor

Ava covers the rapidly evolving world of artificial intelligence, from foundational models and research labs to the real-world economics of intelligence. With a background in computational linguistics, she cuts through the hype to find out what actually works. She firmly believes that benchmarks are just marketing until reproduced in the wild.

vía TechRadar

/ Sigue leyendo