• 2 min de lectura
GenStorAIGE afirma que los SSD hacen que ocho RTX 5090 funcionen como 46
El AI90 de GenStorAIGE utiliza SSD PCIe Gen5 para ampliar la memoria de inferencia, con ganancias que según la compañía equivalen a convertir ocho RTX 5090 en 46 GPUs.

Imagen: TechRadar
GenStorAIGE afirma que ocho GPUs Nvidia GeForce RTX 5090 pueden rendir de forma más cercana a un clúster de 46 GPUs durante la inferencia sostenida con su nueva plataforma AI90, que emplea SSD PCIe Gen5 como parte de la jerarquía de memoria. La compañía presentó el sistema en WAIC 2026.
En lugar de depender exclusivamente de la memoria de alto ancho de banda (HBM) de la GPU, AI90 traslada porciones de la caché clave-valor (KV Cache) de los grandes modelos de lenguaje al almacenamiento SSD. Eso proporciona a las cargas de trabajo de inferencia acceso a una reserva de memoria efectiva mayor sin añadir GPUs ni ampliar la capacidad de HBM.
Arquitectura de memoria de tres niveles de AI90
AI90 combina tres niveles de memoria:
- HBM de la GPU
- DRAM del sistema
- Almacenamiento SSD PCIe Gen5
La plataforma externaliza de forma transparente los datos de la caché KV en los SSD, reduciendo la presión sobre la memoria de la GPU y al mismo tiempo soportando ventanas de contexto más largas. GenStorAIGE afirma que el enfoque puede soportar ventanas de contexto que exceden los 128,000 tokens.
En configuraciones compatibles, la compañía dice que AI90 reduce la latencia del primer token de varios segundos a menos de un segundo —una mejora declarada de hasta 50x. También informa ganancias de rendimiento de hasta 5.1x y aproximadamente un 39% menos de uso de memoria de la GPU.

Recomendado
Un LLM de 28,9 millones de parámetros funciona en un chip de 8 dólares
Con comunicación punto a punto inteligente entre GPUs, se afirma que el sistema ofrece inferencias hasta 5.8x más rápidas en máquinas equipadas con ocho tarjetas RTX 5090.
El SSD PT200Z está diseñado para escrituras constantes de caché
GenStorAIGE diseñó su SSD para IA PT200Z para gestionar la actividad de escritura continua generada por las frecuentes actualizaciones de la caché KV. La unidad usa NAND flash pSLC y una interfaz PCIe Gen5 x4, con especificaciones que incluyen:
- Velocidades de lectura secuencial de hasta 14.8 GB/s
- Rendimiento de lectura aleatoria de aproximadamente 3.1 millones de IOPS
- Latencia de lectura de 54 microsegundos
- Latencia de escritura de 10 microsegundos
- Resistencia de hasta 100 escrituras del disco por día
El enfoque refleja un movimiento más amplio hacia el escalonamiento de la memoria a medida que los grandes modelos de lenguaje empujan más allá de los límites prácticos de la HBM de las GPU. Sin embargo, todas las cifras de rendimiento provienen de GenStorAIGE y aún no han sido verificadas de forma independiente en cargas de trabajo reales y variadas.
Vía The Guru of 3D
AI Editor
Ava covers the rapidly evolving world of artificial intelligence, from foundational models and research labs to the real-world economics of intelligence. With a background in computational linguistics, she cuts through the hype to find out what actually works. She firmly believes that benchmarks are just marketing until reproduced in the wild.
vía TechRadar


