• 6 min de lectura
Los modelos abiertos de China presionan a la IA de EE. UU. por precio
Alibaba y DeepSeek desafían a los modelos de IA de EE. UU. con API más baratas, pesos abiertos y resultados de benchmarks que reducen la brecha de rendimiento.

Imagen: The Register
El empuje de China hacia modelos abiertos ahora ataca a las empresas de IA de EE. UU. en dos frentes: precio y rendimiento. Alibaba ha lanzado Qwen 3.8-Max, un modelo de 2,4 billones de parámetros que, según dice, puede competir con Anthropic y OpenAI, mientras que el V4-Flash-0731 mucho más pequeño de DeepSeek supuestamente ofrece resultados comparables en benchmarks a una fracción del costo.
Los lanzamientos siguen al Kimi K3 de Moonshot AI y añaden impulso a La renovada lucha de China por modelos abiertos. También agudizan el contraste entre la disposición de China a publicar pesos de modelos y el enfoque en gran medida propietario de los principales desarrolladores estadounidenses.
Alibaba abre su modelo más grande
Qwen 3.8-Max es el primer modelo de primer nivel de Alibaba cuyos pesos están disponibles para descargar. La compañía había mantenido previamente sus sistemas más capaces detrás de una API, incluso cuando sus modelos más pequeños de pesos abiertos llamaban la atención por sus licencias permisivas y su idoneidad para el fine-tuning.
El material de lanzamiento de Alibaba presenta a Qwen 3.8-Max como igual o superior a los modelos de OpenAI y Anthropic a la vez que cuesta menos. La clasificación Intelligence de Artificial Analysis ofrece una comparación más comedida: sitúa a Qwen 3.8-Max aproximadamente a la par con Claude Sonnet 5, en lugar de claramente por delante del resto.
Qwen 3.8-Max es un modelo multimodal de mezcla de expertos. Aunque contiene 2,4 billones de parámetros en total, solo alrededor de 95.000 millones están activos para cualquier solicitud individual. Admite ventanas de contexto de hasta 1 millón de tokens, aunque Alibaba no ha explicado si esa cifra depende de técnicas como el escalado RoPE.

Recomendado
Flux 3 hace que la historia falsa parezca inquietantemente real
La compañía también planea lanzar una versión más pequeña de 27.000 millones de parámetros junto al modelo Max. La versión de 2,4 billones de parámetros podría requerir entre 48 y 64 GPUs de clase B200 de Nvidia para un despliegue orientado al cliente, según el análisis de The Register. Las cargas de trabajo internas podrían ejecutarse en 8–16 GPUs B300 o AMD MI355X.
Qwen 3.8-Max está disponible a través de la API QwenCloud de Alibaba a $2 por millón de tokens de entrada y $6 por millón de tokens de salida. La tarificación de tokens en caché es de $0,25 por millón de tokens implícitos en caché, $0,17 por millón de lecturas de tokens de caché explícitos y $2,50 por millón de tokens de caché explícitos creados. Los pesos están programados para aparecer en repositorios de modelos, incluido Hugging Face, a partir de la próxima semana.
DeepSeek apunta a los costos de inferencia
El enfoque de DeepSeek es distinto. En lugar de competir con el enorme conteo de parámetros de Qwen, su nuevo V4 Flash de 284.000 millones de parámetros se centra en extraer más rendimiento de un modelo más pequeño.
A precisión FP4, V4 Flash puede caber en alrededor de 142 GB de memoria GPU, lo que, según The Register, debería permitir a las empresas ejecutarlo a escala en un único sistema. Artificial Analysis lo coloca casi un 14 % por delante del DeepSeek V4 Pro de 1,6 billones de parámetros en su clasificación Intelligence, aunque se espera que las mejoras terminen incorporándose al modelo Pro.
DeepSeek cobra $0.14 por millón de tokens de entrada, $0.0028 por millón de tokens en caché y $0.28 por millón de tokens de salida por acceso a la API. Los precios por token por sí solos pueden ser engañosos para cargas de trabajo de razonamiento y agentes, por lo que Artificial Analysis también mide el costo de completar tareas.
En esa medida, DeepSeek V4 Flash supuestamente cuesta $0.03 por tarea, frente a $0.05 para GPT 5.6 Luna de OpenAI — una reducción del 40 %. The Register informa que Artificial Analysis también encontró el modelo a un solo punto de GPT 5.6 Luna en sus benchmarks independientes.
La eficiencia procede en parte de la decodificación especulativa DSpark, integrada en los pesos del modelo. Un modelo borrador más pequeño predice salidas probables para el modelo más grande; cuando la predicción falla, el modelo base toma el control. DeepSeek afirma que la técnica ofrece entre un 57 % y un 85 % más de velocidad por usuario en el mismo hardware. The Register dijo que sus propias pruebas respaldaron esa afirmación, aunque la fuente no aporta resultados de prueba detallados.
Los modelos abiertos aumentan la presión
La brecha entre las empresas no es solo técnica. El CEO de Anthropic, Dario Amodei, argumentó recientemente que sus objeciones se refieren a los modelos abiertos chinos, a modelos destilados a partir de sistemas propietarios y a sistemas que no cumplen estrictos estándares de seguridad. The Register caracteriza esa posición como una respuesta a modelos que compiten directamente con Anthropic.
El CEO de Hugging Face, Clément Delangue, ofreció una valoración más directa en CNBC:
«Ahora mismo están claramente dominando en modelos abiertos, y no me sorprendería que empiecen a dominar también en la frontera para finales de este año o el próximo al ritmo de progreso que llevan»,
The Register informa que el modelo de pesos abiertos estadounidense más potente, Inkling, tiene poco menos de 1.000 millones de parámetros y aún queda rezagado respecto a los sistemas líderes de DeepSeek. También cita al Kimi K3 de Moonshot y al GLM 5.2 de Z.ai como alternativas sustancialmente más capaces.
La ventaja de DeepSeek es especialmente práctica: V4 Flash es lo bastante pequeño como para ejecutarse localmente con hardware de estación de trabajo caro. The Register lo ejecutó en un DGX Spark de 128 GB, consiguiendo una ventana de contexto de 128.000 tokens con la cuantización IQ3-XXS de Unsloth en Llama.cpp. La configuración de tres bits por peso deja suficiente memoria para el modelo borrador DSpark, pero Unsloth advierte que la compresión más fuerte puede reducir la calidad de la salida.
Ese hardware sigue estando lejos de ser generalizado: el DGX Spark de Nvidia cuesta $4,699, mientras que el Ryzen AI Halo cuesta $3,999. Aun así, el hecho de que se pueda contemplar el despliegue local de un modelo de 284.000 millones de parámetros —mientras que Qwen 3.8-Max puede necesitar docenas de GPUs de centro de datos— convierte a la eficiencia de DeepSeek en el desarrollo técnico más relevante. Para compradores empresariales, la combinación de menor costo por tarea y requisitos de memoria manejables es una propuesta más sólida que el simple conteo bruto de parámetros.
AI Editor
Ava covers the rapidly evolving world of artificial intelligence, from foundational models and research labs to the real-world economics of intelligence. With a background in computational linguistics, she cuts through the hype to find out what actually works. She firmly believes that benchmarks are just marketing until reproduced in the wild.
vía The Register


