2 min de lectura

Inkling-Small supera a su hermano mayor en benchmarks clave

Thinking Machines Lab lanzó Inkling-Small, un modelo MoE de 276.000 millones de parámetros con 12.000 millones activos por token que supera a Inkling en tres benchmarks.

Imagen: ITzine

Thinking Machines Lab ha lanzado Inkling-Small, un modelo multimodal cuyo menor footprint activo superó al Inkling, más grande de la compañía, en varios benchmarks aplicados. El resultado pone de relieve un compromiso práctico en el diseño de modelos: el recuento de parámetros por sí solo no determina el rendimiento; también importan los métodos de entrenamiento y la cantidad de cómputo empleada por token.

Arquitectura y capacidades de Inkling-Small

Inkling-Small utiliza una arquitectura Mixture-of-Experts (MoE). Su modelo completo contiene 276.000 millones de parámetros, pero solo 12.000 millones de parámetros se activan por cada token. Eso reduce la carga computacional mientras se intenta preservar la calidad del modelo.

El modelo admite texto, imágenes y audio, con una ventana de contexto de hasta 1 millón de tokens. Los usuarios también pueden ajustar la profundidad de razonamiento para equilibrar la velocidad de respuesta con la calidad. Thinking Machines Lab ha publicado los pesos del modelo, lo que permite a los desarrolladores ajustarlo y ejecutarlo mediante Tinker.

Resultados de los benchmarks frente al Inkling original

Según la compañía, Inkling-Small obtuvo puntuaciones superiores al Inkling original en tres evaluaciones aplicadas:

  • Terminal-Bench 2.1: 64,7% frente a 63,8%
  • Humanity’s Last Exam: 31,6% frente a 29,7%
  • WE-Bench Verified: 80,2% frente a 77,6%

Fuente: Thinking Machines Lab

Recomendado

Robots de reparto de Yandex llegan a Astana

La compañía afirma que entrenó Inkling-Small mediante destilación on-policy, usando el Inkling más grande como profesor. El modelo más pequeño pasó luego otras dos semanas entrenando en tareas de programación para agentes con aprendizaje por refuerzo.

Ese proceso parece haber mejorado el rendimiento en pruebas prácticas más específicas. Sin embargo, según la fuente, el Inkling original sigue siendo más fuerte en cobertura de conocimiento y precisión factual. La compañía no proporcionó cifras adicionales para esas áreas.

El lanzamiento también sitúa los pesos abiertos del modelo, la entrada multimodal, la profundidad de razonamiento ajustable y el soporte para ajuste fino en el centro de su propuesta. Los sistemas de pesos abiertos de empresas como Meta* y Mistral han competido cada vez más en eficiencia por token, multimodalidad y personalización, en lugar de basarse únicamente en el total de parámetros.

Si la ventana de contexto de 1 millón de tokens de Inkling-Small se mantiene en cargas de trabajo reales sigue sin verificarse con la información proporcionada. Para los equipos centrados en el coste computacional en lugar de las especificaciones de titular, esa validación puede importar más que el total de 276.000 millones de parámetros del modelo.

*Meta está reconocida como organización extremista en Rusia, y sus actividades están prohibidas allí.

Ava Chen

AI Editor

Ava covers the rapidly evolving world of artificial intelligence, from foundational models and research labs to the real-world economics of intelligence. With a background in computational linguistics, she cuts through the hype to find out what actually works. She firmly believes that benchmarks are just marketing until reproduced in the wild.

vía ITzine

/ Sigue leyendo