4 min de lectura

Expertos dudan que copiar Fable haya hecho a Kimi K3 tan potente

Investigadores cuestionan si Fable de Anthropic podría explicar el rápido ascenso de Kimi K3, mientras que las acusaciones sobre el acceso a chips añaden una segunda capa a la disputa.

Imagen: TechCrunch

El asesor científico de la Casa Blanca, Michael Kratsios, ha acusado a Moonshot, la empresa china detrás de Kimi K3, de copiar el modelo de lenguaje a gran escala Fable de Anthropic mientras usaba chips de Nvidia prohibidos para exportación a China. Kimi K3 se describe como el mayor LLM de pesos abiertos disponible.

“La destilación industrial encubierta a gran escala destinada a robar tecnología estadounidense propietaria y socavar la investigación estadounidense es inaceptable”, escribió Kratsios, en medio de informes sobre discusiones para prohibir los modelos chinos de pesos abiertos. Moonshot no respondió a preguntas sobre su proceso de entrenamiento, y Kratsios no ofreció más detalles que respalden la acusación.

El secretario del Tesoro, Scott Bessent, ha hecho una afirmación similar, diciendo que los funcionarios están encontrando “marcas de agua de nuestros modelos de lenguaje a gran escala en muchos de los modelos chinos”. No está claro qué son esas marcas de agua, y el Departamento del Tesoro no respondió a una solicitud de comentario.

Recomendado

El sucesor de Jibo quiere convertir la vida en recuerdos de IA

Por qué los investigadores dudan de una destilación rápida de Fable

Varios investigadores dijeron a TechCrunch que la destilación por sí sola es poco probable que explique las capacidades de Kimi K3. La destilación implica consultar sistemáticamente a un modelo objetivo y luego usar sus respuestas para entrenar a otro modelo. El proceso puede incluir pedirle a un modelo que explique su cadena de pensamiento, o usar sus prompts y respuestas para ajuste fino supervisado, conocido como SFT.

«No creo que obtengas un modelo tan potente y tan rápidamente a raíz de que Fable haga estrictamente destilación. Francamente, simplemente no hay tiempo, ¿verdad? Fable solo ha estado públicamente disponible desde el 1 de julio. No puedes destilar tantos datos, entrenar un modelo y lanzarlo en dos semanas.»

Braden Hancock, investigador en el Laude Institute y cofundador de Snorkel AI

Nathan Lambert, investigador en IA del Allen Institute for AI, dijo en un podcast publicado ayer que la destilación ha perdido impacto a medida que los modelos chinos se acercan a la frontera y el entrenamiento se desplaza hacia el aprendizaje por refuerzo. El SFT puede enseñar a un modelo lo que Lambert llamó sus “modales”, pero afirmó que el ajuste fino supervisado por sí solo es poco probable que reproduzca las capacidades más potentes de un sistema de vanguardia.

Reproducir un rendimiento similar al de Fable probablemente requeriría aprendizaje por refuerzo. Eso puede implicar usar un modelo o agente más grande para evaluar las respuestas de un modelo más pequeño y ajustar su comportamiento. Las ejecuciones de aprendizaje por refuerzo a gran escala pueden requerir decenas de millones de agentes; usar la API de un modelo de vanguardia para ese proceso sería “increíblemente caro”, potencialmente lento, y podría no producir un mejor rendimiento.

Modelos anteriores, chips y supervisión de centros de datos

Modelos fronterizos previos todavía pueden haber contribuido a Kimi K3. Anthropic acusó a Moonshot, DeepSeek y MiniMax a principios de este año de destilar sistemáticamente sus modelos, citando millones de intercambios identificados mediante direcciones IP y otros metadatos. Anthropic dijo que esas consultas reflejaban una extracción deliberada de capacidades en lugar de un uso ordinario. La compañía no respondió a las preguntas de TechCrunch sobre si Fable había sido destilado.

La destilación no está necesariamente limitada a empresas chinas. Elon Musk testificó a principios de este año que su empresa SpaceXAI destiló modelos de OpenAI para desarrollar Grok, describiendo la práctica como común en toda la industria. El límite entre la destilación y la creación de datos sintéticos de entrenamiento también puede ser difícil de definir.

Hancock advirtió contra subestimar a los investigadores chinos. Uno de los fundadores de Moonshot fue estudiante de doctorado en la Carnegie Mellon University, dijo, y los investigadores e ingenieros de la compañía son capaces de hacer progresos sustanciales de forma independiente.

Kratsios también alegó que Moonshot obtuvo avanzadas Nvidia Grace Blackwell 300s y accedió a servidores equipados con chips GB300 en Tailandia. Esos chips están prohibidos para exportación a China, aunque existe un mercado negro, según Sam Bresnick, investigador en Georgetown’s Center for Security and Emerging Technology.

«Soy partidario de leyes de conozca a su cliente para centros de datos en todo el mundo. Si permites que una empresa realice grandes ejecuciones de entrenamiento en tu hardware de última generación, debe existir un mecanismo de reporte sobre quién es esa empresa y qué están haciendo.»

Sam Bresnick, investigador en Georgetown’s Center for Security and Emerging Technology

El Departamento de Comercio del presidente Joe Biden propuso reglas federales de conozca a su cliente para centros de datos en 2024, pero no parece haberse hecho más progreso bajo Donald Trump. Se espera que los exportadores que envían chips avanzados al extranjero sigan asegurándose de que el hardware se utilice solo para fines aprobados.

Ava Chen

AI Editor

Ava covers the rapidly evolving world of artificial intelligence, from foundational models and research labs to the real-world economics of intelligence. With a background in computational linguistics, she cuts through the hype to find out what actually works. She firmly believes that benchmarks are just marketing until reproduced in the wild.

vía TechCrunch

/ Sigue leyendo