3 min de lectura

El método de ETRI ayuda a la IA multimodal a aprender sin olvidar

El método MemEIC de ETRI ayuda a la IA multimodal a aprender nuevos conocimientos visuales y lingüísticos mientras preserva la información anterior.

Imagen: TechXplore

Investigadores surcoreanos han desarrollado un método que permite a la IA multimodal aprender información nueva sin borrar el conocimiento que ya posee. La Tecnología de Edición de Conocimiento Continua y Composicional (MemEIC) fue desarrollada por el Electronics and Telecommunications Research Institute (ETRI), Pohang University of Science and Technology y Sungkyunkwan University.

Un equipo de investigación dirigido por Lim Soo Jong, director de la Sección de Investigación en Inteligencia del Lenguaje de ETRI, presentó el trabajo en NeurIPS 2025 en San Diego a finales del año pasado. El artículo está disponible en el servidor de preprints arXiv.

Modelos multimodales como ChatGPT, Gemini y Claude pueden procesar imágenes y texto conjuntamente, pero actualizar su conocimiento puede provocar un olvido catastrófico. Cuando la información visual y la lingüística se revisan al mismo tiempo, el conocimiento también puede enredarse, lo que conduce a respuestas incorrectas a preguntas que requieren ambos tipos de información.

Por ejemplo, se podría enseñar a un modelo que un postre en una imagen es una galleta masticable de Dubái (Dujjonku) y que el Dujjonku es popular en Corea. Al preguntarle dónde es popular el postre, un modelo existente podría en cambio identificarlo erróneamente como una trufa de chocolate y afirmar que es popular en Europa.

Recomendado

MouthPad y Vox de Augmental despiertan sueños de IA manos libres

Cómo MemEIC separa el conocimiento nuevo

Los métodos convencionales de edición de conocimiento modifican directamente los parámetros internos de un modelo. ETRI compara ese proceso con «cirugía cerebral», porque cambiar el modelo puede dañar involuntariamente la información almacenada anteriormente.

En cambio, MemEIC almacena la información nueva en una memoria externa y la recupera cuando es necesaria. Su arquitectura divide el conocimiento en componentes separados:

  • Un adaptador visual almacena información relacionada con las imágenes.
  • Un adaptador de lenguaje almacena información relacionada con el texto.
  • Un conector de conocimiento vincula ambos según el contexto de la pregunta.

El diseño se inspiró en los roles separados de los hemisferios izquierdo y derecho del cerebro humano. Al mantener el conocimiento visual y el lingüístico separados hasta que se necesiten, el sistema reduce la interferencia y preserva el comportamiento del modelo original.

Resultados del benchmark y usos potenciales

En el benchmark CCKEB de edición de conocimiento composicional de los investigadores, que contiene 1,278 elementos, MemEIC se probó editando secuencialmente cientos de fragmentos de conocimiento. Alcanzó aproximadamente un 70% de precisión en preguntas composicionales, frente al 36%–52% de los métodos existentes —es decir, más del doble del rendimiento en el extremo superior de ese rango.

Los investigadores también confirmaron la «localidad», es decir, que las respuestas a preguntas existentes permanecieron estables después de añadir nuevos conocimientos. El método podría ser útil en campos donde la información cambia con frecuencia, incluidos los datos de políticas y asuntos legales, la información de productos y los datos industriales.

Este estudio es un logro que ha sentado la base tecnológica para que la IA multimodal refleje simultáneamente información actualizada requerida en entornos de servicio reales y garantice la fiabilidad. Avanzaremos aún más la tecnología para que en el futuro pueda reflejar de manera fiable la diversa información procedente de los ámbitos industriales.

Lim Soo Jong, director de la Sección de Investigación en Inteligencia del Lenguaje de ETRI

Seong Jin, autor principal del artículo e investigador de ETRI, dijo que MemEIC aborda la interferencia que se produce cuando el conocimiento visual y el lingüístico se revisan conjuntamente, almacenando los dos tipos de forma independiente y conectándolos solo cuando es necesario.

Los métodos convencionales tenían el problema de que se producía interferencia al revisar simultáneamente el conocimiento visual y el lingüístico. MemEIC superó estas limitaciones mediante una estructura que almacena los dos tipos de conocimiento de forma independiente y los conecta solo cuando es necesario.

Seong Jin, investigador en la Sección de Investigación en Inteligencia del Lenguaje de ETRI

El estudio, «MemEIC: Un paso hacia la edición continua y composicional del conocimiento», se publicó en arXiv en 2025. Su DOI es 10.48550/arxiv.2510.25798.

Ava Chen

AI Editor

Ava covers the rapidly evolving world of artificial intelligence, from foundational models and research labs to the real-world economics of intelligence. With a background in computational linguistics, she cuts through the hype to find out what actually works. She firmly believes that benchmarks are just marketing until reproduced in the wild.

vía TechXplore

/ Sigue leyendo