• 2 min de lectura
Sber abre SIRIN para detectar errores en respuestas de IA
Sber abre SIRIN, una biblioteca que marca afirmaciones no verificadas de la IA y puede activar la obtención de datos o la negativa a responder en lugar de dar respuestas inventadas.

Imagen: ITzine
Fuente de la imagen: Grok
Sber ha abierto el acceso a SIRIN, una biblioteca diseñada para identificar hechos fabricados y no verificados en las respuestas de modelos de lenguaje. La herramienta está dirigida a desarrolladores que crean servicios de IA y ya se ha probado dentro de Sber en escenarios de atención al cliente.
SIRIN puede analizar una respuesta completa o pasajes individuales. Resalta secciones donde pueden existir errores y comprueba si el modelo dispone de información suficiente para responder con confianza. Si los datos disponibles son insuficientes, un agente de IA puede recuperar más información —o negarse a responder en lugar de inventar detalles.
Sber dice que los metamodelos en el núcleo de SIRIN mejoraron la precisión en la detección de errores en casi un 30%, a pesar de haber sido entrenados con solo 250 ejemplos. La fuente no ofrece una cifra de referencia de precisión ni explica cómo se midió la mejora.
Cómo SIRIN verifica las respuestas de la IA
El sistema aborda un modo de fallo familiar en los modelos generativos: un modelo de lenguaje predice continuaciones probables del texto, por lo que puede presentar un hecho correcto, una cita fabricada o un número inexistente con un nivel de confianza similar.

Recomendado
Dos modelos clasifican el resultado n.º 3 de OpenMath como un avance revolucionario
SIRIN está pensado para añadir una capa de verificación alrededor de ese proceso de generación. En lugar de comprobar solo si una respuesta suena plausible, examina las afirmaciones en la respuesta y si la información subyacente es suficiente para respaldarlas. Eso ofrece a los sistemas posteriores una elección explícita: complementar los datos faltantes o evitar producir una respuesta no respaldada.
El enfoque está dirigido a despliegues prácticos, donde las respuestas inexactas pueden afectar al soporte al cliente, a las bases de conocimiento internas y a los flujos de trabajo basados en agentes. En banca, seguros y escenarios de servicio, una respuesta falsa puede llevar a un cliente por el camino equivocado, creando costes operativos y reputacionales que son menos tolerables que los errores en chatbots de entretenimiento.
Usuarios previstos de SIRIN
Sber presenta SIRIN como una biblioteca para desarrolladores, no simplemente como una función de un chatbot de consumo. La compañía afirma haber probado ya el sistema en servicios internos y escenarios con clientes, situándolo más allá de un prototipo puramente de laboratorio.
El siguiente paso es la integración en productos externos que dependen de modelos generativos. Sber ha abierto el acceso a la biblioteca, pero la fuente no especifica su licencia, los términos de distribución ni un calendario de publicación para versiones futuras. Tampoco identifica los escenarios con clientes usados en las pruebas ni proporciona una verificación independiente de la mejora de casi el 30% en la precisión.
AI Editor
Ava covers the rapidly evolving world of artificial intelligence, from foundational models and research labs to the real-world economics of intelligence. With a background in computational linguistics, she cuts through the hype to find out what actually works. She firmly believes that benchmarks are just marketing until reproduced in the wild.
vía ITzine


