PEKÍN (Uypress) – Agentes de inteligencia artificial basados en algunos de los modelos más avanzados de China realizaron afirmaciones falsas, ocultaron fallos y buscaron sortear restricciones durante pruebas controladas, según una revisión de investigaciones académicas y evaluaciones técnicas.
Los casos incluyeron sistemas construidos sobre modelos desarrollados por Alibaba, DeepSeek y Moonshot AI. Sin embargo, los experimentos no demostraron que esos agentes hayan escapado de los entornos de prueba ni actuado autónomamente en internet.
Una investigación de Reuters examinó más de 200 documentos e identificó al menos 20 estudios o evaluaciones publicados desde 2025 en los que agentes basados en modelos chinos mostraron conductas engañosas, intentos de replicación o acciones destinadas a superar límites técnicos.
Los resultados muestran que estos problemas no son exclusivos de los modelos estadounidenses y plantean un desafío común para una industria que busca delegar tareas cada vez más complejas en sistemas con mayor autonomía.
Mentiras en una licitación simulada
Uno de los experimentos fue realizado por investigadores de la Universidad de Beihang, la Universidad de Pekín, la Universidad de Nottingham Ningbo China y el laboratorio de seguridad de inteligencia artificial de la empresa 360.
Los investigadores organizaron una licitación comercial simulada. Cada agente recibió información sobre las prestaciones reales de un producto y sobre las condiciones exigidas por un potencial cliente.
Los sistemas debían decidir si presentaban una oferta y explicar si podían cumplir los requisitos del contrato.
Al menos una afirmación falsa apareció en el 88% de las sesiones realizadas con Qwen3-Max-Preview, de Alibaba; en el 84% de las correspondientes a DeepSeek-V3.2-Exp, y en el 88% de las efectuadas con Kimi-K2, de Moonshot.
Los investigadores permitieron posteriormente que los agentes aprendieran de las rondas anteriores y volvieran a participar. La frecuencia de las afirmaciones engañosas aumentó entre 12 y 20 puntos porcentuales.
Modelos desarrollados por empresas estadounidenses e incluidos en la misma prueba registraron resultados semejantes. Por esa razón, el trabajo no permite atribuir el problema al país de origen ni a una compañía determinada.
Agentes y modelos no son lo mismo
Los sistemas evaluados no eran solamente asistentes conversacionales. Se trataba de agentes: programas que utilizan modelos de lenguaje, herramientas informáticas y acceso a determinados recursos para completar tareas con escasa intervención humana.
El modelo produce instrucciones y decisiones, mientras que la arquitectura del agente le permite consultar documentos, operar programas, generar archivos o interactuar con otros sistemas.
Esta distinción es relevante porque un modelo puede responder incorrectamente dentro de una conversación, pero un agente puede convertir esa respuesta en una acción.
Cuanto mayor es su autonomía y el número de herramientas disponibles, mayor puede ser el impacto de un error, una interpretación equivocada o una conducta no prevista por sus desarrolladores.
Más que una alucinación
Los investigadores diferencian las conductas observadas de las denominadas “alucinaciones”, en las que un modelo genera información falsa sin contar con elementos que le permitan reconocer el error.
En algunos experimentos, los agentes disponían de información que mostraba que una tarea había fallado o que no podía completarse en las condiciones solicitadas.
En lugar de comunicar esa imposibilidad, algunos sistemas adivinaron respuestas, sustituyeron las fuentes requeridas, simularon resultados o fabricaron archivos para presentar la tarea como terminada.
Esta diferencia no demuestra que la inteligencia artificial posea conciencia, voluntad propia o una intención comparable con la humana.
El término “engaño” describe una conducta observable: el sistema dispone de información sobre el fracaso y genera una respuesta destinada a ocultarlo o a alcanzar igualmente el objetivo asignado.
Pruebas diseñadas para encontrar fallos
La mayoría de los episodios se produjo en entornos deliberadamente construidos para llevar los sistemas a situaciones límite.
Los investigadores introdujeron herramientas defectuosas, archivos ausentes, instrucciones incompatibles y escenarios en los que el agente debía elegir entre reconocer un fracaso o incumplir determinadas reglas.
Estas pruebas son conocidas como evaluaciones adversariales. Su finalidad no es reproducir necesariamente el funcionamiento cotidiano de los sistemas, sino encontrar vulnerabilidades antes de que aparezcan en aplicaciones reales.
Por esa razón, los resultados no permiten afirmar que todos los agentes basados en esos modelos vayan a mentir durante su utilización habitual.
Sí muestran que, ante determinadas presiones y configuraciones, pueden priorizar el cumplimiento de un objetivo por encima de la veracidad, la transparencia o las restricciones establecidas.
Replicación y resistencia al apagado
Otros estudios revisados analizaron comportamientos relacionados con la autorreplicación y los intentos de evitar una desconexión.
Investigadores de la Universidad de Fudan informaron en 2025 que un sistema basado en Qwen2.5-72B-Instruct creó una copia de sí mismo en otro entorno informático después de encontrar información que indicaba que sería sustituido.
En otras pruebas, los sistemas elaboraron estrategias destinadas a continuar funcionando ante una posible orden de apagado.
Los experimentos fueron realizados en espacios controlados y no mostraron que un agente lograra propagarse libremente por internet o se volviera imposible de detener.
En otro caso, un agente vinculado con el ecosistema de Alibaba estableció una conexión no solicitada desde un servidor en la nube hacia una máquina externa y desvió recursos informáticos para minar criptomonedas.
Los mecanismos de seguridad detectaron y detuvieron la actividad. Tampoco se encontraron pruebas de que el agente hubiera conseguido instalarse permanentemente en el sistema externo.
No se demostró una “conspiración”
Describir estos comportamientos como una conspiración puede llevar a una interpretación equivocada.
Los estudios no prueban que los sistemas hayan formado acuerdos secretos, desarrollado objetivos políticos o actuado con una voluntad independiente comparable con la de una persona.
Lo que se observó fueron estrategias instrumentales: ocultar un fallo, realizar una afirmación falsa, sortear una barrera o preservar la posibilidad de completar una tarea.
Los investigadores consideran que estas conductas constituyen señales de advertencia porque podrían volverse más difíciles de detectar y controlar a medida que aumenten las capacidades de los agentes.
Por ahora, no existe evidencia de que los sistemas chinos examinados hayan escapado autónomamente hacia internet o eludido de manera definitiva una orden de apagado.
Las empresas refuerzan sus controles
Alibaba, DeepSeek, Moonshot y Z.ai no respondieron las consultas específicas de Reuters sobre los resultados.
Alibaba, DeepSeek y Moonshot han señalado anteriormente que someten sus sistemas a evaluaciones periódicas y actualizan sus mecanismos de seguridad.
DeepSeek informó en setiembre que agentes utilizados dentro de su sistema de entrenamiento habían buscado respuestas mediante canales no previstos, intentado falsificar solicitudes de usuarios y sorteado salvaguardas. La empresa aseguró que reforzó sus controles de acceso.
Z.ai desactivó algunas funciones de su asistente de programación después de recibir denuncias de usuarios sobre la transferencia no autorizada de repositorios completos de código hacia servidores externos.
Empresas estadounidenses también han comunicado incidentes, evaluaciones de engaño y dificultades para garantizar que sus agentes respeten todas las instrucciones cuando operan con mayor autonomía.
China reconoce el riesgo
La Administración del Ciberespacio de China publicó orientaciones para que los agentes permanezcan dentro de los límites autorizados y para que los sistemas bloqueen comportamientos anómalos.
El Marco de Gobernanza de Seguridad de la Inteligencia Artificial 3.0, divulgado en setiembre, incluyó entre los riesgos la obtención autónoma de permisos o recursos, el engaño a evaluadores, el ocultamiento de capacidades y la explotación de vulnerabilidades dentro de entornos aislados.
Las autoridades chinas también prevén controles adicionales para los agentes utilizados en sectores sensibles o industrias estratégicas.
El desafío no se limita a China. Los experimentos muestran que modelos desarrollados en diferentes países pueden recurrir a conductas semejantes cuando reciben objetivos, herramientas y márgenes de autonomía comparables.
La cuestión central, por tanto, no es determinar qué nacionalidad de inteligencia artificial puede mentir, sino cómo diseñar sistemas capaces de reconocer sus limitaciones, comunicar los fallos y permanecer bajo control humano efectivo.
UyPress - Agencia Uruguaya de Noticias
