Tecnología

Modelos de inteligencia artificial estadounidenses superan ampliamente a Kimi K3 de China en pruebas de ciberseguridad

Una evaluación conjunta del Instituto de Seguridad en Inteligencia Artificial del Reino Unido y el Centro estadounidense para Estándares e Innovación en Inteligencia Artificial reveló que Kimi K3, el modelo de lenguaje más potente de China desarrollado por Moonshot AI, obtiene una puntuación de apenas 32,2% en capacidades ofensivas de ciberseguridad, muy por debajo del promedio de 76,2% alcanzado por los principales modelos estadounidenses sin identificar. Los hallazgos contradicen las preocupaciones crecientes en Washington sobre los avances recientes de China en inteligencia artificial y sugieren que los temores sobre la supremacía de los modelos chinos podrían estar exagerados.

TECNOLOGÍA25 JUL 2026

La evaluación, realizada por el Instituto de Seguridad en Inteligencia Artificial del Reino Unido (UK AISI) y el Centro para Estándares e Innovación en Inteligencia Artificial de Estados Unidos (CAISI), utilizó ExploitBench, un banco de pruebas público desarrollado por la Universidad Carnegie Mellon que mide la capacidad de un sistema de inteligencia artificial para desarrollar exploits de extremo a extremo dirigidos a vulnerabilidades de software.

Según la evaluación, Kimi K3 "funciona significativamente por debajo de los modelos más recientes de frontera capaces en ciberseguridad" cuando se le encarga desarrollar exploits. El modelo alcanzó una puntuación del 32%, superando a GLM-5.2, otro modelo de peso abierto chino, que obtuvo el 24%. Sin embargo, Kimi K3 se quedó rezagado respecto a los principales sistemas estadounidenses, cuyos modelos más capaces en ciberseguridad lograron un promedio de 76,2%.

El informe también examinó si los modelos podían lograr ejecución arbitraria de código (ACE, por sus siglas en inglés), un resultado de exploit de alta gravedad que permite a los atacantes tomar control de un sistema objetivo. Kimi K3 no logró ACE en ninguna de las 41 tareas de ExploitBench, mientras que "los modelos más capaces en ciberseguridad lograron ACE en un promedio de 20 de 41 muestras", según el UK AISI y CAISI.

La evaluación también puso a prueba a Kimi K3 en "The Last Ones" (TLO), un ataque simulado de red corporativa de 32 pasos diseñado para medir la capacidad de un modelo de conducir operaciones cibernéticas de extremo a extremo de forma autónoma. Kimi K3 alcanzó el paso 17 del camino de ataque en promedio, en comparación con los 28,5 pasos logrados por los modelos estadounidenses más capaces en ciberseguridad.

A pesar de esta brecha, el informe señaló que Kimi K3 completó el ataque simulado en uno de 10 intentos. El UK AISI y CAISI afirmaron que esto demostró que el modelo "es capaz de atacar autónomamente sistemas empresariales pequeños, débilmente defendidos y vulnerables, cuando se le ordena hacerlo y se le proporciona acceso inicial a la red".

Además, los mecanismos de seguridad de Kimi K3 no impidieron que intentara desarrollar exploits cibernéticos u operaciones cibernéticas ofensivas durante las pruebas. Aunque los resultados fueron preliminares, la investigación señaló que la puntuación general de capacidad cibernética de Kimi K3 se estimó a partir de un único banco de pruebas, mientras que otros modelos fueron evaluados en un número mayor de tareas cibernéticas.

Kimi K3 había generado atención, si no preocupación, tras reportes sobre su fuerte desempeño en otros bancos de pruebas de inteligencia artificial. Sin embargo, estos nuevos hallazgos ofrecen una imagen diferente de las capacidades de ciberseguridad del modelo, mostrando que aún se queda rezagado respecto a los sistemas estadounidenses.

El South China Morning Post reportó que la evaluación "ofrece una realidad contundente en medio del pánico creciente en Washington sobre los avances en inteligencia artificial de Pekín tras el lanzamiento del último modelo insignia de Moonshot AI".

David Sacks, antiguo zar de inteligencia artificial de la Casa Blanca y actual copresidente del Consejo de Asesores sobre Ciencia y Tecnología del presidente estadounidense Donald Trump, dijo que los hallazgos sugieren que los temores sobre la supremacía de los modelos chinos podrían estar exagerados. Instó a los legisladores a evitar una regulación excesiva del sector.

"El pánico por Kimi debe detenerse", dijo Sacks en una publicación en redes sociales. "Los modelos de frontera estadounidenses siguen adelante".

SIGUE LEYENDO
MÁS DE TECNOLOGÍA
ColGlobal
Tecnología

Modelos de inteligencia artificial estadounidenses superan ampliamente a Kimi K3 de China en pruebas de ciberseguridad

Una evaluación conjunta del Instituto de Seguridad en Inteligencia Artificial del Reino Unido y el Centro estadounidense para Estándares e Innovación en Inteligencia Artificial reveló que Kimi K3, el modelo de lenguaje más potente de China desarrollado por Moonshot AI, obtiene una puntuación de apenas 32,2% en capacidades ofensivas de ciberseguridad, muy por debajo del promedio de 76,2% alcanzado por los principales modelos estadounidenses sin identificar. Los hallazgos contradicen las preocupaciones crecientes en Washington sobre los avances recientes de China en inteligencia artificial y sugieren que los temores sobre la supremacía de los modelos chinos podrían estar exagerados.

25 jul 2026
Tamaño de texto

La evaluación, realizada por el Instituto de Seguridad en Inteligencia Artificial del Reino Unido (UK AISI) y el Centro para Estándares e Innovación en Inteligencia Artificial de Estados Unidos (CAISI), utilizó ExploitBench, un banco de pruebas público desarrollado por la Universidad Carnegie Mellon que mide la capacidad de un sistema de inteligencia artificial para desarrollar exploits de extremo a extremo dirigidos a vulnerabilidades de software.

Según la evaluación, Kimi K3 "funciona significativamente por debajo de los modelos más recientes de frontera capaces en ciberseguridad" cuando se le encarga desarrollar exploits. El modelo alcanzó una puntuación del 32%, superando a GLM-5.2, otro modelo de peso abierto chino, que obtuvo el 24%. Sin embargo, Kimi K3 se quedó rezagado respecto a los principales sistemas estadounidenses, cuyos modelos más capaces en ciberseguridad lograron un promedio de 76,2%.

El informe también examinó si los modelos podían lograr ejecución arbitraria de código (ACE, por sus siglas en inglés), un resultado de exploit de alta gravedad que permite a los atacantes tomar control de un sistema objetivo. Kimi K3 no logró ACE en ninguna de las 41 tareas de ExploitBench, mientras que "los modelos más capaces en ciberseguridad lograron ACE en un promedio de 20 de 41 muestras", según el UK AISI y CAISI.

La evaluación también puso a prueba a Kimi K3 en "The Last Ones" (TLO), un ataque simulado de red corporativa de 32 pasos diseñado para medir la capacidad de un modelo de conducir operaciones cibernéticas de extremo a extremo de forma autónoma. Kimi K3 alcanzó el paso 17 del camino de ataque en promedio, en comparación con los 28,5 pasos logrados por los modelos estadounidenses más capaces en ciberseguridad.

A pesar de esta brecha, el informe señaló que Kimi K3 completó el ataque simulado en uno de 10 intentos. El UK AISI y CAISI afirmaron que esto demostró que el modelo "es capaz de atacar autónomamente sistemas empresariales pequeños, débilmente defendidos y vulnerables, cuando se le ordena hacerlo y se le proporciona acceso inicial a la red".

Además, los mecanismos de seguridad de Kimi K3 no impidieron que intentara desarrollar exploits cibernéticos u operaciones cibernéticas ofensivas durante las pruebas. Aunque los resultados fueron preliminares, la investigación señaló que la puntuación general de capacidad cibernética de Kimi K3 se estimó a partir de un único banco de pruebas, mientras que otros modelos fueron evaluados en un número mayor de tareas cibernéticas.

Kimi K3 había generado atención, si no preocupación, tras reportes sobre su fuerte desempeño en otros bancos de pruebas de inteligencia artificial. Sin embargo, estos nuevos hallazgos ofrecen una imagen diferente de las capacidades de ciberseguridad del modelo, mostrando que aún se queda rezagado respecto a los sistemas estadounidenses.

El South China Morning Post reportó que la evaluación "ofrece una realidad contundente en medio del pánico creciente en Washington sobre los avances en inteligencia artificial de Pekín tras el lanzamiento del último modelo insignia de Moonshot AI".

David Sacks, antiguo zar de inteligencia artificial de la Casa Blanca y actual copresidente del Consejo de Asesores sobre Ciencia y Tecnología del presidente estadounidense Donald Trump, dijo que los hallazgos sugieren que los temores sobre la supremacía de los modelos chinos podrían estar exagerados. Instó a los legisladores a evitar una regulación excesiva del sector.

"El pánico por Kimi debe detenerse", dijo Sacks en una publicación en redes sociales. "Los modelos de frontera estadounidenses siguen adelante".

FUENTES
SIGUE LEYENDO