Z.ai afirma que GLM-5.3 alcanzó un 84,5 % en CyberGym, ligeramente por encima del 83,8 % que atribuye a Mythos 5 de Anthropic. Los resultados no han sido verificados de manera independiente.

En ExploitBench, dedicado a convertir fallos en ataques funcionales, obtuvo 54,4 % frente a 78 % de Mythos. La diferencia separa revisar código de producir una intrusión utilizable.

La empresa aplazará unas dos semanas la publicación mientras termina evaluaciones y reservará funciones sensibles para usuarios verificados.

Una vez descargados los pesos, los controles son más difíciles de imponer. El lanzamiento intenta combinar apertura para defensores con límites sobre capacidades de doble uso.

PublicidadARQUITHEAArquitectura para mirar mejorIdeas, obras y herramientas para entender la ciudad desde preguntas reales.Sigue @arquithea_
La pregunta

¿Puede un modelo abierto conservar controles de seguridad?

Puede controlar el acceso inicial y entrenar rechazos, pero no garantiza lo que otros harán tras descargar y modificar los pesos. La apertura exige pruebas y responsabilidad compartida más allá del proveedor.