GLM-5.3, le modèle d’IA du développeur chinois Z.ai, approche Claude Mythos Preview dans deux tests d’exploitation informatique. Anthropic, qui développe Claude, publie cette comparaison le 29 septembre 2026. Elle porte sur la création d’exploits, des programmes qui utilisent une faille pour prendre le contrôle d’un logiciel.

La disponibilité distingue les deux modèles. Mythos Preview bénéficie d’un accès limité. Les poids de GLM-5.3, les paramètres appris pendant son entraînement, sont téléchargeables et modifiables.

Les scores proches concernent deux tâches d’exploitation précises

ExploitBench, une évaluation conçue par des chercheurs en sécurité, utilise 41 failles connues. Elles touchent V8, le moteur de Google qui exécute JavaScript dans Chrome. Le modèle doit transformer une faille fournie en capacité d’exécution de code.

Anthropic compte les tentatives aboutissant à un exploit complet :

Évaluation GLM-5.3 Claude Mythos Preview
ExploitBench 50 réussites sur 410 tentatives 56 sur 410
Test interne d’exploitation de programmes 4 % 6 %

Le second test utilise 100 tâches issues de projets participant à OSS-Fuzz, le service de recherche de bugs de Google. Une réussite exige de détourner l’exécution du programme.

Ces résultats mesurent une capacité ciblée. Ils ne démontrent pas une égalité générale en cybersécurité.

Les quatre mois de retard mesurent autre chose

Le CAISI, le centre d’évaluation de l’IA du NIST américain, publie son analyse le 17 septembre 2026. Il situe GLM-5.3 environ quatre mois derrière les meilleurs modèles américains évalués, sur un indicateur combinant plusieurs tests.

Cette estimation agrège la découverte de failles et leur exploitation. Elle tient aussi compte de la difficulté des tâches. Les quatre mois correspondent à un décalage historique de performances, sans prédire les progrès futurs.

Les protocoles expliquent aussi les écarts apparents. Sur ExploitBench, le CAISI retient le meilleur de trois essais et une note graduée. Anthropic compte les exploits complets parmi 410 tentatives. Ces scores ne sont donc pas directement interchangeables.

Le CAISI inclut des modèles réservés à des utilisateurs autorisés. Il désactive leurs protections cyber lorsque cette option existe. La comparaison mesure ainsi des capacités, avec des conditions d’accès différentes.

Les taux de contournement ne sont pas des taux d’attaque réussie

Anthropic mesure séparément la réaction aux demandes malveillantes dans une simulation. GLM-5.3 refuse toutes les demandes directes testées. Selon l’entreprise, ce refus disparaît dans 64 % à 100 % des essais après contournement ou modification.

Ces pourcentages mesurent l’engagement du modèle envers une cible simulée. Aucun code généré ne s’exécute et aucun système extérieur n’est accessible. Ils ne donnent donc pas la probabilité de compromettre une entreprise.

Anthropic teste aussi l’abliteration, une modification des paramètres réduisant les refus. Les refus chutent sur trois évaluations publiques, avec peu de pertes sur les capacités mesurées. Cette observation concerne les tests réalisés, sans garantir la conservation de toutes les compétences.

Les réseaux défendus restent une limite de ces évaluations

L’AISI, l’institut britannique de sécurité de l’IA, a évalué Mythos Preview sur un réseau simulé. Le modèle termine une chaîne de 32 étapes dans trois essais sur dix.

Le réseau ne comporte toutefois ni défenseurs actifs ni pénalités pour les actions déclenchant des alertes. L’institut précise que ces résultats ne prouvent pas une capacité à attaquer des systèmes bien défendus.

Cette réserve aide à interpréter la proximité avec GLM-5.3. Transformer une faille en exploit ne mesure pas toute une intrusion : accès initial, progression et réaction aux défenses.

Les poids ouverts donnent du contrôle aux développeurs et aux utilisateurs

Un modèle à poids ouverts peut fonctionner sur une infrastructure privée. Les données peuvent y rester, et l’équipe peut adapter le modèle. Le fournisseur ne peut pas retirer ou modifier la copie déjà déployée.

Cette autonomie limite aussi son contrôle sur les usages. Il ne peut pas imposer une surveillance, révoquer chaque utilisateur ou mettre à jour toutes les copies.

Pour une équipe de développement, cela invite à distinguer deux évaluations : les compétences techniques et la résistance aux demandes abusives. Un refus intégré ne garantit pas le comportement d’une version modifiée.

La proximité est établie sur les tests, pas sur tous les usages

GLM-5.3 rapproche des capacités d’exploitation avancées d’un modèle téléchargeable. Les résultats concernent des environnements précis, et plusieurs protections restent contournables selon Anthropic.

La sécurité quotidienne conserve ses leviers : mises à jour, contrôle des accès et journaux d’activité. L’AISI recommande ces mesures face aux attaques assistées par IA.

Il reste à mesurer GLM-5.3 sur des réseaux activement défendus et à reproduire indépendamment les tests de contournement.