01 oct. 2026
GLM-5.3 de Z.ai approche Mythos dans deux tests d’exploits
GLM-5.3 approche Mythos Preview dans certains tests d’exploits. Les résultats éclairent les capacités du modèle et les limites de ses protections.
Les benchmarks sont les tests qui servent à comparer les modèles entre eux. Cette page regroupe les articles sur ce sujet, toutes rubriques confondues.
01 oct. 2026
GLM-5.3 approche Mythos Preview dans certains tests d’exploits. Les résultats éclairent les capacités du modèle et les limites de ses protections.
01 oct. 2026
Google annonce Gemini 4 Argon pour les tâches longues de code et de sécurité. Les scores progressent, mais coûts et protocoles limitent les comparaisons.
30 sept. 2026
Ibou publie trois modèles ArseneLupin pour classer et noter sans générer de texte. Formats locaux et benchmarks éclairent leurs usages et leurs limites.