Sortie et benchmarks de GLM-5.3 : ce qui est vérifié, ce qui ne l'est pas
Cette analyse approfondie examine la sortie de GLM-5.3 par Z.ai, présenté comme un modèle de 743B dédié au code et à la cyberdéfense, avec des poids diffusés par étapes. Elle distingue le graphique officiel de neuf benchmarks de Z.ai — Terminal-Bench, DeepSWE, CyberGym 84.5%, ExploitBench et d'autres — de l'affirmation virale et à source unique des 73/80 à KingBench 3, désormais attribuée à une suite créée par un YouTubeur. Elle détaille le virage vers la cybersécurité, compare les spécifications de GLM-5.2, Qwen, Kimi et de rivaux non confirmés, et conclut que toutes les revendications de supériorité restent provisoires.