Aller au contenu
Zhipu AI (Z.ai)

GLM-5.3-Flash

Le modèle multimodal open-weights de Z.ai, orienté efficacité. Assez bon marché et assez capable pour faire tourner un assistant personnel toute l'année.

Qualité

Modalité

Multimodal

Fenêtre de contexte

1M tokens

Accès

Poids ouverts

L'avis de Fabian

FM

"C'est le modèle sur lequel tourne mon assistant OpenClaw, et il est incroyablement capable et rapide pour son prix. Il gère mes e-mails et mon agenda et fait de temps en temps un peu de recherche, et le tout me coûte environ CHF 5 par mois via OpenRouter. Il a moins de personnalité que certains autres modèles, mais il reste agréable à utiliser."

GLM-5.3-Flash est le niveau efficacité de Z.ai, sorti le 26 août 2026 et le premier modèle nativement multimodal de la série GLM-5. Il prend en entrée texte, images, vidéo et fichiers, et renvoie du texte, avec appel d’outils et sortie structurée. Les poids sont sur Hugging Face sous licence MIT.

L’argument en sa faveur

C’est le modèle sur lequel tourne mon assistant OpenClaw. Cet assistant gère mes e-mails et mon agenda et fait de temps en temps un peu de recherche, et il me coûte environ CHF 5 par mois via OpenRouter. Pour une chose qui travaille tous les jours, c’est un chiffre remarquable, et c’est tout l’argument en faveur de ce modèle.

Ce qui le rend possible, c’est le prix: 0,15 $ par million de tokens en entrée et 0,50 $ en sortie, environ un dixième du tarif affiché du modèle phare GLM-5.3. Un assistant consomme beaucoup de tokens sur des appels d’outils qu’aucun humain ne lit jamais, et à ces tarifs, on arrête de s’en soucier.

Un réglage à changer

La réflexion est toujours activée et le niveau d’effort est réglé par défaut sur le maximum, ce qui ne peut pas être entièrement désactivé. Pour les problèmes difficiles, c’est ce qu’on veut. Pour « déplace ce rendez-vous », ce ne l’est pas, et vous paierez pour un raisonnement dont personne n’avait besoin. Baissez reasoning_effort pour le travail courant et laissez-le élevé pour les tâches qui le méritent.

Où il se situe

Les propres tableaux de benchmarks de Z.ai placent Flash devant Claude Opus 4.8 sur plusieurs lignes agentiques, d’automatisation et de travail de connaissance, et derrière lui sur certaines lignes de codage et de raisonnement difficile. Ce sont des chiffres rapportés par l’éditeur, donc traitez la tendance comme informative et les décimales comme du marketing. Le résumé honnête, c’est qu’il est assez proche des modèles chers sur le genre de travail piloté par des outils que fait un assistant, et assez en retrait pour que vous ne lui confiiez pas votre problème le plus difficile.

Il a aussi nettement moins de personnalité que les modèles de discussion phares. Cela compte si vous lui parlez toute la journée, et pas du tout s’il classe tranquillement vos e-mails.

Le verdict

Idéal pour: Faire tourner un assistant ou un agent qui travaille toute la journée sur des appels d'outils, quand le coût par tâche compte plus que la personnalité.

Avantages

  • Assez bon marché pour le laisser tourner: un assistant personnel coûte quelques francs par mois
  • Prend en entrée texte, images, vidéo et fichiers, ce qui couvre l'essentiel de ce qu'on confie à un assistant
  • Poids ouverts sous licence MIT, donc rien n'empêche de l'auto-héberger plus tard
  • Les propres tableaux de Z.ai le placent devant Claude Opus 4.8 sur plusieurs benchmarks agentiques et d'automatisation

Inconvénients

  • La réflexion est toujours activée et se règle par défaut sur l'effort maximal, ce qui rend les tâches courantes plus coûteuses que nécessaire tant qu'on ne la baisse pas
  • Moins de personnalité que les modèles de discussion phares
  • Les victoires aux benchmarks sont rapportées par l'éditeur, et il reste à la traîne sur les lignes de codage et de raisonnement les plus difficiles
  • Faire tourner soi-même le modèle complet à 320 milliards de paramètres demande un matériel sérieux

Caractéristiques

  • Tarifs 0,15 $/M en entrée, 0,50 $/M en sortie · entrée en cache 0,03 $/M
  • Niveau de coût Abordable
  • ⚡
    Vitesse Rapide
  • Licence MIT
Documentation développeur

Accéder à ce modèle via