🇬🇧 This article is also available in English.

Clef de Cloudflare apporte les modèles de décision au cœur des agents

Clef de Cloudflare apporte les modèles de décision au cœur des agents
🇬🇧 This article is also available in English.
📑 Table of Contents

TL;DR

  • Cloudflare a publié Clef (27B) et Clef-flash (9B), les premiers modèles entraînés par son équipe Workers AI, open-sourcés sous Apache 2.0 sur Hugging Face.
  • Un modèle de décision lit un état d’entrée accompagné de questions typées et renvoie une probabilité pour chaque réponse autorisée — pas de texte libre, pas de tokens de raisonnement — destiné au « hot path » des pipelines d’agents.
  • Sur 43 exécutions de benchmarks, Clef affiche une latence médiane de 209,3 ms contre 524,1 ms pour Jev (2,5x plus rapide), tandis que Clef-flash atteint 38,8 ms (13x plus rapide).
  • Clef est compatible en drop-in avec Jev de Typesafe via l’API System One et ajoute un encodeur visuel, bien qu’il reste en retrait face à Jev sur quelques évaluations.

Un modèle plus petit qui ne fait que décider

Pendant deux ans, la réponse par défaut à « comment un agent devrait-il décider quelque chose ? » a été de demander à un LLM. Mais c’est lent et non déterministe : le modèle émet des tokens un par un, et le temps que votre code ait analysé le texte libre, le moment de prendre une décision de routage est peut-être déjà passé. L’équipe Workers AI de Cloudflare a fait un pari différent le 1er octobre. Clef et Clef-flash sont ses premiers modèles entraînés en interne, positionnés non pas comme des LLM mais comme des modèles de décision, « de la même famille que Jev de Typesafe » — ils lisent un état d’entrée accompagné de questions typées et renvoient une probabilité pour chaque réponse autorisée (Source : Cloudflare — Introducing Clef).

C’est la séparation Système 1 / Système 2 appliquée à l’infrastructure. Un modèle de décision gère le réflexe rapide et borné — router ce ticket, bloquer cette requête, escalader vers un humain — tandis qu’un LLM généraliste gère le raisonnement ouvert et les appels d’outils. Cloudflare présente les deux comme complémentaires, et non rivaux. Le modèle de décision se place dans le chemin de la requête ; le LLM exécute l’action (Source : Cloudflare Changelog — Introducing Clef).

Des questions typées, des réponses analysables

L’interface est réduite et explicite. Chaque requête transporte un état ainsi que jusqu’à 64 questions, en trois types (Source : Cloudflare Changelog — Introducing Clef) :

  • noul — une question oui/non. Renvoie la probabilité que la réponse soit oui.
  • choice — choisir une option parmi un ensemble que vous définissez. Renvoie l’option choisie, une probabilité par option et une valeur de confiance.
  • score — évaluer selon une grille ordonnée. Renvoie un score pondéré par les probabilités et une probabilité par niveau.

Comme la sortie est strictement typée et que les réponses autorisées sont bornées par le schéma, il n’y a aucun texte à analyser et aucune chaîne de raisonnement à attendre. Cloudflare soutient que c’est tout l’intérêt : un modèle de décision « produit des sorties structurées bornées de manière économique, rapide et cohérente » là où un LLM est « largement non déterministe » (Source : Cloudflare — Introducing Clef).

Les chiffres de latence et de précision

L’argument principal de Cloudflare, c’est la vitesse. Sur les 43 benchmarks d’évaluation exécutés, Clef a mesuré une latence médiane de 209,3 ms (238,6 ms au p95) contre 524,1 ms en médiane pour Jev (536,0 ms au p95). Clef-flash descend à 38,8 ms en médiane et 122,4 ms au p95. Cela rend Clef 2,5x plus rapide que Jev en médiane et Clef-flash 13x plus rapide (Source : Cloudflare Changelog — Introducing Clef).

Le tableau de la précision est plus contrasté et mérite une lecture attentive. Sur 10 benchmarks de décision, un modèle Clef obtient le meilleur score sur 7 (Source : Cloudflare Changelog — Introducing Clef). Sur BFCL case-exact, Clef obtient 98,47 et Clef-flash 98,76 contre 95,75 pour Jev. Sur BANKING77 macro-F1, Clef mène avec 94,20 contre 79,74 pour Jev. Sur CLINC150+OOS macro-F1, Clef atteint 97,43 tandis que Clef-flash s’effondre à 66,77 — en dessous des 89,27 de Jev. La tendance s’inverse sur les appareils électroménagers, où Clef-flash obtient 97,73 contre 82,95 pour Clef et 52,27 pour Jev (Source : Cloudflare Changelog — Introducing Clef).

Sur les propres évaluations de workflows de Typesafe, Clef bat Jev dans 3 des 4 domaines — traitement de factures (64,7 vs 61,8), service client (76,3 vs 76,0) et incidents de sécurité (62,9 vs 61,7). Jev reste en tête sur l’observabilité des traces d’agents, avec 71,6 contre 69,8 pour Clef-flash (Source : Cloudflare — Introducing Clef).

À retenir : Clef-flash est un véritable compromis, pas un repas gratuit : il gagne un ordre de grandeur en latence mais peut perdre beaucoup de précision sur certaines tâches de classification, le choix de la tâche compte donc.

Sous le capot, et dans le hot path

Clef utilise Qwen comme backbone, post-entraîné pour des cas d’usage de décision. À l’inférence, il exécute une passe en prefill uniquement, puis évalue en parallèle les choix valides du schéma — l’étape de décision est non autorégressive, donc aucun texte n’est généré token par token (Source : Cloudflare — Introducing Clef). Cloudflare indique que l’entraînement gèle le backbone et optimise conjointement une tête de routage avec des adaptateurs de rang faible de rang 256, en calibrant avec une perte de Brier et un objectif de « Reinforcement Learning for Calibrated Decisions » (Source : Cloudflare — Introducing Clef).

Clef (27B) est l’option la plus précise ; Clef-flash (9B) est destiné aux décisions critiques en latence. Les deux disposent d’une fenêtre de contexte de 64K tokens, le double des 32K de Jev (Source : Cloudflare — Introducing Clef). Clef possède également un encodeur visuel et accepte jusqu’à quatre images en plus de l’état, contrairement aux modèles de décision purement textuels comme Jev (Source : Cloudflare Changelog — Introducing Clef).

Comme les modèles tournent sur les GPU Workers AI à travers le réseau de Cloudflare, l’aller-retour réseau reste court, ce qui rend l’argument du hot path crédible (Source : Cloudflare Changelog — Introducing Clef). L’équipe threat intelligence de Cloudflare l’utilise pour classifier des domaines : associé à Browser Run, Clef a récupéré, rendu et classifié un site en 2,2 secondes contre 4,7 secondes pour gpt-oss-120b (Source : Cloudflare — Introducing Clef).

Poids ouverts et un volet de fine-tuning par RL

Les poids sont sur Hugging Face sous Apache 2.0, et Clef est accessible via le binding Workers AI (env.AI.run()) ou l’API REST à /ai/run, ainsi que via AI Gateway (Source : Cloudflare Changelog — Introducing Clef).

En parallèle des modèles, Cloudflare a lancé un service de fine-tuning par apprentissage par renforcement, en commençant par son équipe d’ingénierie déployée sur le terrain et avec l’intention de le rendre en self-serve, permettant aux clients de capturer des données via AI Gateway, de générer des rollouts sur Workers AI, de scorer les actions dans des sandboxes RL basées sur Containers, de réentraîner et de redéployer (Source : Cloudflare — Introducing Clef).

FAQ

Qu’est-ce qu’un modèle de décision ?

Un modèle qui lit un état d’entrée accompagné de questions typées et renvoie une probabilité pour chaque réponse autorisée, plutôt que de générer du texte libre. Il prend des choix bornés et programmatiques au sein d’un workflow d’agent.

De combien Clef est-il plus rapide que Jev ?

Sur 43 exécutions de benchmarks, la latence médiane de Clef était de 209,3 ms contre 524,1 ms pour Jev — 2,5x plus rapide. Clef-flash atteint 38,8 ms en médiane, soit 13x plus rapide (Source : Cloudflare Changelog — Introducing Clef).

Clef remplace-t-il les LLM ?

Non, Cloudflare le positionne comme un complément. Clef gère les décisions rapides dans le chemin de la requête ; un LLM sur Workers AI exécute ensuite l’action, les deux sont donc enchaînés plutôt qu’échangés (Source : Cloudflare Changelog — Introducing Clef).

Puis-je basculer une intégration Jev existante vers Clef ?

Oui. Clef suit l’API System One, donc basculer revient à changer l’endpoint et le nom du modèle (Source : Cloudflare Changelog — Introducing Clef).

Pour aller plus loin

— The Agent Report