Aller au contenu

GEO

Jev : le modèle d’IA qui décide au lieu d’écrire

Classer 40 000 adresses par intention de recherche coûte cher, parce qu’on demande à une IA d’écrire une réponse qu’il faut ensuite décortiquer. Jev, lancé le 15 septembre, renvoie directement la décision.

Vous avez 40 000 adresses à trier par intention de recherche, ou 3 000 textes à noter avant publication. Vous ouvrez un assistant d’IA, vous écrivez la consigne, et il répond par une phrase — qu’il faut ensuite relire, découper, ranger dans un tableur. Multiplié par 40 000, ce détour coûte des heures et une facture. Le 15 septembre 2026, une jeune société américaine a publié un modèle bâti pour l’éviter : il ne rédige rien, il renvoie directement la valeur. Voici ce qu’il fait, ce que ça coûte, et ce qui est mesuré à ce jour.

Ce que TypeSafe a annoncé le 15 septembre

TypeSafe AI est fondée par Diogo Almeida, ancien chercheur d’OpenAI, que l’entreprise présente comme co-inventeur de la méthode d’entraînement qui a donné ChatGPT. Le 15 septembre, elle a publié Jev — version jev-1.13 —, présenté comme le premier d’une famille qu’elle appelle System One Models :

« a new class of frontier models built to make fast, structured decisions that software can use directly »
— « une nouvelle classe de modèles de pointe conçus pour prendre des décisions rapides et structurées que le logiciel peut utiliser directement ».

La différence avec ChatGPT ou Claude tient en une phrase : ces derniers produisent du texte, Jev produit une valeur. Il accepte trois formes de questions, et rien d’autre. Choice choisit une option dans une liste, 255 au maximum. Score note sur une échelle dont vous définissez les niveaux. Noul renvoie la probabilité qu’une affirmation soit vraie. Choice et Score s’accompagnent de deux nombres qui font tout l’intérêt du modèle : la probabilité attribuée à chaque réponse possible, et un indice de confiance, qui dit à quel point le modèle hésite entre elles. Noul, lui, ne renvoie que sa probabilité.

Un modèle de langage rédige une phrase à décortiquer, Jev renvoie directement des valeurs typées À partir d’une même phrase d’un client, un modèle de langage produit un texte que le code doit ensuite analyser et valider, tandis que Jev renvoie trois valeurs accompagnées de leurs probabilités, directement utilisables. Ce qu’on envoie au modèle « Mes versements échouent depuis trois jours » Un modèle de langage ChatGPT, Claude, Gemini Jev modèle de décision 1. Il rédige une phrase, un mot après l’autre « Ce message paraît urgent. Il relève probablement de la facturation, et le client semble assez contrarié. » 1. Il répond à trois questions typées urgent 0,95 service facturation (0,87) irritation 1,04 sur 3 niveaux 2. Votre code doit l’analyser et la valider Repérer les mots utiles, deviner le niveau, recommencer si la réponse est mal formée. 2. Votre code s’en sert tel quel Les valeurs et leurs probabilités sont déjà dans la forme attendue par le programme. Risque : une réponse hors format Risque : une réponse bien formée mais fausse
Le même message client, traité par un modèle de langage et par Jev. Les valeurs de droite sont celles de l’exemple d’appel publié par Cloudflare, pas une mesure effectuée pour cet article.

Sur la phrase « mes versements échouent depuis trois jours », l’exemple publié par Cloudflare renvoie : urgence 0,95 ; service compétent « facturation », probabilité 0,87, confiance 0,80 ; irritation notée 1,04 sur trois niveaux. Aucune phrase à décortiquer : la réponse est déjà un objet que le code consomme.

Les chiffres annoncés par l’éditeur sont spectaculaires. Le temps de réponse va de 70 à 500 millisecondes, contre 3 à 329 secondes pour les modèles de pointe ; à intelligence comparable, l’éditeur en tire un gain « de 40 à 200 fois ». Les jetons d’entrée — les tokens, ces fragments de texte qu’un modèle facture à l’unité, l’entrée étant ce qu’on lui envoie et la sortie ce qu’il produit — coûtent 0,042 $ par million, et la sortie est gratuite : « too cheap to meter », trop bon marché pour être comptée. Quant au nom, l’éditeur dit l’avoir emprunté à l’économiste William Stanley Jevons, qui avait observé que le rendement des machines à vapeur avait fait augmenter la consommation de charbon.

Ce que ça change quand on doit trier des milliers de pages

Le SEO est plein de tâches qui sont des questions fermées posées un très grand nombre de fois : classer des adresses par intention de recherche, séparer les requêtes de marque des autres, noter une page sur une grille de qualité, repérer deux pages qui répondent à la même question, vérifier un texte produit par IA avant publication. Dans tous ces cas, on ne veut pas une rédaction : on veut une étiquette et un niveau de certitude.

Ce que ça coûte se calcule, aux tarifs affichés le 18 septembre :

Hypothèse ou tarif Facture
Le travail 40 000 pages, 500 jetons chacune (titre, adresse, extrait) = 20 millions de jetons en entrée ; 40 jetons de réponse par page
Jev 0,042 $ le million en entrée, sortie gratuite 0,84 $
GPT-5.6 Terra 2 $ le million en entrée, 12 $ en sortie 59,20 $
Rapport ≈ 70 fois

Calcul propre à partir des tarifs publiés par les deux éditeurs. Le rapport dépend entièrement des hypothèses de volume ci-dessus : une réponse plus longue le creuse, un texte source plus court le réduit.

Une réserve, et elle est sérieuse : rien de tout cela n’est nouveau en tant que fonction. Un classifieur — un petit modèle entraîné à ranger des textes dans des cases — fait déjà ce travail pour presque rien, et les grands fournisseurs proposent depuis longtemps des sorties contraintes, c’est-à-dire un format de réponse imposé au modèle à l’avance. Ce que Jev ajoute, c’est de le faire sans données d’entraînement, avec des probabilités, et à cette vitesse.

Ce qui est mesuré, et ce qui ne l’est pas

Deux tests publics sont parus dans les jours suivant l’annonce. Le plus chiffré est celui de l’éditeur d’agents Empryo, le 16 septembre, sur 102 pannes réelles de fournisseurs d’API qu’il fallait classer en « à réessayer » ou « définitive » : Jev répond juste 102 fois sur 102, en 273 millisecondes médianes et 0,00002 $ par vérification, contre 1 387 millisecondes et 0,00250 $ pour GPT-5.6 Terra, qui se trompe une fois de retentative. L’auteur intègre Jev dans son propre produit : ce n’est pas un laboratoire neutre.

Et c’est justement la partie négative de son relevé qui est la plus utile. Sur huit tâches essayées, il en a écarté trois après mesure, parce que du code ordinaire faisait mieux : classer des lignes de résultats de recherche textuelle avec Jev fait tomber la précision de 78,6 % à 74,1 %, et sur la validation d’une boucle de correction automatique, le modèle n’a suivi le jugement humain que dans 12 cas ambigus sur 20. Personne n’a en revanche publié de comparaison entre Jev et un classifieur entraîné sur les données du site : sur ce point précis, l’univers de preuve est vide.

Les gains affichés sur la page d’accueil de l’éditeur — 193,6 fois plus rapide, 444,6 fois moins cher — restent, eux, des évaluations maison, dont il décrit lui-même la méthode : la réponse de référence n’est pas une vérité établie mais la moyenne des réponses de deux modèles concurrents, ce qui, précise-t-il, « biaise les réponses vers les modèles d’OpenAI et d’Anthropic » — donc, en principe, à son propre désavantage. C’est une divulgation honnête, mais elle ne remplace pas une mesure indépendante.

L’argument le plus repris mérite le même examen. TypeSafe écrit que Jev « ne peut pas halluciner », c’est-à-dire inventer une information fausse avec aplomb. The Register a objecté le 16 septembre que la comparaison n’est pas loyale, puisque la sortie n’est pas du langage naturel, et que le modèle « retourne des réponses structurées assorties de probabilités, ce qui n’exclut pas la possibilité qu’elles soient fausses ». Un choix limité à 255 options ne peut pas en inventer une 256ᵉ ; il peut parfaitement désigner la mauvaise. L’éditeur publie d’ailleurs sa propre liste de faiblesses, revue le 17 septembre : neuf modes d’échec, dont l’arithmétique, la comparaison de dates, et le contenu hostile — le modèle n’est pas entraîné à traiter ce qu’on lui soumet comme potentiellement malveillant. Pour qui envisagerait de lui faire noter des textes ramassés sur le web, c’est à lire avant le reste.

Reste la disponibilité, et elle a bougé en trois jours. L’accès direct chez l’éditeur passe par une liste d’attente, et sa page de tarifs renvoie une erreur ; mais Cloudflare documente le modèle dans son catalogue avec un exemple d’appel complet, et depuis le 18 septembre la place de marché OpenRouter le propose publiquement, au tarif annoncé, avec une fenêtre de contexte — la quantité de texte qu’on peut lui envoyer en une fois — de 32 000 jetons.

Ce qui est établi, ce qui est déduit, ce qui reste inconnu

Documenté : les trois formes de questions, la limite de 255 options, les tarifs et temps de réponse annoncés, les neuf faiblesses reconnues, la mise à disposition chez Cloudflare et OpenRouter. Mesuré par un tiers : les latences et les coûts par appel du relevé Empryo, et les trois tâches où le code ordinaire l’emporte. Déduit : le rapport de coût d’environ 70, qui découle des tarifs affichés et d’hypothèses de volume explicitées. Inconnu : la performance face à un classifieur entraîné, et la tenue des tarifs dans le temps.

Affirmation Statut Référence
Jev renvoie des décisions typées, pas du texte Documenté Billet TypeSafe, 15/09/2026
Trois formes de questions — Choice, Score, Noul — dont un Choice plafonné à 255 options Documenté Documentation TypeSafe, page Choice
70 à 500 ms, 0,042 $ le million de jetons en entrée, sortie gratuite Documenté Billet TypeSafe, 15/09/2026
Disponible publiquement chez OpenRouter et au catalogue Cloudflare Documenté OpenRouter, 18/09/2026 ; Cloudflare
102 décisions justes sur 102, 273 ms médianes, 0,00002 $ par vérification Mesuré Empryo, 16/09/2026, éditeur non neutre
Trois tâches sur huit où du code ordinaire fait mieux que Jev Mesuré Empryo, 16/09/2026
193,6 fois plus rapide et 444,6 fois moins cher Imprécis Évaluation interne, référence = moyenne de deux modèles concurrents
« Ne peut pas halluciner » vaut pour le format, pas pour la justesse Déduit Objection de The Register, 16/09/2026
Environ 70 fois moins cher sur un tri de 40 000 pages Déduit Calcul à partir des tarifs affichés
Une comparaison publique entre Jev et un classifieur entraîné Non documenté Aucune trouvée au 18/09/2026

Documenté : une phrase copiable de la source. Mesuré : un relevé chiffré publié par un tiers, avec son dispositif. Déduit : conséquence logique de faits documentés, que personne n’écrit ainsi. Imprécis : le chiffre existe, mais sa méthode de mesure ne permet pas d’en tirer ce qu’on voudrait. Non documenté : personne ne le publie.

Questions fréquentes

Peut-on l’utiliser dès aujourd’hui pour un projet SEO ? Oui, par OpenRouter ou par Cloudflare, sans attendre la liste d’attente de l’éditeur. Mais avant de s’y engager, la comparaison honnête n’est pas « Jev contre ChatGPT » : c’est « Jev contre un classifieur entraîné sur vos propres données », moins cher encore sur une tâche fixe, et « Jev contre trois lignes de code », qui gagnent plus souvent qu’on ne le croit — le relevé d’Empryo le montre sur trois tâches sur huit.

Un résultat au bon format est-il un résultat juste ? Non, et c’est le point à retenir. La garantie porte sur la forme de la réponse, pas sur son exactitude. Une étiquette fausse reste une étiquette fausse, même livrée en 80 millisecondes avec une probabilité à deux décimales.

Sources

Relevé effectué le 18 septembre 2026. Le produit est en accès anticipé : ses tarifs et ses limites peuvent changer sans préavis.

À voir aussi

Grégory Florin

Expert SEO et auteur sur learnSEO.

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *