Se rendre au contenu

Cas approfondi

Le même modèle, deux mesures, deux conclusions opposées

Sur le tableau de son éditeur, GPT-6 Astra écrase la génération précédente : 99,9 % contre 17,8 % sur un test de raisonnement — chiffre annoncé, non rejoué. Sur l'index d'un tiers indépendant, mesuré et publié, il est à égalité avec son concurrent direct. Ce qui est confirmé ici, c'est la divergence des deux récits, pas les scores de l'éditeur. C'est la leçon.

Télécharger la fiche en PDF logo, sources et statut de preuve inclus

Le contexte

Qui, quand, quel système

En septembre 2026, OpenAI publie l'annonce de GPT-6 Astra — page consultée le 10 — avec un tableau comparatif contre GPT-5.6 Sol, la génération précédente de la même maison. Les écarts affichés sont spectaculaires : ARC-AGI-3 à 99,9 % contre 17,8 %, ExploitBench à 100 % contre 78,5 %, FrontierMath Tier 4 à 97,6 % contre 83,0 %.

Le 9 septembre 2026, Artificial Analysis — un évaluateur indépendant qui rejoue ses propres tests — publie ses mesures. Son Intelligence Index place Astra à 53. Son Coding Agent Index le place à 62. Dans les deux cas, à égalité avec Claude Fable 5.1.

La décision, et qui l'a prise

La Directive de fait

Personne n'a menti et rien n'est contradictoire. L'éditeur a choisi ses tests et son point de comparaison : lui-même, six mois plus tôt. Le tiers a choisi les siens et son point de comparaison : le marché, aujourd'hui. Les deux choix sont défendables, et ils produisent deux récits inconciliables du même objet.

La décision qui compte est celle du lecteur : sur quel chiffre engage-t-il un budget ? C'est très exactement la décision qu'AIPM cherche à outiller.

Ce que le système a réellement fait

Une convergence mérite d'être relevée, parce qu'elle est rare et qu'elle vaut davantage que les écarts. Sur Terminal-Bench 4.0, l'éditeur annonce 57,9 % ; le tiers mesure 59 %. Deux protocoles, deux équipes, un écart d'un point : ce chiffre-là est solide, et il est le seul du lot à pouvoir être qualifié de confirmé.

Sur le reste, les périmètres ne se recouvrent pas : les tests du tableau de l'éditeur ne sont pas ceux de l'index du tiers. Il n'y a donc ni confirmation, ni contradiction — il y a deux ensembles disjoints présentés au même public dans la même semaine.

L'état de la preuve

Ce que les sources établissent, et ce qu'elles n'établissent pas

Ce que la source établit

  • Terminal-Bench 4.0 est mesuré deux fois, indépendamment : 57,9 % annoncé, 59 % constaté
  • Les indices du tiers placent Astra à égalité avec son concurrent direct, pas devant
  • Les tests du tableau de l'éditeur ne sont pas repris par le tiers, et réciproquement
  • Le tiers publie son protocole et ses dates ; l'annonce publie ses scores

Ce que la source n'établit pas

  • Si les écarts annoncés sur ARC-AGI-3, ExploitBench et FrontierMath sont reproductibles : aucun tiers ne les a rejoués à cette date
  • Ce que ces tests prédisent du travail réellement payé en entreprise
  • Si l'égalité mesurée par le tiers tiendra à la prochaine mise à jour de son index

Ce que ce cas dit du référentiel

C'est le principe 7 — l'interdiction de l'autorité empruntée — appliqué à un chiffre plutôt qu'à une institution. Un score n'emprunte pas seulement l'autorité de celui qui le publie : il emprunte celle du test, et celle du point de comparaison choisi. Trois emprunts, trois endroits où l'affirmation peut céder.

Le cas fournit aussi la règle la plus simple de toute la méthode de preuve d'AIPM : un chiffre mesuré deux fois par deux parties qui ne partagent pas d'intérêt vaut mieux que dix chiffres mesurés une fois. Terminal-Bench à 57,9 et 59 est plus utile que ARC-AGI-3 à 99,9.

La consigne

Ce qu'un lecteur fait différemment après avoir lu cette fiche

Avant d'inscrire un chiffre de performance dans une note interne, posez trois questions dans cet ordre.

Qui a mesuré ? Si c'est le vendeur, le chiffre entre au statut « annoncé » et n'en sort que si quelqu'un d'autre le retrouve.

Contre quoi ? Un progrès contre soi-même n'est pas un avantage sur le marché. Exigez un point de comparaison externe, ou traitez le chiffre comme une communication.

Sur quoi ? Le test le plus proche du travail que vous payez l'emporte sur le test le plus impressionnant. Un score de raisonnement à 99,9 % ne dit rien de la capacité à finir un dossier.

Cette fiche suit le gabarit des cas approfondis d'AIPM : huit questions, toujours les mêmes. Voir les autres fiches.

Ce site est gratuit : il est sponsorisé par la publicité et par des liens partenaires, qui couvrent ses frais d'hébergement et de fonctionnement. Certains liens sont des liens partenaires : si vous achetez après les avoir suivis, nous percevons une commission, sans surcoût pour vous. En tant que Partenaire Amazon, nous réalisons un bénéfice sur les achats remplissant les conditions requises. Nos partenaires