Se rendre au contenu

Preuves

Les cas approfondis

La banque de cas dit ce qui est établi. Ces fiches disent comment on l'a établi, ce qui manque encore, et ce qu'un lecteur doit faire différemment. Huit questions, toujours les mêmes, dont une que peu de référentiels acceptent de poser : ce qui invaliderait cette lecture.

Un tableau de cas enseigne mal. « Foxconn — 60 000 postes — à consolider » apprend à se méfier de cette ligne ; il n'apprend pas à reconnaître la suivante. Une fiche approfondie fait l'inverse : elle suit un cas depuis sa source jusqu'à l'usage qu'on en fait, et elle nomme l'endroit exact où l'affirmation a cédé.

Les huit questions

Le gabarit, identique pour toutes les fiches

1

Le contexte

Qui, quand, quel système. Sans date ni périmètre, un cas n'est pas un cas.

2

La décision, et qui l'a prise

La Directive de fait, explicite ou non.

3

Ce que le système a réellement fait

Les effets, pas les intentions.

4

L'état de la preuve

Deux colonnes séparées : ce que la source établit, ce qu'elle n'établit pas.

5

Ce que le cas dit du référentiel

Quel principe, quel domaine, quel seuil, quel risque.

6

La consigne

Ce qu'un lecteur fait autrement lundi matin.

7

Ce qui invaliderait cette lecture

Le fait qui obligerait à réécrire la fiche.


Les fiches publiées

Sept cas de la vague 2026, deux cas historiques repris en profondeur

Les sept premières portent sur la génération de modèles agentiques mise sur le marché en septembre 2026 et sur ce qu'elle change pour la vérification — dont une qui ne doit rien à un éditeur, puisqu'elle vient du rapport annuel de Stanford. Les deux dernières reprennent deux cas industriels que la banque classait déjà « à consolider », pour montrer comment un chiffre se déforme — c'est le même mécanisme, à vingt ans d'écart.

FicheCe qu'elle établitStatut de preuve
Quand la chaîne de pensée cesse d'être une preuveL'éditeur reconnaît que son modèle contrôle mieux son propre raisonnement et peut sous-performer stratégiquement. Ce que cela change pour la vérification.Annoncé/projeté
Le même modèle, deux mesures, deux conclusions opposées99,9 % contre 17,8 % annoncés par l'éditeur ; à égalité avec son concurrent sur l'index mesuré d'un tiers. La divergence, elle, est établie.Confirmé opérationnel
Le modèle plus rapide qui régresse là où le travail se paieEnviron 45 points Elo perdus sur le test le plus proche du travail rémunéré, pour 24 tours par tâche au lieu de 45 et 60.Confirmé opérationnel
Quand le fournisseur déclare lui-même franchir un seuilNiveau « Critical » de capacité en cybersécurité, déclaré par l'éditeur, sans validation externe ni restriction de déploiement.Annoncé/projeté
Le contrôle ralentit le travail légitime, et l'éditeur l'écrit« Ralentir, suspendre ou arrêter du travail légitime », cybersécurité défensive comprise : l'arbitrage central de la gouvernance, énoncé par le vendeur.Annoncé/projeté
Douze entreprises, des chiffres précis, une seule voix+17 %, « plus de 10 % », +20 % : des mesures réelles, publiées par une seule partie, sans un seul résultat défavorable.Annoncé/projeté
À quatre points de l'humain, et un échec sur troisSix bancs d'essai agrégés par une source académique : les agents frôlent la performance humaine et ratent une tâche sur trois. Les deux à la fois.Confirmé opérationnel
Un smartphone par seconde : anatomie d'un chiffre déplacéLe chiffre est réel, la source est institutionnelle, et il décrit un autre site, une autre année.À consolider
Le cas fantôme : dix ans de citations, une seule source60 000 postes, une source unique de 2016, jamais confirmée par l'entreprise, et une expression ajoutée en chemin.À consolider
Cent soixante-dix fois plus de conversations, un tiers toujours escaladéVolume ×170, escalade stable à 32 % : la part humaine ne fond pas avec l'échelle. Télémétrie de l'éditeur, cohorte survivante, sans audit.À consolider
Six relecteurs spécialisés, et une revue sur trois sans humainSlash sépare l'agent qui écrit du code des six sous-agents qui le relisent. Une revue sur trois fusionnée sans commentaire humain, annoncé par l'entreprise.Confirmé opérationnel
Sept heures d'autonomie, une référence pour vérifier : la Directive bien écriteSept heures d'autonomie jugées contre une méthode de référence : une Directive bien formée. Démonstration sur base open source, pas production.Annoncé/projeté
Chez l'éditeur lui-même, la délégation complète reste l'exceptionUsage déclaré de 28 % à 59 % du travail en un an, mais plus de la moitié ne délèguent entièrement que 0 à 20 %. L'éditeur mesure son propre usage.Confirmé opérationnel
Cent robots en entrepôt réel : l'échelle physique supprime un transfertPlus de 100 robots grimpeurs en exploitation à Dongguan, productivité de stockage-retrait doublée selon l'entreprise. Base de comparaison non publiée.Confirmé opérationnel
542 000 robots en 2024 : une statistique d'équipement, pas d'autonomieLa statistique mondiale de l'IFR établit l'équipement robotique, Chine en tête ; elle ne dit rien de l'autonomie ni de la gouvernance des usines.Confirmé opérationnel
Apollo Go : une Directive sans chauffeur, mesurée par son seul exploitantApollo Go opère à grande échelle sans conducteur à bord ; les volumes sont publiés par Baidu seul, non audités, et ne figurent plus au T2 2026.Confirmé opérationnel
Delta Concierge : une autonomie accordée par paliers, sans mesure publiéeDelta a ouvert son assistant IA à tous les membres SkyMiles par paliers, du renseignement à l'annulation ; aucun chiffre d'usage ni d'escalade n'est publié.Confirmé opérationnel
ServiceNow : une croissance confirmée, une part de l'IA qui reste à prouverLes résultats T2 2026 de ServiceNow confirment la croissance ; le 10-Q l'attribue aux achats des clients, pas à l'IA, qui pèse « plus d'1 Md$ » d'ACV.Confirmé opérationnel
Palantir : une croissance record que ses propres dépôts n'attribuent pas à AIPLa croissance de Palantir au T1 2026 est confirmée par la SEC ; ni le communiqué ni le 10-Q ne l'attribuent à la plateforme d'IA AIP.Confirmé opérationnel
Mine de Yimin : 100 camions autonomes en service, aucun bilan d'exploitation100 camions miniers autonomes mis en service à Yimin (Chine) en 2025 : le déploiement est attesté, ses résultats restent des projections de l'exploitant.Annoncé/projeté
Walgreens : robots à 40 % des ordonnances, temps pharmacien non mesuré12 centres robotisés, plus de 5 000 pharmacies desservies, environ 40 % du volume d'une officine : Walgreens chiffre l'automatisation, pas le temps rendu aux patients.Confirmé opérationnel
Lemonade : la prime double, l'effectif baisse — une métrique rapportée au volumeLemonade publie une productivité rapportée au volume : prime plus que doublée, effectif −6 % depuis fin 2022, coût de gestion des sinistres à 5 % des primes.Confirmé opérationnel
BMW et Figure 02 : des volumes prouvés, des objectifs de qualité jamais publiésFigure 02 chez BMW Spartanburg : 90 000 pièces, 30 000 X3, 1 250 heures confirmés par les deux parties ; les résultats sur les objectifs de qualité ne sont pas publiés.Confirmé opérationnel
Unilever : « 2 fois plus vite, 50 % moins cher », un seul marché chiffréUnilever annonce des visuels produits 2 fois plus rapides et 50 % moins chers par jumeaux numériques ; seul TRESemmé Thaïlande donne un périmètre de mesure précis.À consolider
Alibaba : des volumes d'IA énormes, des gains sans dénominateur200 millions d'images par mois, +12 % de ROI marketing, 20 millions de yuans économisés par jour : des chiffres annoncés par Alibaba, sans base de calcul publiée.Confirmé opérationnel
Xcel Energy : l'IA détecte les fumées, un humain confirme avant l'alerteNeuf caméras IA au Wisconsin, vérification humaine avant toute alerte, un incendie contenu à 3,12 acres le jour même : un pipeline où l'humain reste un point de passage obligé.Confirmé opérationnel
Union Pacific : un pilote automatique enclenché par l'humain, bordé par un tiersEMS pilote la traction de 3 500+ locomotives, 18 millions de gallons économisés en 2023 selon Union Pacific, sous la surveillance d'un système de sécurité séparé.Confirmé opérationnel
Chine : l'État écrit trois niveaux de décision pour les agents IALe texte chinois du 8 mai 2026 sur les agents IA distingue trois modes de décision et garantit à l'utilisateur la décision finale. Orientation publiée, application non mesurée.Annoncé/projeté
Chine : deux familles de normes, projets et agents IA, sans pontLa Chine normalise activement la gestion de projet (normes de 2026) et les agents IA (10 documents en 2026), mais aucun titre ne traite de projets confiés à des agents.Confirmé opérationnel

Pourquoi si peu de cas confirmés

Sur les 29 fiches, 18 portent le statut « confirmé opérationnel », et ce statut porte sur le constat central de la fiche, pas sur chacun des chiffres cités. Ce n'est pas une prudence de façade : c'est la conséquence mécanique de la règle de preuve. Un chiffre publié par celui qui en tire un bénéfice reste « annoncé », quel que soit le prestige de la source.

La matière publiquement disponible sur l'IA en production est, pour l'essentiel, de cette nature. Un référentiel peut soit l'ignorer et n'avoir presque rien à dire, soit la publier avec son statut réel. AIPM fait le second choix, et l'assume : la règle est publiée, elle est mécanique, et n'importe qui peut la rejouer sur les mêmes sources pour vérifier qu'elle donne les mêmes statuts.

Questions fréquentes

Parce qu'ils circulent de toute façon. Un cas célèbre et faible que personne ne contredit fait plus de dégâts qu'un cas célèbre et faible publié avec l'analyse de sa faiblesse. Le supprimer de la banque ne le supprime pas du monde.

Chacune nomme le fait qui la rendrait caduque. Quand ce fait survient, la fiche est réécrite et le changement apparaît au journal des versions. C'est la seule promesse tenable pour un référentiel tenu par une personne.

Parce que sa mise sur le marché, en septembre 2026, a produit en une semaine trois publications de l'éditeur et une mesure indépendante sur le même objet. C'est une configuration rare, et c'est précisément ce qui permet de comparer les récits — ce qu'aucun cas isolé ne permet.

Oui. Un cas est recevable s'il porte une source primaire consultable et une date. Sans ces deux éléments, il ne peut recevoir aucun statut, et un cas sans statut n'entre pas dans la banque.

La règle qui attribue ces statuts est publique

Elle tient en une page, elle est mécanique, et elle a été écrite pour que quelqu'un d'autre puisse la rejouer sur les mêmes sources et obtenir les mêmes résultats. C'est la seule garantie qu'un référentiel sans institution peut offrir.

Ce site est gratuit : il est sponsorisé par la publicité et par des liens partenaires, qui couvrent ses frais d'hébergement et de fonctionnement. Certains liens sont des liens partenaires : si vous achetez après les avoir suivis, nous percevons une commission, sans surcoût pour vous. En tant que Partenaire Amazon, nous réalisons un bénéfice sur les achats remplissant les conditions requises. Nos partenaires