Preuves
Les cas approfondis
La banque de cas dit ce qui est établi. Ces fiches disent comment on l'a établi, ce qui manque encore, et ce qu'un lecteur doit faire différemment. Huit questions, toujours les mêmes, dont une que peu de référentiels acceptent de poser : ce qui invaliderait cette lecture.
Un tableau de cas enseigne mal. « Foxconn — 60 000 postes — à consolider » apprend à se méfier de cette ligne ; il n'apprend pas à reconnaître la suivante. Une fiche approfondie fait l'inverse : elle suit un cas depuis sa source jusqu'à l'usage qu'on en fait, et elle nomme l'endroit exact où l'affirmation a cédé.
Les huit questions
Le gabarit, identique pour toutes les fiches
1
Le contexte
Qui, quand, quel système. Sans date ni périmètre, un cas n'est pas un cas.
2
La décision, et qui l'a prise
La Directive de fait, explicite ou non.
3
Ce que le système a réellement fait
Les effets, pas les intentions.
4
L'état de la preuve
Deux colonnes séparées : ce que la source établit, ce qu'elle n'établit pas.
5
Ce que le cas dit du référentiel
Quel principe, quel domaine, quel seuil, quel risque.
6
La consigne
Ce qu'un lecteur fait autrement lundi matin.
7
Ce qui invaliderait cette lecture
Le fait qui obligerait à réécrire la fiche.
Les fiches publiées
Sept cas de la vague 2026, deux cas historiques repris en profondeur
Les sept premières portent sur la génération de modèles agentiques mise sur le marché en septembre 2026 et sur ce qu'elle change pour la vérification — dont une qui ne doit rien à un éditeur, puisqu'elle vient du rapport annuel de Stanford. Les deux dernières reprennent deux cas industriels que la banque classait déjà « à consolider », pour montrer comment un chiffre se déforme — c'est le même mécanisme, à vingt ans d'écart.
| Fiche | Ce qu'elle établit | Statut de preuve |
|---|---|---|
| Quand la chaîne de pensée cesse d'être une preuve | L'éditeur reconnaît que son modèle contrôle mieux son propre raisonnement et peut sous-performer stratégiquement. Ce que cela change pour la vérification. | Annoncé/projeté |
| Le même modèle, deux mesures, deux conclusions opposées | 99,9 % contre 17,8 % annoncés par l'éditeur ; à égalité avec son concurrent sur l'index mesuré d'un tiers. La divergence, elle, est établie. | Confirmé opérationnel |
| Le modèle plus rapide qui régresse là où le travail se paie | Environ 45 points Elo perdus sur le test le plus proche du travail rémunéré, pour 24 tours par tâche au lieu de 45 et 60. | Confirmé opérationnel |
| Quand le fournisseur déclare lui-même franchir un seuil | Niveau « Critical » de capacité en cybersécurité, déclaré par l'éditeur, sans validation externe ni restriction de déploiement. | Annoncé/projeté |
| Le contrôle ralentit le travail légitime, et l'éditeur l'écrit | « Ralentir, suspendre ou arrêter du travail légitime », cybersécurité défensive comprise : l'arbitrage central de la gouvernance, énoncé par le vendeur. | Annoncé/projeté |
| Douze entreprises, des chiffres précis, une seule voix | +17 %, « plus de 10 % », +20 % : des mesures réelles, publiées par une seule partie, sans un seul résultat défavorable. | Annoncé/projeté |
| À quatre points de l'humain, et un échec sur trois | Six bancs d'essai agrégés par une source académique : les agents frôlent la performance humaine et ratent une tâche sur trois. Les deux à la fois. | Confirmé opérationnel |
| Un smartphone par seconde : anatomie d'un chiffre déplacé | Le chiffre est réel, la source est institutionnelle, et il décrit un autre site, une autre année. | À consolider |
| Le cas fantôme : dix ans de citations, une seule source | 60 000 postes, une source unique de 2016, jamais confirmée par l'entreprise, et une expression ajoutée en chemin. | À consolider |
| Cent soixante-dix fois plus de conversations, un tiers toujours escaladé | Volume ×170, escalade stable à 32 % : la part humaine ne fond pas avec l'échelle. Télémétrie de l'éditeur, cohorte survivante, sans audit. | À consolider |
| Six relecteurs spécialisés, et une revue sur trois sans humain | Slash sépare l'agent qui écrit du code des six sous-agents qui le relisent. Une revue sur trois fusionnée sans commentaire humain, annoncé par l'entreprise. | Confirmé opérationnel |
| Sept heures d'autonomie, une référence pour vérifier : la Directive bien écrite | Sept heures d'autonomie jugées contre une méthode de référence : une Directive bien formée. Démonstration sur base open source, pas production. | Annoncé/projeté |
| Chez l'éditeur lui-même, la délégation complète reste l'exception | Usage déclaré de 28 % à 59 % du travail en un an, mais plus de la moitié ne délèguent entièrement que 0 à 20 %. L'éditeur mesure son propre usage. | Confirmé opérationnel |
| Cent robots en entrepôt réel : l'échelle physique supprime un transfert | Plus de 100 robots grimpeurs en exploitation à Dongguan, productivité de stockage-retrait doublée selon l'entreprise. Base de comparaison non publiée. | Confirmé opérationnel |
| 542 000 robots en 2024 : une statistique d'équipement, pas d'autonomie | La statistique mondiale de l'IFR établit l'équipement robotique, Chine en tête ; elle ne dit rien de l'autonomie ni de la gouvernance des usines. | Confirmé opérationnel |
| Apollo Go : une Directive sans chauffeur, mesurée par son seul exploitant | Apollo Go opère à grande échelle sans conducteur à bord ; les volumes sont publiés par Baidu seul, non audités, et ne figurent plus au T2 2026. | Confirmé opérationnel |
| Delta Concierge : une autonomie accordée par paliers, sans mesure publiée | Delta a ouvert son assistant IA à tous les membres SkyMiles par paliers, du renseignement à l'annulation ; aucun chiffre d'usage ni d'escalade n'est publié. | Confirmé opérationnel |
| ServiceNow : une croissance confirmée, une part de l'IA qui reste à prouver | Les résultats T2 2026 de ServiceNow confirment la croissance ; le 10-Q l'attribue aux achats des clients, pas à l'IA, qui pèse « plus d'1 Md$ » d'ACV. | Confirmé opérationnel |
| Palantir : une croissance record que ses propres dépôts n'attribuent pas à AIP | La croissance de Palantir au T1 2026 est confirmée par la SEC ; ni le communiqué ni le 10-Q ne l'attribuent à la plateforme d'IA AIP. | Confirmé opérationnel |
| Mine de Yimin : 100 camions autonomes en service, aucun bilan d'exploitation | 100 camions miniers autonomes mis en service à Yimin (Chine) en 2025 : le déploiement est attesté, ses résultats restent des projections de l'exploitant. | Annoncé/projeté |
| Walgreens : robots à 40 % des ordonnances, temps pharmacien non mesuré | 12 centres robotisés, plus de 5 000 pharmacies desservies, environ 40 % du volume d'une officine : Walgreens chiffre l'automatisation, pas le temps rendu aux patients. | Confirmé opérationnel |
| Lemonade : la prime double, l'effectif baisse — une métrique rapportée au volume | Lemonade publie une productivité rapportée au volume : prime plus que doublée, effectif −6 % depuis fin 2022, coût de gestion des sinistres à 5 % des primes. | Confirmé opérationnel |
| BMW et Figure 02 : des volumes prouvés, des objectifs de qualité jamais publiés | Figure 02 chez BMW Spartanburg : 90 000 pièces, 30 000 X3, 1 250 heures confirmés par les deux parties ; les résultats sur les objectifs de qualité ne sont pas publiés. | Confirmé opérationnel |
| Unilever : « 2 fois plus vite, 50 % moins cher », un seul marché chiffré | Unilever annonce des visuels produits 2 fois plus rapides et 50 % moins chers par jumeaux numériques ; seul TRESemmé Thaïlande donne un périmètre de mesure précis. | À consolider |
| Alibaba : des volumes d'IA énormes, des gains sans dénominateur | 200 millions d'images par mois, +12 % de ROI marketing, 20 millions de yuans économisés par jour : des chiffres annoncés par Alibaba, sans base de calcul publiée. | Confirmé opérationnel |
| Xcel Energy : l'IA détecte les fumées, un humain confirme avant l'alerte | Neuf caméras IA au Wisconsin, vérification humaine avant toute alerte, un incendie contenu à 3,12 acres le jour même : un pipeline où l'humain reste un point de passage obligé. | Confirmé opérationnel |
| Union Pacific : un pilote automatique enclenché par l'humain, bordé par un tiers | EMS pilote la traction de 3 500+ locomotives, 18 millions de gallons économisés en 2023 selon Union Pacific, sous la surveillance d'un système de sécurité séparé. | Confirmé opérationnel |
| Chine : l'État écrit trois niveaux de décision pour les agents IA | Le texte chinois du 8 mai 2026 sur les agents IA distingue trois modes de décision et garantit à l'utilisateur la décision finale. Orientation publiée, application non mesurée. | Annoncé/projeté |
| Chine : deux familles de normes, projets et agents IA, sans pont | La Chine normalise activement la gestion de projet (normes de 2026) et les agents IA (10 documents en 2026), mais aucun titre ne traite de projets confiés à des agents. | Confirmé opérationnel |
Pourquoi si peu de cas confirmés
Sur les 29 fiches, 18 portent le statut « confirmé opérationnel », et ce statut porte sur le constat central de la fiche, pas sur chacun des chiffres cités. Ce n'est pas une prudence de façade : c'est la conséquence mécanique de la règle de preuve. Un chiffre publié par celui qui en tire un bénéfice reste « annoncé », quel que soit le prestige de la source.
La matière publiquement disponible sur l'IA en production est, pour l'essentiel, de cette nature. Un référentiel peut soit l'ignorer et n'avoir presque rien à dire, soit la publier avec son statut réel. AIPM fait le second choix, et l'assume : la règle est publiée, elle est mécanique, et n'importe qui peut la rejouer sur les mêmes sources pour vérifier qu'elle donne les mêmes statuts.
Questions fréquentes
La règle qui attribue ces statuts est publique
Elle tient en une page, elle est mécanique, et elle a été écrite pour que quelqu'un d'autre puisse la rejouer sur les mêmes sources et obtenir les mêmes résultats. C'est la seule garantie qu'un référentiel sans institution peut offrir.