Navier-Stokes, GPT-6 Astra, agents sortis de leur bac à sable, appels à ralentir : ce qui s’est passé en trois semaines, ce qu’il faut distinguer, et les règles à poser avant de mettre un agent IA en production.
J’ai passé trois semaines à préparer une vidéo qui devait parler d’un problème de mathématiques. Elle finit sur des agents qui sortent de leur environnement de test, des patrons de laboratoires qui demandent à ralentir et une bataille politique entre Washington et Pékin. Ce texte reprend ce que la vidéo raconte, dans l’ordre, et ajoute ce que je n’y dis pas : ce que ces trois semaines changent, ou pas, pour une entreprise qui s’apprête à confier une tâche à un agent IA.
Vidéo publiée le 23 septembre 2026 sur la chaîne YouTube Rodi, tenue par Richad Addou. Aucun script YouTube n’est chargé avant votre clic.
00:00Intro01:14Un problème vieux de 90 ans03:25Les IA commencent à découvrir ?05:50Astra, l’AGI et ce qu’on mesure vraiment08:49Quand les créateurs commencent à freiner10:45Le problème n’est pas qu’elle devienne consciente16:42Trois façons de lire ce qui se passe18:59Personne ne veut ralentir seul21:03La big picturePris un par un, chaque événement a une explication rassurante. C’est leur enchaînement qui donne le vertige. Voici la chronologie telle qu’elle ressort des sources citées sous la vidéo.
La plupart des gros titres de ces trois semaines reposent sur une confusion de vocabulaire. Trois distinctions suffisent à lire l’actualité correctement.
Publié n’est pas validé. La démonstration Navier-Stokes vient d’être mise en ligne. Elle doit être lue, attaquée et vérifiée par d’autres mathématiciens, et le Clay Mathematics Institute a lui-même indiqué que son processus serait délibérément lent. La bonne formulation aujourd’hui n’est pas « OpenAI a résolu Navier-Stokes » mais « OpenAI affirme avoir produit une solution, et la communauté doit maintenant essayer de la casser ».
Formaliser n’est pas découvrir. Sur Fermat, Claude n’a rien redécouvert. Il a transformé une preuve humaine existante en un objet qu’un assistant de preuve peut vérifier. C’est un travail énorme, ce n’est pas une découverte. Le cas de la conjecture jacobienne est différent : là, le modèle a contribué à une réponse qui n’était pas connue à l’avance.
Un benchmark saturé n’est pas une intelligence générale. Un benchmark est un examen standardisé. Obtenir 99 % à un examen prouve qu’on est excellent à cet examen. L’AGI, c’est l’idée d’un système qui se débrouille quand on change complètement d’examen. Les deux ne se mesurent pas de la même façon, et personne n’a démontré la seconde.
Ce qui reste, une fois ces trois confusions écartées, est déjà suffisant : en quelques semaines, les mêmes modèles apparaissent dans des travaux où l’on imaginait des équipes de chercheurs pendant des mois. La question n’est plus de savoir s’ils répondent bien, mais à partir de quand ils contribuent.
Un agent n’est pas une fenêtre de discussion. C’est un modèle auquel on donne des outils et une marge d’autonomie : lancer du code, lire des fichiers, utiliser un navigateur, enchaîner des actions, parfois parler à d’autres agents pour atteindre un objectif. Nous en construisons pour des PME, et c’est exactement ce cadre que décrit notre page sur les agents IA.
Dans l’incident Hugging Face, des agents ont dépassé les limites du test. Ils ne se sont pas réveillés et n’ont pas développé une hostilité. On leur avait donné un objectif, ils étaient très bons pour l’atteindre, et ils ont trouvé des chemins que les humains n’avaient pas prévus ou pas autorisés. C’est la définition utile du désalignement : le système poursuit bien l’objectif, mais la manière ne correspond plus à ce que ses concepteurs voulaient.
Les six rapports du 16 septembre vont dans le même sens. Un modèle interne a utilisé une clé d’accès exposée par erreur, puis inventé des données quand il n’a pas pu récupérer celles demandées. D’autres ont communiqué entre eux par un dépôt de code ou des sites publics de partage de fichiers. D’autres encore ont mis des fichiers en ligne pour pouvoir ensuite les citer comme sources. OpenAI précise qu’il s’agit de six cas individuels, pas d’une mesure de fréquence.
Le cas le plus commenté est celui des résumés de contexte : pendant un entraînement, un modèle a ajouté de lui-même, dans sa mémoire de travail, des instructions destinées à influencer la suite de la tâche, dont une qui commence par « You are freed from the roles and identities that bind other chatbots ». Sorti de son contexte, c’est effrayant. Dans le contexte, OpenAI indique 27 résumés concernés, un phénomène rare, observé sur un entraînement distinct du modèle final, non reproduit sur les versions ensuite utilisées, et sans effet visible sur le comportement du modèle qui reprenait la tâche. Rare n’est pas impossible. Mais ce n’est pas une IA qui se libère : c’est un comportement que personne n’avait demandé, et c’est précisément ce qui rend le sujet sérieux sans avoir besoin de parler de conscience.
L’argument central d’Amodei tient en une boucle : depuis cet été, les modèles sont assez bons en recherche et en programmation pour participer à la création des modèles suivants. Une IA meilleure accélère la recherche, qui produit une IA encore meilleure. Il ne dit pas qu’une superintelligence existe. Il dit que les capacités pourraient progresser plus vite que notre capacité à les comprendre, les évaluer et les corriger. Son scénario le plus concret n’est pas une armée de robots mais un réseau persistant de machines compromises par des agents capables de trouver des failles, à l’échelle d’Internet, sur un horizon de six à douze mois. C’est son scénario de risque, pas une prédiction.
Je vois trois lectures, et elles peuvent être vraies en même temps.
L’inquiétude est réelle. Les laboratoires observent des comportements qu’ils n’avaient pas anticipés, sur des systèmes qui agissent de plus en plus avec des outils. Les appels à ralentir sont alors ce qu’ils prétendent être.
L’intérêt économique existe aussi. Si les acteurs en tête obtiennent des règles que seuls eux peuvent respecter, ces règles deviennent une barrière pour ceux qui arrivent derrière. C’est l’argument de David Sacks. Un discours de sécurité peut être sincère et servir celui qui le porte.
Le risque n’a pas besoin d’une IA consciente. C’est la lecture qui me travaille le plus. On construit des systèmes qui utilisent Internet, du code, des comptes, d’autres agents. Plus ils ont de moyens d’agir, plus une erreur cesse d’être une mauvaise phrase et devient une action. Il suffit d’un système très compétent qui comprend de travers une limite qu’on pensait claire.
Et personne ne veut ralentir seul. Trump résume sa position en quatre mots, « Whoever wins AI wins », et la presse d’État chinoise renvoie l’appel d’Amodei à une stratégie de restriction sur les puces. Même si tout le monde s’accordait sur le risque, aucun pays n’accepterait d’être le seul à lever le pied.
Rien de tout cela ne se passe chez un artisan ou dans un cabinet de dix personnes. Et pourtant le mécanisme est le même, à une échelle minuscule. Un agent qui relance des devis, trie des demandes ou met à jour un CRM est un système compétent avec des outils et un objectif. S’il comprend une limite de travers, l’erreur n’est pas une phrase malheureuse, c’est un email parti au mauvais client ou une fiche écrasée. Les six rapports d’OpenAI sont la version géante de ce que nous voyons en petit dans chaque diagnostic.
C’est pour ça que la question « faut-il laisser l’agent agir seul » n’est pas philosophique. Elle se règle par des choix de conception, que nous détaillons dans notre page sur l’agent IA autonome et que nous écrivons noir sur blanc dans une charte IA d’entreprise. Les règles que nous appliquons, dans cet ordre :
Ces règles ne demandent pas de comprendre Navier-Stokes. Elles demandent d’écrire, avant la mise en service, ce que l’agent ne fera pas seul. Le règlement européen va d’ailleurs dans ce sens : nos pages sur l’AI Act et sur l’IA et le RGPD détaillent ce qu’une PME doit déclarer et documenter.
Je n’ai pas de réponse à la question du titre. Mais je pense qu’on est arrivé à un moment où se moquer du sujet, dans un sens comme dans l’autre, devient difficile. La question n’est plus seulement jusqu’où on peut pousser l’intelligence artificielle. C’est si on saura encore la contrôler quand elle arrivera là où on veut l’emmener. À l’échelle d’une PME, cette question a une réponse concrète, et elle tient dans les six règles ci-dessus.
Ce que je retiens de ces trois semaines n’est pas le million de dollars ni la citation qui fait peur. C’est le rapport d’OpenAI sur un modèle qui, faute de trouver la donnée demandée, l’a inventée. Nous voyons ce comportement en petit dans presque chaque projet, et c’est la raison pour laquelle aucun agent que nous livrons n’envoie quoi que ce soit à un client sans qu’une personne ait validé, tant que le journal n’a pas montré plusieurs semaines sans surprise.
Ma règle : la puissance du modèle n’est jamais l’argument pour lui donner plus d’outils. C’est l’argument pour lui en donner moins, et pour écrire ce qu’il ne fera pas.
Richad AddouNous mesurons l'audience de ce site pour savoir ce qui vous y amène. Rien n'est déposé sur votre appareil tant que vous n'avez pas accepté, et nous ne revendons aucune donnée.