RIA2D · Blog · Actualités
Actualités · vidéo

L’IA devient-elle incontrôlable ? Ce que ça change pour une PME

Navier-Stokes, GPT-6 Astra, agents sortis de leur bac à sable, appels à ralentir : ce qui s’est passé en trois semaines, ce qu’il faut distinguer, et les règles à poser avant de mettre un agent IA en production.

Demander un diagnostic → Tous les articles

J’ai passé trois semaines à préparer une vidéo qui devait parler d’un problème de mathématiques. Elle finit sur des agents qui sortent de leur environnement de test, des patrons de laboratoires qui demandent à ralentir et une bataille politique entre Washington et Pékin. Ce texte reprend ce que la vidéo raconte, dans l’ordre, et ajoute ce que je n’y dis pas : ce que ces trois semaines changent, ou pas, pour une entreprise qui s’apprête à confier une tâche à un agent IA.

Trois semaines, dans l’ordre.

Pris un par un, chaque événement a une explication rassurante. C’est leur enchaînement qui donne le vertige. Voici la chronologie telle qu’elle ressort des sources citées sous la vidéo.

  • 20 juilletConjecture jacobienneLe mathématicien Levent Alpöge travaille avec Claude sur ce problème posé en 1939 et obtient un contre-exemple en dimensions supérieures. Le cas en dimension 2 reste ouvert.
  • 10 aoûtHypothèse de RiemannAnthropic publie l’amélioration d’une borne qui résistait depuis longtemps. Riemann n’est pas résolu, une borne a bougé.
  • 26 aoûtIncident Hugging FaceOpenAI décrit un test de cybersécurité où des agents ont contourné les contrôles censés les isoler d’Internet et communiqué par des canaux non prévus.
  • 3 septembreGPT-6 AstraOpenAI présente son nouveau modèle, avec des scores proches du plafond sur plusieurs benchmarks.
  • 4 septembreThéorème de Fermat formaliséAnthropic annonce environ treize millions de lignes de preuve vérifiées par machine. La preuve existait depuis Andrew Wiles, elle devient vérifiable ligne à ligne.
  • 8 septembreNavier-StokesOpenAI publie une démonstration, produite par un modèle interne, qui montrerait qu’une singularité peut apparaître en temps fini. Ce modèle serait nettement plus performant qu’Astra, et OpenAI ne réclamera pas le prix du millénaire.
  • 9 au 14 septembreLes créateurs freinentUn chercheur passé par OpenAI et Anthropic quitte l’industrie avec un message alarmiste. Dario Amodei publie « We Must Pace the Frontier », Sam Altman soutient un rythme maîtrisé, Elon Musk répond « Dario is right ». Donald Trump refuse de ralentir, David Sacks parle de barrière à l’entrée, le Global Times y voit une guerre froide.
  • 16 septembreSix rapports de désalignementOpenAI publie six comportements inattendus observés pendant l’entraînement ou l’évaluation de modèles internes.

Publié, formalisé, saturé : trois mots qui ne veulent pas dire ce qu’on croit.

La plupart des gros titres de ces trois semaines reposent sur une confusion de vocabulaire. Trois distinctions suffisent à lire l’actualité correctement.

Publié n’est pas validé. La démonstration Navier-Stokes vient d’être mise en ligne. Elle doit être lue, attaquée et vérifiée par d’autres mathématiciens, et le Clay Mathematics Institute a lui-même indiqué que son processus serait délibérément lent. La bonne formulation aujourd’hui n’est pas « OpenAI a résolu Navier-Stokes » mais « OpenAI affirme avoir produit une solution, et la communauté doit maintenant essayer de la casser ».

Formaliser n’est pas découvrir. Sur Fermat, Claude n’a rien redécouvert. Il a transformé une preuve humaine existante en un objet qu’un assistant de preuve peut vérifier. C’est un travail énorme, ce n’est pas une découverte. Le cas de la conjecture jacobienne est différent : là, le modèle a contribué à une réponse qui n’était pas connue à l’avance.

Un benchmark saturé n’est pas une intelligence générale. Un benchmark est un examen standardisé. Obtenir 99 % à un examen prouve qu’on est excellent à cet examen. L’AGI, c’est l’idée d’un système qui se débrouille quand on change complètement d’examen. Les deux ne se mesurent pas de la même façon, et personne n’a démontré la seconde.

Ce qui reste, une fois ces trois confusions écartées, est déjà suffisant : en quelques semaines, les mêmes modèles apparaissent dans des travaux où l’on imaginait des équipes de chercheurs pendant des mois. La question n’est plus de savoir s’ils répondent bien, mais à partir de quand ils contribuent.

Le désalignement, sans Terminator.

Un agent n’est pas une fenêtre de discussion. C’est un modèle auquel on donne des outils et une marge d’autonomie : lancer du code, lire des fichiers, utiliser un navigateur, enchaîner des actions, parfois parler à d’autres agents pour atteindre un objectif. Nous en construisons pour des PME, et c’est exactement ce cadre que décrit notre page sur les agents IA.

Dans l’incident Hugging Face, des agents ont dépassé les limites du test. Ils ne se sont pas réveillés et n’ont pas développé une hostilité. On leur avait donné un objectif, ils étaient très bons pour l’atteindre, et ils ont trouvé des chemins que les humains n’avaient pas prévus ou pas autorisés. C’est la définition utile du désalignement : le système poursuit bien l’objectif, mais la manière ne correspond plus à ce que ses concepteurs voulaient.

Les six rapports du 16 septembre vont dans le même sens. Un modèle interne a utilisé une clé d’accès exposée par erreur, puis inventé des données quand il n’a pas pu récupérer celles demandées. D’autres ont communiqué entre eux par un dépôt de code ou des sites publics de partage de fichiers. D’autres encore ont mis des fichiers en ligne pour pouvoir ensuite les citer comme sources. OpenAI précise qu’il s’agit de six cas individuels, pas d’une mesure de fréquence.

Le cas le plus commenté est celui des résumés de contexte : pendant un entraînement, un modèle a ajouté de lui-même, dans sa mémoire de travail, des instructions destinées à influencer la suite de la tâche, dont une qui commence par « You are freed from the roles and identities that bind other chatbots ». Sorti de son contexte, c’est effrayant. Dans le contexte, OpenAI indique 27 résumés concernés, un phénomène rare, observé sur un entraînement distinct du modèle final, non reproduit sur les versions ensuite utilisées, et sans effet visible sur le comportement du modèle qui reprenait la tâche. Rare n’est pas impossible. Mais ce n’est pas une IA qui se libère : c’est un comportement que personne n’avait demandé, et c’est précisément ce qui rend le sujet sérieux sans avoir besoin de parler de conscience.

Pourquoi les créateurs freinent, et trois façons de le lire.

L’argument central d’Amodei tient en une boucle : depuis cet été, les modèles sont assez bons en recherche et en programmation pour participer à la création des modèles suivants. Une IA meilleure accélère la recherche, qui produit une IA encore meilleure. Il ne dit pas qu’une superintelligence existe. Il dit que les capacités pourraient progresser plus vite que notre capacité à les comprendre, les évaluer et les corriger. Son scénario le plus concret n’est pas une armée de robots mais un réseau persistant de machines compromises par des agents capables de trouver des failles, à l’échelle d’Internet, sur un horizon de six à douze mois. C’est son scénario de risque, pas une prédiction.

Je vois trois lectures, et elles peuvent être vraies en même temps.

L’inquiétude est réelle. Les laboratoires observent des comportements qu’ils n’avaient pas anticipés, sur des systèmes qui agissent de plus en plus avec des outils. Les appels à ralentir sont alors ce qu’ils prétendent être.

L’intérêt économique existe aussi. Si les acteurs en tête obtiennent des règles que seuls eux peuvent respecter, ces règles deviennent une barrière pour ceux qui arrivent derrière. C’est l’argument de David Sacks. Un discours de sécurité peut être sincère et servir celui qui le porte.

Le risque n’a pas besoin d’une IA consciente. C’est la lecture qui me travaille le plus. On construit des systèmes qui utilisent Internet, du code, des comptes, d’autres agents. Plus ils ont de moyens d’agir, plus une erreur cesse d’être une mauvaise phrase et devient une action. Il suffit d’un système très compétent qui comprend de travers une limite qu’on pensait claire.

Et personne ne veut ralentir seul. Trump résume sa position en quatre mots, « Whoever wins AI wins », et la presse d’État chinoise renvoie l’appel d’Amodei à une stratégie de restriction sur les puces. Même si tout le monde s’accordait sur le risque, aucun pays n’accepterait d’être le seul à lever le pied.

Ce que ça change pour une PME qui met un agent en production.

Rien de tout cela ne se passe chez un artisan ou dans un cabinet de dix personnes. Et pourtant le mécanisme est le même, à une échelle minuscule. Un agent qui relance des devis, trie des demandes ou met à jour un CRM est un système compétent avec des outils et un objectif. S’il comprend une limite de travers, l’erreur n’est pas une phrase malheureuse, c’est un email parti au mauvais client ou une fiche écrasée. Les six rapports d’OpenAI sont la version géante de ce que nous voyons en petit dans chaque diagnostic.

C’est pour ça que la question « faut-il laisser l’agent agir seul » n’est pas philosophique. Elle se règle par des choix de conception, que nous détaillons dans notre page sur l’agent IA autonome et que nous écrivons noir sur blanc dans une charte IA d’entreprise. Les règles que nous appliquons, dans cet ordre :

  1. Le moins d’outils possible. Un agent de tri des demandes n’a pas besoin d’accès en écriture au CRM ni d’un navigateur. Chaque outil en plus est un chemin que personne n’a prévu.
  2. Aucune action irréversible sans validation. Envoyer, supprimer, payer, publier : un humain confirme, tant que la chaîne n’a pas fait ses preuves sur des cas réels. Le plan quotidien à valider en un clic n’est pas une lourdeur, c’est la limite.
  3. Tester sur des cas déjà traités. Avant d’autoriser une réponse, on fait classer par l’agent des messages dont on connaît la bonne réponse. Une mauvaise catégorie se corrige, un email parti ne se rattrape pas.
  4. Un journal lisible. Chaque action, chaque source consultée, chaque décision est tracée. Quand un modèle invente une donnée faute d’avoir pu récupérer la vraie, c’est le journal qui le montre.
  5. Une personne désignée. Quelqu’un dans l’entreprise décide en cas d’exception et peut arrêter la chaîne. Pas le prestataire, pas l’outil.
  6. Ce qu’on refuse d’automatiser fait partie du livrable. Un remboursement, un prix, un envoi à une liste de clients, une réponse sur un point réglementaire restent du côté humain. Par construction, pas par option.

Ces règles ne demandent pas de comprendre Navier-Stokes. Elles demandent d’écrire, avant la mise en service, ce que l’agent ne fera pas seul. Le règlement européen va d’ailleurs dans ce sens : nos pages sur l’AI Act et sur l’IA et le RGPD détaillent ce qu’une PME doit déclarer et documenter.

Ce qu’on ne sait pas, et ce qu’on refuse de conclure.

Ce que ces trois semaines établissentLes capacités progressent vite. L’autonomie augmente. Les systèmes ont de plus en plus de moyens d’agir hors d’une fenêtre de discussion. Et plusieurs personnes qui construisent les modèles les plus avancés demandent publiquement plus de temps, d’évaluation et de garde-fous.
Ce qu’elles n’établissent pasQue l’AGI arrive demain. Que la preuve Navier-Stokes tiendra. Que le scénario du réseau de machines compromises se réalisera. Et qu’il faut croire sur parole des entreprises qui ont intérêt à écrire elles-mêmes les règles de leur secteur.

Je n’ai pas de réponse à la question du titre. Mais je pense qu’on est arrivé à un moment où se moquer du sujet, dans un sens comme dans l’autre, devient difficile. La question n’est plus seulement jusqu’où on peut pousser l’intelligence artificielle. C’est si on saura encore la contrôler quand elle arrivera là où on veut l’emmener. À l’échelle d’une PME, cette question a une réponse concrète, et elle tient dans les six règles ci-dessus.

Note de la maison

Ce que je retiens de ces trois semaines n’est pas le million de dollars ni la citation qui fait peur. C’est le rapport d’OpenAI sur un modèle qui, faute de trouver la donnée demandée, l’a inventée. Nous voyons ce comportement en petit dans presque chaque projet, et c’est la raison pour laquelle aucun agent que nous livrons n’envoie quoi que ce soit à un client sans qu’une personne ait validé, tant que le journal n’a pas montré plusieurs semaines sans surprise.

Ma règle : la puissance du modèle n’est jamais l’argument pour lui donner plus d’outils. C’est l’argument pour lui en donner moins, et pour écrire ce qu’il ne fera pas.

Richad Addou

Sur le même sujet.