虎嗅

**RSI : Lorsque l’IA apprend à s’évoluer par elle-même, les plus forts deviendront-ils vraiment encore plus forts ?**

原文:RSI:当AI学会自我进化,强者真的会愈强吗?

Résumé des points clés

En 2026, la compétition technologique la plus féroce de Silicon Valley se concentrera sur l'RSI (Recursive Self-Improvement), qui consiste à faire en sorte que l'intelligence artificielle (IA) trouve ses propres problèmes et s'améliore elle-même, créant ainsi un cycle accéléré de « découverte → amélioration → renforcement → nouvelle découverte ». Des géants tels qu'OpenAI et Anthropic, ainsi que le monde universitaire, parient sur l'issue de cette compétition. Le débat principal porte sur la question de savoir si les grands acteurs domineront grâce à leur puissance de calcul ou si des nouveaux venus pourront réaliser une remontée inattendue. La sécurité et l'efficacité organisationnelle deviendront également des facteurs clés. Cette compétition concerne non seulement la structure du secteur de l'IA, mais soulève aussi la question fondamentale de savoir si les humains céderont le contrôle de leur évolution.

I. Qu'est-ce que l'RSI ? Pourquoi est-il soudainement devenu populaire en 2026 ?

L'essence de l'RSI réside dans un cercle vertueux où l'IA découvre ses propres faiblesses, les améliore, devient plus forte, et cette IA renforcée est capable de découvrir des problèmes encore plus complexes, ce qui entraîne une nouvelle amélioration... Ce cycle s'accélère constamment.

Son succès n'est pas fortuit : deux conditions sont réunies :

1. L'IA est désormais capable de « travailler » seule : elle peut écrire du code, mener des expériences et analyser les résultats.

2. L'IA comprend mieux ses propres limites, ce qui lui permet d'analyser ses faiblesses comme un chercheur.

Le facteur crucial est que le cycle de feedback a été raccourci à quelques minutes : il y a peu, les humains mettaient des jours voire des semaines pour passer d'une idée à un résultat (tuteur → étudiant → expérience → feedback). Aujourd'hui, l'IA peut accomplir tout cela en quelques minutes (idée → écriture du code → exécution de l'expérience → obtention des résultats), ce qui représente une évolution rapide, comparable au passage d'un vélo à pédales à un vélo électrique.

Tous les acteurs majeurs sont impliqués : OpenAI a fixé un calendrier pour recruter des stagiaires en recherche sur l'IA en 2026, Claude d'Anthropic a déjà mené 800 heures de recherches sur la sécurité de l'IA (à une efficacité quatre fois supérieure à celle des humains), et le congrès ICLR a consacré une session spéciale à l'RSI. Cela montre que l'RSI est passé d'une approche marginale à un consensus dans l'industrie.

II. Quelle est la différence entre l'RSI et AutoML il y a 10 ans ?

Beaucoup se demandent si AutoML, lancé par Google il y a 10 ans, n'était pas également une forme d'IA s'autopportant à l'amélioration. La différence est significative :

  • Auparavant, l'IA était « confinée » : les humains définissaient les limites de sa recherche (par exemple, la portée des recherches), et l'IA ne pouvait trouver que la solution optimale à l'intérieur de ces limites.
  • Aujourd'hui, les grands modèles d'IA comprennent leur propre architecture et leurs problèmes ; ils peuvent découvrir de nouvelles directions pour s'améliorer sans intervention humaine.

En somme, il y a un changement radical : auparavant, c'étaient les humains qui définissaient les détails, tandis que l'IA effectuait les tâches routinières ; aujourd'hui, l'IA aide les humains à trouver la bonne direction, ce qui modifie le niveau de participation.

III. Le débat principal : les géants domineront-ils ou les nouveaux venus ont-ils une chance ?

Cette question est très intéressante et divise les experts en deux camps :

  • Le camp du « plus on a, mieux on gagne » : selon eux, celui qui dispose de la plus grande puissance de calcul et des meilleures compétences en programmation lancera le premier le cycle de RSI, accélérant ainsi son développement de manière significative et laissant les autres loin derrière (comme OpenAI et Anthropic).
  • **Le camp du « progrès est imprévisible » : ils soutiennent que l'amélioration de l'IA ne suit pas une courbe linéaire, mais se déroule en étapes (accélération rapide → période de stagnation → nouveau progrès), et que les avancées révolutionnaires reposent sur de nouvelles découvertes scientifiques, pas seulement sur la puissance de calcul. Cela signifie qu'une petite équipe pourrait réussir une remontée inattendue si elle trouve d'abord ces nouvelles approches.

Les divergences au sein de l'industrie reflètent des différences de philosophie : certains croient en la loi de l'échelle (plus de puissance de calcul, plus de performance), tandis que d'autres pensent que les progrès découlent de révélations intuitives. Le cofondateur d'Anthropic a même fixé la fin de 2028 comme date limite pour prouver ou infirmer l'automatisation complète de l'RSI.

IV. Quel est l'état actuel du développement de l'RSI ? Qu'est-ce qui manque le plus ?

L'RSI en est encore à ses débuts :

  • Des progrès ont été réalisés dans des tâches nécessitant une évaluation et un feedback rapides (amélioration d'algorithmes, augmentation de l'efficacité) : par exemple, Claude d'Anthropic a écrit 80 % du code de l'entreprise, augmentant l'efficacité des ingénieurs de 8 fois par rapport à 2024 ; le modèle OpenRSI de Tsinghua atteint presque le niveau de GPT-5.6 avec moins de ressources.
  • Ce qui manque le plus, c'est la « sensibilité » de l'IA : la capacité des chercheurs humains à identifier des tendances à partir d'un petit nombre d'exemples et à abstraire des problèmes complexes. Les grands modèles fonctionnent bien avec de grandes quantités de données, mais les avancées scientifiques souvent requièrent des approches sans données, ce qui reste un point faible pour l'IA.

L'RSI n'est pas une question binaire (0 ou 100) ; il s'agit d'un processus en plusieurs étapes : la première étape consiste à améliorer l'efficacité (déjà réalisée), la seconde étape est de découvrir des règles plus profondes (en cours de développement), et l'objectif ultime est que l'IA puisse, comme Einstein, réaliser des percées avec un petit nombre d'exemples (ce qui reste loin).

V. Deux variables sous-estimées : la sécurité et l'organisation

  • La sécurité : il n'est pas certain que l'IA deviendra incontrôlable. Les non-experts s'inquiètent, mais les professionnels estiment que cela prendra encore du temps. Actuellement, entraîner l'IA ressemble à dresser un chien, avec des mécanismes de récompense et de punition pour la guider ; il est difficile pour l'IA d'acquérir une conscience autonome. Anthropic a même suggéré qu'une coordination mondiale pour ralentir son développement pourrait être bénéfique, mais le défi réside dans la surveillance (le processus d'entraînement est beaucoup plus complexe que celui d'un lance-missile).
  • L'organisation : les grandes entreprises ne sont pas nécessairement en meilleure position que les petites équipes. L'RSI nécessite un feedback rapide, mais les grandes structures ont de nombreux niveaux de gestion (tuteurs → étudiants → responsables), ce qui ralentit la transmission des informations et peut entraîner une stagnation. Les petites équipes, avec un nombre limité de membres (environ 150 personnes, selon le « nombre de Dunbar »), communiquent plus efficacement. Ainsi, la flexibilité organisationnelle pourrait être tout aussi importante que la puissance de calcul.

Conclusion : quelle vision du futur devrions-nous adopter ?

L'attrait de l'RSI réside dans le potentiel des plus forts à s'améliorer encore davantage, mais il existe également la possibilité que de nouvelles découvertes bouleversent le paysage actuel. L'incertitude est le caractère le plus fascinant de cette compétition : vous pouvez croire que les géants domineront ou que de petites équipes réussiront une remontée inattendue. Quoi qu'il en soit, l'RSI représente un chemin inévitable pour le développement de l'IA. Lorsque l'IA sera capable de s'améliorer elle-même, le contrôle de son évolution pourrait échapper aux humains. Cette question reste sans réponse, mais elle mérite notre attention attentive.