Résumé des points clés
Le 6 août, deux événements majeurs dans le domaine de l'IA se sont chevauchés : le fondateur de Google DeepMind a démissionné de son poste de PDG en raison du retard de son modèle (Gemini) ; Zhang Yiming de ByteDance a pris la décision que les « grands modèles » ne seraient pas distillés. Cette décision a provoqué des divisions au sein de l'industrie : certains l'ont critiquée, affirmant qu'elle visait à se faire connaître à tout prix, tandis que d'autres l'ont saluée comme une mesure pour revenir aux fondamentaux. L'article explore la nature même du processus de distillation, les raisons profondes derrière la décision de ByteDance, les controverses au sein de l'industrie et les différentes approches adoptées par les entreprises chinoises en IA, soulignant que ByteDance a choisi une voie « coûteuse et difficile ». Cependant, cette diversité est précisément ce dont l'écosystème chinois de l'IA a besoin.
Analyse détaillée
1. Qu'est-ce que la distillation, et pourquoi tout le monde en parle-t-il ?
La distillation n'est pas un procédé chimique, mais une méthode d'entraînement des modèles d'IA, qui se divise en deux types :
- Distillation interne : utiliser son propre grand modèle pour entraîner de plus petits modèles (par exemple, utiliser GPT-4 pour entraîner GPT-3.5), ce qui est une pratique courante et non controversée dans l'industrie ;
- Distillation externe : utiliser les résultats d'autres modèles (comme les réponses de ChatGPT) pour entraîner son propre modèle, ce qui est au cœur des débats.
Pour illustrer : la distillation externe est comme un étudiant qui copie les devoirs d'un excellent élève pour améliorer rapidement ses résultats scolaires (son classement dans les rankings), mais il ne peut pas vraiment acquérir la capacité de résoudre les problèmes par lui-même. Pourquoi est-ce populaire ? Parce que cela est rapide et économise des ressources en calcul : par exemple, DeepSeek a utilisé 800 000 données issues du modèle R1 pour améliorer les performances d'un petit modèle (sur l'indice AIME24) au-delà de celles de l'OpenAI o1-preview, à un coût de calcul très bas.
Mais maintenant, des problèmes surviennent : les États-Unis commencent à utiliser la distillation comme prétexte à des sanctions ; la Maison Blanche a accusé Moonshot de « voler des technologies », et Anthropic a dénoncé plusieurs entreprises chinoises d'utiliser des comptes fictifs pour collecter des données, capable même de détecter les activités de distillation grâce aux adresses IP et aux modes d'accès.
2. Zhang Yiming refuse la distillation : est-ce par peur des sanctions ou par conviction personnelle ?
Beaucoup pensent que ByteDance craint que TikTok ne soit mis en cause par les États-Unis, mais l'article présente des contre-exemples : même les modèles open source chinois (comme Kimi K3) ne sont pas autorisés à être distillés, car leur licence est souple et sans risque, ce qui n'affecterait pas TikTok. Quelle en est donc la véritable raison ?
- Crainte de la contamination technique : l'année dernière, ByteDance a open-sourcé des modèles ne contenant pas de données synthétiques, de peur que cela ne pollue leurs recherches futures. C'est comme utiliser des tubes de laboratoire propres pour identifier précisément les problèmes ;
- Impact sur TikTok : bien que ce ne soit pas la raison principale, ByteDance possède la plus grande activité à l'étranger et ne veut pas se mettre en péril (rappelons le cas de Project Seed, dont le compte a été suspendu par OpenAI après avoir été soupçonné d'utiliser des données distillées) ;
- Conviction personnelle de Zhang Yiming : depuis sa démission, il s'est consacré à l'IA en écoutant les révisions de l'équipe Seed, en lisant des articles jusqu'à tard dans la nuit et en faisant appel à des professeurs singapouriens pour se perfectionner. Sa première décision après cette formation a été de privilégier le développement de compétences réelles, même si cela signifie un retard à court terme.
3. La distillation : une voie rapide ou une impasse ?
Les deux camps ont leurs arguments :
- Partisans de la distillation : elle est efficace et économise des ressources ; des recherches de l'Université Tsinghua montrent que les modèles distillés sont significativement plus performants que les modèles de base ; même Anthropic reconnaît que la distillation est une méthode d'entraînement légale ;
- Contrepartisans : elle pourrait limiter les potentialités des modèles ; une étude de l'Université d'Oxford a montré que l'apprentissage répété sur des données propres ou externes peut entraîner la perte d'informations (comme un message qui se déforme au fil des transmissions) ;
- Point de vue neutre : selon le chercheur en IA Lambert, la distillation est une forme d'imitation, tandis que l'apprentissage automatique est une exploration pour trouver ses propres solutions. La véritable puissance réside dans l'exploration, et ces compétences ne peuvent pas être obtenues à partir des API d'autres entreprises. Cependant, il reconnaît également que l'utilisation de données synthétiques (avec plusieurs sources et un mélange de données réelles) peut éviter ce phénomène.
4. Les entreprises chinoises en IA : plus que de la distillation, elles ont aussi des compétences réelles
L'article met en évidence trois exemples montrant que la distillation n'est qu'un outil parmi d'autres :
- Zhipu GLM-5.3 : sans distillation ni paramètres supplémentaires, il a amélioré ses performances grâce à l'apprentissage automatique et à une architecture de contexte étendue ; les développeurs affirment que les potentialités de ce modèle ne sont pas encore entièrement exploitées ;
- DeepSeek : en s'entraînant par des jeux d'échecs, il a développé des capacités de raisonnement indépendantes des données externes, et le directeur de recherche d'OpenAI a reconnu que leur approche découvrait les principes fondamentaux de l'algorithme o1 ;
- AliQianwen : bien qu'accusé de distillation, il sert de base pour de nombreux petits modèles à travers le monde, ce qui prouve sa solide infrastructure.
En conclusion, les débats sur la distillation reflètent souvent une stigmatisation de l'IA chinoise ; elle ne définit pas vraiment les limites des potentialités de cette technologie.
5. Le pari de ByteDance : suivre la voie la plus difficile pour changer l'histoire ?
ByteDance discute actuellement de l'entraînement de modèles contenant plus de 5 ou même 10 billions de paramètres. À quel point cette voie est-elle difficile ?
- Conséquences à court terme : Liang Rubo a admis que le retard par rapport aux modèles leaders mondiaux s'aggrave ;
- Valorisation à long terme : en cas de succès, ByteDance pourrait devenir un acteur majeur dans l'IA mondiale et même réécrire l'histoire du développement de l'IA en Chine ; en cas d'échec, cela pourrait être une leçon coûteuse pour l'industrie.
Cependant, cette diversité est bénéfique : l'AI chinois a besoin que différentes entreprises empruntent des chemins distincts. Le choix de Zhang Yiming mérite respect et ne devrait pas être imposé comme norme dans l'industrie.
Conclusion finale
La distillation n'est pas un test de positionnement politique, mais un outil technique. ByteDance a choisi la voie la plus difficile, mais ce courage à s'écarter des sentiers battus est précisément ce dont l'innovation en IA a besoin. Quel que soit le résultat, cela ajoute une possibilité supplémentaire à l'écosystème chinois de l'IA.