// FRANDROID — INTELLIGENZA ARTIFICIALE
Claude et ChatGPT semblent moins intelligents après chaque mise à jour ou lors de pics d’affluence : simple biais ou réalité ?
Hier soir, j’ai demandé à Claude de reprendre un tableau qu’il avait bouclé sans broncher le matin même. Réponse tronquée, une colonne oubliée, et ce « voulez-vous que je continue ? ». J’ai juste eu envie de fermer la session et de passer à autre chose.
J’ai eu ce sentiment plusieurs fois, comme s’ils avaient bridé le truc parce que tout le monde se connecte à cette heure-là. Ou que Claude Code sous Opus 5 était devenu stupide depuis la sortie d’Opus 5.5, le 22 septembre. On a tous formulé cette théorie au moins une fois. J’ai essayé de comprendre ce qui est vrai et ce qui est faux.
Pour aller plus loin
Claude Opus 5.5 vs GPT 6-Sol : une bataille entre la puissance et le prix
La question n’est plus anecdotique. Claude Code, Codex et leurs concurrents sont devenus des outils de travail quotidiens, facturés de 20 à 200 euros par mois, et une partie des gens qui les paient dépendent d’eux pour livrer. Un PC portble qui ralentit, on le voit. Un modèle qui change sous nos pieds, on ne le voit pas, et personne ne nous prévient. D’où le soupçon permanent, et d’où l’intérêt de regarder ce qui a été réellement mesuré.
Le phénomène a un nom, la dérive des modèles, et il a été mesuré dès 2023. Cet été-là, des chercheurs de Stanford et Berkeley avaient constaté que GPT-4 reconnaissait un nombre premier dans 97,6 % des cas en mars, puis 2,4 % en juin.
L’étude a été critiquée, notamment par Arvind Narayanan, informaticien à l’université de Princeton. Il y voyait un changement de comportement plutôt qu’une perte de capacité : le modèle ne répondait plus de la même façon, sans être forcément moins bon. Le doute était tout de même installé, et il n’a jamais quitté les forums depuis. Il aura fallu attendre septembre 2025 pour qu’un laboratoire pose lui-même des chiffres sur la table.
Le 17 septembre 2025, Anthropic a publié un premier post-mortem détaillé et reconnu trois bugs d’infrastructure entre août et début septembre. Le plus parlant : une erreur de routage envoyait des requêtes Sonnet 4 vers des serveurs configurés pour la fenêtre de 1 million de tokens, d’abord 0,8 % des requêtes Sonnet 4 à partir du 5 août, puis 16 % à la pire heure du 31 août. Environ 30 % des utilisateurs de Claude Code actifs pendant cette période ont eu au moins un message dégradé. Comme le routage était « collant », une requête tombée sur le mauvais serveur y restait souvent pour la suite de la conversation. Autrement dit, deux personnes assises côte à côte pouvaient vivre deux Claude différents pendant des jours.
Ce premier post-mortem répondait à une question, pas à toutes. La théorie la plus tenace, celle qui ressort à chaque baisse de forme, ne parle pas de routage. Elle parle de compression.
Le principe de la quantification tient en quelques lignes. Un modèle est fait de milliards de nombres, généralement stockés en 16 bits. Les compresser en 8 ou 4 bits divise la mémoire nécessaire par deux ou quatre, donc le nombre de GPU par utilisateur, et donc la facture. Pour un labo qui sert des millions de requêtes par jour, la tentation est évidente.
À 8 bits, la perte est quasi invisible. À 4 bits, les erreurs apparaissent sur le code et les raisonnements longs, sauf pour les modèles entraînés pour ça dès le départ, comme Kimi K3 de Moonshot, livré nativement en MXFP4 depuis juillet.