// CLUBIC — INTELLIGENZA ARTIFICIALE
Un paramètre d’IA, qu’est-ce que c’est et faut-il vraiment en compter des milliards ?
Un modèle d’IA peut compter dix fois plus de paramètres qu’un autre sans produire de meilleures réponses. Ces petits coefficients influencent ses calculs, mobilisent parfois une mémoire considérable et disent finalement moins de ses capacités qu’on pourrait le croire.
7 milliards, 70 milliards, 400 milliards… En quelques années, le nombre de paramètres des modèles d’IA a explosé, et dépasse aujourd’hui le millier de milliards pour les plus imposants. Cet indicateur renseigne d’abord sur la taille du modèle et sert volontiers de point de comparaison, mais il nourrit aussi parfois des raccourcis un peu faciles sur ses capacités. Alors, que compte-t-on exactement quand on parle d’un modèle à X milliards de paramètres ? Ni des mots appris, ni des faits enregistrés, ni même des neurones artificiels, mais des valeurs numériques ajustées au cours de l’entraînement du modèle. Bien. Et concrètement ?
Un paramètre est avant tout un nombre. Plus exactement, un coefficient interne et persistant du modèle, qui influence la manière dont il traite les données et calcule ses prédictions.
Qu’il soit fixé à 0,018, -0,42 ou 1,27 importe peu en soi : extraire un paramètre du modèle ne permet pas d’en déduire grand-chose. En revanche, la place qu’il occupe dans les calculs et ses interactions avec des milliards d’autres paramètres déterminent ce qui sera renforcé, atténué ou combiné dans les séries de nombres qui représentent les tokens à l’intérieur du modèle.
Dans un modèle de langage générant du texte token par token, cette succession de calculs attribue finalement un score à chacun des tokens de son vocabulaire. Ces scores sont convertis en probabilités, puis l’un des tokens est sélectionné. Après « Paris est la capitale de la », par exemple, l’action conjointe de milliards de paramètres donnera une probabilité élevée au token susceptible d’amorcer une suite comme « France », et bien plus faible à ceux qui cadrent mal avec le contexte. Le token retenu rejoint alors le texte déjà généré, et les calculs recommencent pour prédire le suivant, jusqu’à la fin de la génération.
Impossible, donc, d’isoler le paramètre qui contient « Paris », la conjugaison d’un verbe ou la date d’un événement : aucun ne renferme une information que l’on pourrait lire ou extraire telle quelle. Ce que le modèle a appris dépend des effets combinés d’un très grand nombre de ces coefficients. Une même connaissance peut ainsi mobiliser quantité de paramètres, et un même paramètre participer à des calculs utiles dans des contextes très différents.
Un paramètre n’est pas non plus un neurone artificiel, mais une valeur numérique utilisée dans les calculs du réseau, dont les neurones peuvent faire intervenir de nombreux paramètres. Compter les paramètres ne revient donc pas à compter les neurones du réseau.
Techniquement, ces milliards de paramètres sont regroupés dans des tableaux de nombres appelés tenseurs. De tailles différentes, ils sont répartis dans le modèle selon les opérations auxquelles ils participent.
Une grande partie de ces tableaux contient des poids, utilisés dans les calculs du modèle. Selon l'architecture, on trouve également des biais qui, contrairement aux poids, ajoutent une valeur au résultat d'un calcul plutôt que de multiplier les valeurs reçues. Ils permettent ainsi de décaler ce résultat indépendamment des entrées.
D'autres tableaux remplissent des fonctions particulières. La table d'embeddings, par exemple, contient les représentations numériques initiales des tokens du vocabulaire. Chaque token y possède sa propre série de nombres, apprise pendant l'entraînement.