Problème entièrement résolu
-
Terre et Soleil à 0,299 sur 13 rencontres 6 étapes
Le panneau évalue
␣Earthpar rapport à␣Sunà 0,299. Earth apparaît 230 fois dans le corpus et Sun 150 fois, sur un total de 385 078 tokens qui ouvrent 2 770 646 emplacements de contexte entre eux, et les deux se trouvent à 4 tokens au plus l'un de l'autre à 13 reprises. Calculez la part de ces 13 rencontres dans le score de 0,299.-
Une coordonnée par mot de contexte, et les vecteurs sont normalisés à une longueur de 1 avant toute comparaison. C'est cette mise à l'échelle qui fait de la similarité cosinus un simple produit scalaire : 0,299 est une somme de produits, avec un terme pour chaque mot de contexte que les deux tokens ont en commun.
-
Une coordonnée est un rapport de surprise, et non un décompte — la fréquence à laquelle la paire apparaît réellement ensemble comparée à la fréquence à laquelle un corpus mélangé les associerait. La surprise négative est ramenée à 0, de sorte que le vecteur enregistre ce par quoi un token est attiré et n'a aucun moyen de consigner ce qu'il évite.
-
Le hasard d'abord. Earth occupe 230 des 385 078 positions et Sun 150, si bien que sur l'ensemble des 2 770 646 emplacements, on s'attendrait à trouver la paire 0,6446 fois — soit moins de 1 occurrence dans tout le corpus.
-
Elles apparaissent 13 fois, soit 20,17 fois ce que prédit le hasard, et la coordonnée est le logarithme de ce rapport : 3,004. Les deux vecteurs reçoivent la même valeur, car le décompte et les deux fréquences se lisent de la même manière dans les deux sens.
-
Passons à la mise à l'échelle. Le vecteur d'Earth compte 419 coordonnées positives et une longueur de 30,381 ; celui de Sun en compte 302 et une longueur de 29,144. En divisant 3,004 par chacune d'elles, les coordonnées unitaires s'élèvent à 0,0989 et 0,1031.
-
Leur produit, 0,0102, représente l'intégralité de la contribution de ces 13 rencontres. Earth et Sun partagent 105 mots de contexte au total ; en additionnant l'ensemble des 105 produits, on obtient 0,2992, que l'outil arrondit à 0,299 — les données directes fournissent donc 3,4 % du score.
Réponse
L'outil affiche 0,299, et les cooccurrences effectives de ces deux mots représentent 0,0102 de ce total. Le reste provient de l'entourage : 105 mots de contexte partagés sur les 2 742 tokens qui possèdent un vecteur. Deux conséquences en découlent. Puisque le tronquage supprime toute coordonnée négative, chacun des 105 produits est positif, si bien que l'échelle s'étend de 0 à 1 plutôt que de -1 à 1 — une paire qui n'a rien en commun obtient un score de 0, et non l'opposé de 1. Interprété comme un angle, 0,299 correspond à 72,6°, ce qui place Earth et Sun à 17,4° d'une absence totale de point commun. Et le classement issu du score est plus fin que les preuves sous-jacentes : ␣planet arrive en tête de la liste des voisins d'Earth avec 0,307, devançant Sun de 0,008, alors que la seule coordonnée propre à Earth et Sun vaut à elle seule 0,0102. Un seul mot de contexte suffit pour modifier le token désigné comme le plus proche.
-
Parcours
Comment un LLM choisit le mot suivant
Références (2)
- The vector arithmetic this tool measures, in the paper that made it famous: T. Mikolov, K. Chen, G. Corrado and J. Dean, "Efficient Estimation of Word Representations in Vector Space." arXiv:1301.3781, 2013.
- The co-occurrence counts underneath it, made explicit: J. Pennington, R. Socher and C. D. Manning, "GloVe: Global Vectors for Word Representation." Proceedings of EMNLP 2014, 1532–1543, 2014.