Explorateur de fréquence et de probabilité des kanji

combien de kanji couvrent 95 % des caractères d'un texte japonais réel ?

Chargement de la simulation interactive...

Leçon

La théorie — Explorateur de fréquence et de probabilité des kanji

Il s’agit d’une question de couverture, et non de décompte : sachant que quelques caractères sont utilisés en permanence alors que la plupart le sont rarement, combien parmi les plus fréquents devez-vous connaître pour reconnaître une proportion donnée de tout ce qui est écrit ? La réponse est bien inférieure au total, et la raison en est que la fréquence des caractères est extrêmement inégale.

Ce que signifie chaque symbole

rank
la position d’un caractère lorsque tous sont triés selon leur fréquence d’apparition. Le rang 1 est le plus fréquent.
coverage
la part de toutes les occurrences représentée par l’ensemble des caractères jusqu’à un certain rang — un total cumulé de la fréquence, pas un décompte de caractères.
required
le nombre de caractères les plus fréquents nécessaires pour atteindre une couverture cible. Le tableau ci-dessus convertit la couverture que vous choisissez en ce nombre.
known
le nombre de caractères que vous supposez déjà connaître, que la page utilise pour indiquer quelle serait votre couverture actuelle.

Comment lire ce que vous voyez

Le tableau se lit comme un tarif pour la maîtrise de la langue : une couverture de 50% coûte 158 kanjis, 80% coûte 558, 90% coûte 872, 95% coûte 1,162 et 99% coûte 1,651. Observez les écarts plutôt que les lignes, et la structure de la langue apparaît.

Suppose
Un corpus fixe. La fréquence est une propriété des textes analysés, non de la langue dans l’abstrait — un corpus de journaux, un corpus de mangas et un corpus juridique réordonneraient chacun la queue de distribution et modifieraient chaque nombre de ce tableau.
Ne tient plus quand
Les rendements s’effondrent, et ils s’effondrent d’une manière qu’il vaut la peine d’anticiper. Les 158 premiers caractères vous apportent la moitié de tout texte. Passer de 90 % à 95 % coûte 290 caractères de plus, et le dernier 1 % — pour passer d’une couverture de 99 % à une couverture complète — coûte plus cher que tout le trajet de 50 % à 90 %. Il n’y a aucun rang où la queue de distribution prend fin, seulement un point où chaque caractère supplémentaire cesse de valoir l’heure qu’il nécessite.

La liste décide de la fréquence à laquelle vous pouvez réviser 🖖

Le rang de fréquence se lit d'ordinaire comme une importance, mais il fixe quelque chose de plus pratique : le temps d'attente entre deux rencontres. Dans le corpus de cet outil, 人 au rang 1 apparaît une fois tous les 62 kanji, 休 au rang 500 une fois tous les 2 051, et 騎 au rang 1 500 une fois tous les 15 428. Lisez une nouvelle de 10 000 caractères et votre probabilité de croiser ne serait-ce qu'une fois ce caractère de rang 1 500 est de 47,7 % : l'apprendre puis ne plus jamais le revoir est le résultat ordinaire et non de la malchance, et c'est un argument pour suivre l'ordre de fréquence plutôt que celui d'un manuel. Dix-neuf des 2 136 kanji jōyō n'apparaissent pas du tout dans les 709 707 caractères échantillonnés. Il faut toutefois savoir ce qu'est l'échantillon : 60 œuvres de prose littéraire majoritairement du début du XXe siècle, et non de l'actualité ou des textes techniques.

Couverture n'est pas compréhension 🖖

La couverture indique quelle part des occurrences de kanji d'un texte est représentée par l'ensemble que vous connaissez déjà. En apprenant les 1,162 kanji les plus fréquents, vous reconnaîtrez environ 95% des caractères kanji de ce corpus. Mais une page pleine de caractères familiers peut rester illisible si la grammaire et le vocabulaire vous sont inconnus. La couverture mesure les symboles rencontrés, pas votre compréhension.

Un même kanji, deux probabilités 🖖

« Quelle est la probabilité qu'un kanji ait 15 traits ou plus ? » admet deux réponses correctes. En tirant un kanji uniformément dans le dictionnaire (types), les caractères complexes forment une part notable ; en tirant une occurrence dans un texte réel (occurrences), ils sont bien plus rares, car les caractères réellement lus penchent vers le simple (人, 日, 一). Cet écart entre types et occurrences est un échantillonnage pondéré par la fréquence — le mécanisme du paradoxe de l'amitié.

Problème entièrement résolu

  1. 500 kanjis offrant une couverture de 77,39 % de ce corpus 6 étapes

    500 kanji assurent une couverture de 77,39 % de ce corpus. Déterminez ce que cela représente pour une page de texte, puis ce qu'il en coûte pour combler l'écart.

    1. La couverture et son complémentaire expriment le même fait. L'inverse du complémentaire est l'écart moyen entre deux inconnues, ce qui constitue la forme indiquant ce qu'est réellement l'expérience de lecture.

    2. Rapportez cela à une œuvre entière. L'en-tête du corpus donne le nombre d'occurrences et le nombre d'œuvres, de sorte que le calcul ne nécessite rien d'extérieur à la page.

    3. Passons à la courbe de coût. Le panneau indique le nombre de kanji requis pour cinq objectifs de couverture, et la quantité intéressante est la différence entre deux lignes consécutives.

    4. Divisez la couverture gagnée par le nombre de kanji investis. Le taux diminue de moitié entre les deux intervalles.

    5. Le reste de la liste des Jōyō constitue le cas extrême : un cinquième des caractères pour un centième du texte.

    6. Inversez l'objectif. Lire avec un seul kanji inconnu par œuvre plutôt qu'un tous les 4,4 kanji correspond à un taux de couverture comportant quatre neuf, ce qu'aucune liste fixe de 2 136 caractères ne peut offrir.

    Réponse

    Un kanji inconnu tous les 4,4 kanjis, et chacun des kanjis nécessaires pour gagner le dernier 1% coûte huit fois plus cher que sur le trajet de 90% à 95%. Les 158 premiers kanjis suffisent à couvrir la moitié du corpus. Les 290 qui font passer de 90% à 95% rapportent chacun 0,017 point. Les 489 qui mènent ensuite de 95% à 99% n'en rapportent plus que 0,008. Quant aux 485 restants, ils ne valent que 0,002 point chacun : un cinquième des caractères pour un centième du texte. Toute distribution de fréquences à longue traîne présente cette allure, qui dicte la stratégie d'apprentissage la plus rentable. Les mille premiers caractères constituent un investissement sans égal dans le domaine de l'éducation ; les cinq cents derniers relèvent plutôt du goût de l'exhaustivité. On comprend aussi pourquoi une couverture de 77% n'en donne pas l'impression. Avec un kanji manquant tous les 4,4 kanjis, vous buteriez environ 2 700 fois sur une œuvre moyenne de ce corpus. Ce n'est pas lire.

Références (2)

Exemples de problèmes