Lección
La teoría — Explorador de Frecuencia y Probabilidad de Kanji
Esta es una cuestión de cobertura, no de recuento: dado que unos pocos caracteres se usan constantemente y la mayoría raramente, ¿cuántos de los más comunes necesitas conocer para reconocer una proporción determinada de todo lo escrito? La respuesta es muchísimos menos que el total, y la razón es que la frecuencia de los caracteres es extremadamente desigual.
Qué significa cada símbolo
rank- la posición de un carácter cuando todos se ordenan según la frecuencia con la que aparecen. El rango 1 es el más común.
coverage- la proporción del total de apariciones abarcada por todos los caracteres hasta un determinado rango — un total acumulado de frecuencia, no un recuento de caracteres.
required- cuántos de los caracteres más comunes necesitas para alcanzar una cobertura objetivo. La tabla de arriba convierte la cobertura que elijas en esa cantidad.
known- cuántos asumes que ya conoces, cifra que la página utiliza para informar cuál sería tu cobertura actual.
Cómo leer lo que ves
La tabla se lee como una lista de precios para la fluidez: una cobertura del 50% cuesta 158 kanjis, el 80% cuesta 558, el 90% cuesta 872, el 95% cuesta 1,162 y el 99% cuesta 1,651. Lee los intervalos en lugar de las filas y la estructura del idioma saldrá a la luz.
- Supone
- Un corpus fijo. La frecuencia es una propiedad de los textos analizados, no del idioma en abstracto — un corpus periodístico, uno de manga y uno jurídico reordenarían la cola y alterarían cada número de esa tabla.
- Falla cuando
- El rendimiento decrece drásticamente, y lo hace de una forma que conviene tener en cuenta al planificar. Los primeros
158caracteres te proporcionan la mitad de todo. Pasar del 90% al 95% cuesta otros290, y el 1% final —desde el 99% de cobertura hasta la totalidad— cuesta más que todo el recorrido del 50% al 90%. No hay un rango en el que la cola termine, solo un punto en el que cada carácter adicional deja de valer la hora que cuesta aprenderlo.
Problema resuelto al detalle
-
500 kanjis que dan un 77,39% de cobertura en este corpus 6 pasos
500 kanji dan una cobertura del 77,39% de este corpus. Calcule qué significa esto para una página de texto y, a continuación, cuánto cuesta cerrar la brecha.
-
La cobertura y su complemento son el mismo hecho. El recíproco del complemento es la distancia media entre desconocidos, que es la forma que revela lo que realmente se siente al leer.
-
Escale eso a una obra completa. El encabezado del corpus proporciona el recuento de apariciones y el número de obras, por lo que la aritmética no necesita nada de fuera de la página.
-
Ahora, la curva de costes. El panel enumera la cantidad de kanji necesarios para cinco objetivos de cobertura, y la magnitud de interés es la diferencia entre filas consecutivas.
-
Divida la cobertura obtenida entre los kanji invertidos. La tasa se reduce a la mitad entre los dos intervalos.
-
El resto de la lista Jōyō es el caso extremo: una quinta parte de los caracteres por una centésima parte del texto.
-
Invierta el objetivo. Leer con un solo kanji desconocido por obra en lugar de uno cada 4,4 kanji es una cifra de cobertura que contiene cuatro nueves, algo que ninguna lista fija de 2.136 caracteres puede ofrecer.
Respuesta
Un kanji desconocido cada 4,4; además, cada kanji del último 1 % cuesta ocho veces más que uno del tramo del 90 % al 95 %. Los primeros 158 kanji bastan para abarcar la mitad del corpus. Los 290 que te llevan del 90 % al 95 % aportan 0,017 puntos cada uno. Los 489 que te llevan del 95 % al 99 % aportan 0,008. Y los 485 restantes, 0,002: una quinta parte del repertorio para una centésima parte del texto. Así se comportan siempre las distribuciones de frecuencias con cola larga, y esa forma determina qué merece la pena aprender de una lengua. Los primeros mil caracteres son la mejor inversión posible en educación; los últimos quinientos, un capricho de completista. También explica por qué una cobertura del 77 % no se percibe como tal. Si desconoces un kanji de cada 4,4, tropezarás unas 2.700 veces en una obra media de este corpus, demasiadas para poder leer con fluidez.
-
Referencias (2)
- The corpus every number here is counted from — a sample of public-domain Japanese literary works: Aozora Bunko (青空文庫), public-domain Japanese texts. Counts restricted to the Jōyō kanji set.
- Per-character metadata (readings, grade, stroke count): KANJIDIC2, Electronic Dictionary Research and Development Group (EDRDG), used under CC BY-SA 4.0.