Explorador de Frecuencia y Probabilidad de Kanji

¿cuántos kanji cubren el 95 % de los caracteres de un texto japonés real?

Cargando simulación interactiva...

Lección

La teoría — Explorador de Frecuencia y Probabilidad de Kanji

Esta es una cuestión de cobertura, no de recuento: dado que unos pocos caracteres se usan constantemente y la mayoría raramente, ¿cuántos de los más comunes necesitas conocer para reconocer una proporción determinada de todo lo escrito? La respuesta es muchísimos menos que el total, y la razón es que la frecuencia de los caracteres es extremadamente desigual.

Qué significa cada símbolo

rank
la posición de un carácter cuando todos se ordenan según la frecuencia con la que aparecen. El rango 1 es el más común.
coverage
la proporción del total de apariciones abarcada por todos los caracteres hasta un determinado rango — un total acumulado de frecuencia, no un recuento de caracteres.
required
cuántos de los caracteres más comunes necesitas para alcanzar una cobertura objetivo. La tabla de arriba convierte la cobertura que elijas en esa cantidad.
known
cuántos asumes que ya conoces, cifra que la página utiliza para informar cuál sería tu cobertura actual.

Cómo leer lo que ves

La tabla se lee como una lista de precios para la fluidez: una cobertura del 50% cuesta 158 kanjis, el 80% cuesta 558, el 90% cuesta 872, el 95% cuesta 1,162 y el 99% cuesta 1,651. Lee los intervalos en lugar de las filas y la estructura del idioma saldrá a la luz.

Supone
Un corpus fijo. La frecuencia es una propiedad de los textos analizados, no del idioma en abstracto — un corpus periodístico, uno de manga y uno jurídico reordenarían la cola y alterarían cada número de esa tabla.
Falla cuando
El rendimiento decrece drásticamente, y lo hace de una forma que conviene tener en cuenta al planificar. Los primeros 158 caracteres te proporcionan la mitad de todo. Pasar del 90% al 95% cuesta otros 290, y el 1% final —desde el 99% de cobertura hasta la totalidad— cuesta más que todo el recorrido del 50% al 90%. No hay un rango en el que la cola termine, solo un punto en el que cada carácter adicional deja de valer la hora que cuesta aprenderlo.

La lista decide cada cuánto puedes repasar 🖖

El rango de frecuencia se lee normalmente como importancia, pero fija algo más práctico: cuánto esperas entre un encuentro y el siguiente. En el corpus de esta herramienta 人, en el puesto 1, aparece una vez cada 62 kanji; 休, en el 500, una vez cada 2.051; y 騎, en el 1.500, una vez cada 15.428. Lee un relato de 10.000 caracteres y tu probabilidad de cruzarte con ese carácter del puesto 1.500 aunque sea una vez es del 47,7 %: aprenderlo y no volver a verlo es el resultado corriente, no mala suerte, y es un argumento para seguir el orden de frecuencia en vez del de un libro de texto. Diecinueve de los 2.136 kanji jōyō no aparecen en absoluto en los 709.707 caracteres muestreados. Conviene saber cuál es la muestra: 60 obras de prosa literaria mayoritariamente de principios del siglo XX, no noticias actuales ni textos técnicos.

Cobertura no es comprensión 🖖

La cobertura indica qué proporción de las apariciones de kanji en un texto representa el conjunto que ya conoces. Si aprendes los 1,162 kanji más frecuentes, reconocerás alrededor del 95% de los caracteres kanji de este corpus. Pero una página llena de caracteres familiares puede seguir siendo ilegible si la gramática y el vocabulario son nuevos. La cobertura mide los símbolos que encuentras, no lo que entiendes.

El mismo kanji, dos probabilidades 🖖

"¿Qué probabilidad hay de que un kanji tenga 15 trazos o más?" admite dos respuestas correctas. Si eliges un kanji al azar del diccionario (tipos), los complejos son una porción notable; si eliges una aparición de un texto real (ocurrencias), son mucho más raros, porque los caracteres que lees tienden a ser simples (人, 日, 一). Esta brecha entre tipos y ocurrencias es un muestreo ponderado por frecuencia, el mismo mecanismo de la paradoja de la amistad.

Problema resuelto al detalle

  1. 500 kanjis que dan un 77,39% de cobertura en este corpus 6 pasos

    500 kanji dan una cobertura del 77,39% de este corpus. Calcule qué significa esto para una página de texto y, a continuación, cuánto cuesta cerrar la brecha.

    1. La cobertura y su complemento son el mismo hecho. El recíproco del complemento es la distancia media entre desconocidos, que es la forma que revela lo que realmente se siente al leer.

    2. Escale eso a una obra completa. El encabezado del corpus proporciona el recuento de apariciones y el número de obras, por lo que la aritmética no necesita nada de fuera de la página.

    3. Ahora, la curva de costes. El panel enumera la cantidad de kanji necesarios para cinco objetivos de cobertura, y la magnitud de interés es la diferencia entre filas consecutivas.

    4. Divida la cobertura obtenida entre los kanji invertidos. La tasa se reduce a la mitad entre los dos intervalos.

    5. El resto de la lista Jōyō es el caso extremo: una quinta parte de los caracteres por una centésima parte del texto.

    6. Invierta el objetivo. Leer con un solo kanji desconocido por obra en lugar de uno cada 4,4 kanji es una cifra de cobertura que contiene cuatro nueves, algo que ninguna lista fija de 2.136 caracteres puede ofrecer.

    Respuesta

    Un kanji desconocido cada 4,4; además, cada kanji del último 1 % cuesta ocho veces más que uno del tramo del 90 % al 95 %. Los primeros 158 kanji bastan para abarcar la mitad del corpus. Los 290 que te llevan del 90 % al 95 % aportan 0,017 puntos cada uno. Los 489 que te llevan del 95 % al 99 % aportan 0,008. Y los 485 restantes, 0,002: una quinta parte del repertorio para una centésima parte del texto. Así se comportan siempre las distribuciones de frecuencias con cola larga, y esa forma determina qué merece la pena aprender de una lengua. Los primeros mil caracteres son la mejor inversión posible en educación; los últimos quinientos, un capricho de completista. También explica por qué una cobertura del 77 % no se percibe como tal. Si desconoces un kanji de cada 4,4, tropezarás unas 2.700 veces en una obra media de este corpus, demasiadas para poder leer con fluidez.

Referencias (2)

Problemas de ejemplo