Lição
A teoria — Explorador de Frequência e Probabilidade de Kanji
Esta é uma questão de cobertura, e não de contagem: dado que alguns carateres são usados constantemente e a maioria raramente, quantos dos mais comuns precisa de saber para reconhecer uma determinada fração de tudo o que está escrito? A resposta é muito menor do que o total, e a razão é que a frequência dos carateres é extremamente desigual.
O que significa cada símbolo
rank- a posição de um carater quando todos são ordenados pela frequência com que aparecem. A posição 1 é a do mais comum.
coverage- a fração de todas as ocorrências representada por tudo até a uma determinada posição — um total acumulado da frequência, e não uma contagem de carateres.
required- quantos dos carateres mais comuns precisa de saber para atingir uma cobertura pretendida. A tabela acima converte a cobertura escolhida nesse número.
known- quantos assume que já conhece, que a página utiliza para indicar qual seria a sua cobertura atual.
Como ler o que vê
A tabela lê-se como uma lista de preços para a fluência: uma cobertura de 50% custa 158 kanji, 80% custa 558, 90% custa 872, 95% custa 1,162 e 99% custa 1,651. Leia os intervalos em vez das linhas e a estrutura da língua revela-se.
- Pressupõe
- Um corpus fixo. A frequência é uma propriedade dos textos analisados, não da língua em abstrato — um corpus de jornais, um corpus de manga e um corpus jurídico alterariam, cada um, a ordem da cauda e deslocariam todos os números dessa tabela.
- Falha quando
- Os ganhos diminuem drasticamente, e fá-lo de uma forma que vale a pena ter em conta no planeamento. Os primeiros
158carateres garantem-lhe metade de tudo. Passar de 90% para 95% custa outros290, e o 1% final — de 99% de cobertura até à totalidade — custa mais do que todo o percurso dos 50% aos 90%. Não existe uma posição em que a cauda termine, apenas um ponto em que cada carater adicional deixa de valer a hora que exige.
Problema resolvido na íntegra
-
500 kanji a dar 77,39% de cobertura deste corpus 6 passos
500 kanji garantem uma cobertura de 77,39% deste corpus. Calcule o que isso significa para uma página de texto e, em seguida, quanto custa fechar a lacuna.
-
A cobertura e o seu complemento são o mesmo facto. O recíproco do complemento é o intervalo médio entre desconhecidos, que é a forma que mostra qual é realmente a sensação de ler.
-
Dimensione isso para uma obra inteira. O cabeçalho do corpus dá a contagem de ocorrências e o número de obras, pelo que a aritmética não precisa de nada vindo de fora da página.
-
Agora a curva de custo. O painel lista o número de kanji necessário para cinco metas de cobertura, e a quantidade interessante é a diferença entre linhas consecutivas.
-
Divida a cobertura ganha pelo kanji gasto. A taxa reduz-se para metade entre os dois intervalos.
-
O restante da lista Jōyō é o caso extremo: um quinto dos caracteres por um centésimo do texto.
-
Inverta o objetivo. Ler com um desconhecido por obra, em vez de um por cada 4,4 kanji, é um valor de cobertura com quatro noves, que nenhuma lista fixa de 2.136 caracteres consegue fornecer.
Resposta
Um kanji desconhecido em cada 4,4, e cada kanji do último 1% custa 8 vezes mais do que no percurso entre 90% e 95%. Os primeiros 158 kanji dão acesso a metade do corpus. Os 290 que elevam a cobertura de 90% para 95% rendem 0,017 pontos percentuais cada um. Os 489 que levam de 95% a 99% rendem 0,008. Já os 485 restantes rendem 0,002: um quinto do alfabeto para chegar a mais um centésimo do texto. É a forma inevitável de uma distribuição de frequências com cauda longa, e ela dita a melhor estratégia para aprender uma língua. Os primeiros mil caracteres são um dos melhores investimentos possíveis em educação; os últimos quinhentos ficam para quem faz questão de completar a coleção. Isso também explica por que uma cobertura de 77% não parece corresponder a 77%. Desconhecer um kanji em cada 4,4 significa tropeçar cerca de 2.700 vezes numa obra de extensão média deste corpus. Isso não é ler.
-
Referências (2)
- The corpus every number here is counted from — a sample of public-domain Japanese literary works: Aozora Bunko (青空文庫), public-domain Japanese texts. Counts restricted to the Jōyō kanji set.
- Per-character metadata (readings, grade, stroke count): KANJIDIC2, Electronic Dictionary Research and Development Group (EDRDG), used under CC BY-SA 4.0.