Problema resuelto al detalle
-
Compresión cuando sesenta y ocho caracteres pasan a ser trece tokens 5 pasos
Sesenta y ocho caracteres se convierten en trece tokens. Calcule la compresión y determine qué representan realmente para un modelo esos cinco caracteres por token.
-
Ambos recuentos conforman la medida completa: caracteres de entrada y tokens de salida.
-
Su proporción es algo superior a cinco, lo cual es habitual en inglés con la codificación por pares de bytes: las palabras frecuentes sobreviven como tokens individuales y las raras se fragmentan.
-
La comparación relevante es frente a la alternativa. Un modelo a nivel de byte lee el mismo texto como 68 tokens, más de cinco veces la longitud de la secuencia.
-
Y la matriz de atención contiene n² elementos, así que multiplicar la longitud por 5,23 multiplica por 27 el trabajo correspondiente a esa parte. En el resto de la red, el coste crece linealmente con n y se reduce por un factor de 5,23. Que predomine uno u otro depende de la longitud del contexto: la atención solo pasa a dominar a partir de unos cuantos miles de tokens.
-
Los trece tokens de este caso son distintos, lo que indica que el texto es breve y variado: no hay repeticiones que las fusiones puedan aprovechar más allá de lo que el vocabulario ya codifica.
Respuesta
La herramienta muestra 13 tokens para 68 caracteres: 5,23 caracteres por token. Esa compresión explica tanto la existencia de la tokenización como su importancia. Para una longitud de contexto fija, supone la diferencia entre cinco páginas de texto y una. También explica por qué un mismo modelo resulta más barato en inglés que en lenguas para las que no se diseñó el vocabulario. Las fusiones se aprendieron a partir de un corpus; por eso, una escritura poco representada en él tiende a fragmentarse hasta acercarse al nivel de los bytes y encarece ambos componentes del cálculo: el coste crece linealmente en toda la red y cuadráticamente en la atención. Pega un texto en otra lengua y observa cómo baja la proporción.
-
Ruta de aprendizaje
Cómo elige un LLM la siguiente palabra
Referencias (2)
- Byte-pair encoding applied to text, which is where subword tokenisation came from: R. Sennrich, B. Haddow and A. Birch, "Neural Machine Translation of Rare Words with Subword Units." Proceedings of the 54th Annual Meeting of the ACL (Volume 1: Long Papers), 1715–1725, 2016.
- The language-independent scheme most current models actually ship: T. Kudo and J. Richardson, "SentencePiece: A simple and language independent subword tokenizer and detokenizer for Neural Text Processing." Proceedings of EMNLP 2018: System Demonstrations, 66–71, 2018.