Co je to vlastně tokenizace?
LLM nečtou slova jako lidé. Text je rozbit na tzv. "tokeny" – shluky znaků, které mohou být celými slovy nebo jen jejich částmi. Tento proces transformuje lidskou řeč do numerických vektorů, se kterými dokáže procesor pracovat. Marketerské sliby o "pochopení kontextu" jsou ve skutečnosti jen matematické operace nad těmito vektory v multidimenzionálním prostoru.