模型不直接读字,而是先把文本切成一个个小片段(Token)再处理;切分方式直接影响成本、上下文长度和效果。
语言模型的最小处理单位不是「字」,也不是「词」,而是 Token——一个介于两者之间的片段。分词就是决定怎么切的那一步。
如果按字切,序列会很长,模型要花更多计算去处理;如果按词切,词表会爆炸,而且遇到没见过的新词、拼写错误、代码符号就没法处理。子词切分是折中方案:常见词整体保留为一个 Token,罕见词拆成更小的片段。
Token 数量直接决定三件事:一是费用和速度,按量计费的服务通常就是按 Token 算;二是上下文长度,窗口是用 Token 计量的;三是注意力计算的成本,随长度快速增长。 不同语言的「密度」不一样:表达同样一段意思,中文、日文等往往需要比英文更多的 Token,这会影响成本估算和多语言任务的难度。