首页 / AI 百科 / Token 与分词

Token 与分词Token and Tokenization

基础概念

模型不直接读字,而是先把文本切成一个个小片段(Token)再处理;切分方式直接影响成本、上下文长度和效果。

语言模型的最小处理单位不是「字」,也不是「词」,而是 Token——一个介于两者之间的片段。分词就是决定怎么切的那一步。

为什么要切

如果按字切,序列会很长,模型要花更多计算去处理;如果按词切,词表会爆炸,而且遇到没见过的新词、拼写错误、代码符号就没法处理。子词切分是折中方案:常见词整体保留为一个 Token,罕见词拆成更小的片段。

常见做法

实际影响

Token 数量直接决定三件事:一是费用和速度,按量计费的服务通常就是按 Token 算;二是上下文长度,窗口是用 Token 计量的;三是注意力计算的成本,随长度快速增长。 不同语言的「密度」不一样:表达同样一段意思,中文、日文等往往需要比英文更多的 Token,这会影响成本估算和多语言任务的难度。

常见误区

相关词条
词嵌入 上下文窗口 大语言模型(LLM)
本词条为原创科普整理,用于帮助理解,不替代论文与官方文档。如有技术性错漏,欢迎指正。
← 返回 AI 百科 · 返回首页