
你看到的是一句话,Token看到的是一串词元。
随着AI技术,特别是大语言模型的广泛运用,“Token”一词越来越频繁地出现在人们的日常生活中。前不久,国内三大电信运营商相继推出面向个人、家庭以及企业的“Token套餐”,将AI算力以类似“手机流量包”的形式进行标价和收费。那么,什么是Token,它的出现对于生活在AI时代的人们意味着什么?
Token一词的本义是“符号、标记、信物”,在AI领域,Token被解释为“词元”,是指大语言模型在处理信息时能够独立读取的最小语义单元。
人类能够读懂的文字信息需要翻译成计算机能够读取和理解的语言,这种语言的最小单位就是Token。值得注意的是,这里的Token不是人们理解的“字”或“词”,而是依照计算机编码规则,将人类语言切割后形成的可被计算机理解的“语义积木”。在中文里,1个Token大约对应1.5到2个汉字;在英文里,1个Token大约对应4个字母,也就是0.75个单词。一个高频词如“人工智能”,可能对应一个Token,而一个复杂的词语如“不高兴”,可能被拆分“不”和“高兴”对应两个Token。另外,标点符号、空格甚至表情符号也会被算作一个Token。同样,大语言模型在输出结果时也是以Token为单位输出,再编译为人们能够读取的文字、图片、视频等信息。
就像人脑在记忆信息时有长度限制、超出部分会被遗忘一样,大语言模型每次能够记住和处理的最大Token数量也是有限的。AI在处理任务时,能够接收并处理的Token序列的最大长度,叫做上下文窗口,它是大语言模型的记忆单位。想象一下,当你和AI正在一块黑板上对话:这块黑板的大小是固定的(比如只能写4000个字)。你写的问题、AI写的回答、以及你们之前的聊天记录,都会写在这块黑板上。当黑板被写满时,为了写下新的内容,最早写在黑板左上角的内容就会被擦掉。对大语言模型来讲,上下文窗口就是这块黑板的最大容量。如果一个大语言模型的上限是8K Token,意味着你的提问加上AI的答复,占用的Token总和不应超过8000 tokens。一旦超过,大语言模型会截断超出部分,导致回复不完整或丢失上下文。相应的,上下文窗口越大,AI就能一次性“阅读”和“思考”越长的内容。
Token这种计量属性,使其成为描述算力性能的标尺。它首先被用来衡量模型处理能力。用户每次调用AI服务,计算量都是按Token算的——输入多少、输出多少。这不仅关系到计算系统的工作量,还关乎计算成本和收费。100 tokens和10000 tokens背后对应着真实的算力、电力和硬件成本差别。从云厂商、模型公司到应用开发者,整个产业链都以Token为核心进行结算。因此,就像信息时代计算网络流量一样,算力运营商推出“Token套餐”,以Token衡量服务量,并对应收费。
另外,Token也被用来衡量AI的响应速度。大语言模型生成内容时是一个一个Token往外“蹦”,随着Token调用量的增长,消耗的算力和时间也呈线性增长。这就是为什么有时AI回复长文时,人们感觉它是在“打字”,因为它正在实时计算下一个Token。每个Token都需要独立计算,所以内容越长,消耗的时间和资源就越多,响应速度就会变慢。可以说,处理Token的能力是衡量AI的关键指标。
在AI时代,一个行业、一个领域甚至一个国家每天的Token调用量,已经成为衡量其算力应用规模和算力强弱的关键性指标。可以说,Token既是AI理解世界的“语言”,也是衡量算力的标尺,还是驱动AI产业发展的“燃料”。未来,它将成为人们工作和生活中不可或缺的数字工具。(于 斌)






