Token 是模型处理文本时使用的片段。英文可能一个短词就是一个 token,也可能被拆开;中文常按一个或少数字符形成 token,但具体比例取决于模型的 tokenizer。
所以不要用“一个 token 等于几个汉字”做精确预算。真正准确的数字应由对应模型的 tokenizer 或 API usage 字段给出。
一次请求的 token 账本通常包含系统规则、历史对话、附件、工具结果、你的新问题、模型思考与最终输出。
01 / TOKENToken 既不是字,也不是词。
模型先把文字转成 token ID,再进行计算。标点、空格、代码、数字和不同语言都会影响切分。相同意思换一种语言或格式,token 数量可能不同。
输入 Token
系统提示、历史消息、当前问题、附件文本和工具结果都可能计入。
输出 Token
模型生成的内容;推理模型还可能有不可见或单独计费的 reasoning tokens。
上下文窗口
模型一次能够处理的总容量,通常要同时容纳输入与预留输出。
最大输出
一次最多能生成多少 token,常与总上下文限制不同。
02 / WINDOW128K 上下文,不等于能输出 128K。
如果模型总上下文是 128K,而系统规则、历史和材料已经占用 110K,就不可能再完整生成同样长的输出。产品还可能设置比模型理论上限更小的附件、对话或输出限制。
长上下文也不是越满越好。更多 token 意味着更高成本、更长延迟,并可能让关键信息被噪声淹没。Agent 会使用检索、摘要和上下文压缩,只把当前步骤真正需要的内容送入模型。
03 / GENERATION“生成数量”受四类上限共同影响。
第一是模型本身的最大输出;第二是产品套餐或接口参数设置;第三是总上下文剩余容量;第四是时间、费用和安全策略。网页产品显示的消息次数,与 API 的 token 计费也不是同一个概念。
- 写长文时先要结构,再分段生成和逐段核验,不要赌一次输出到底。
- 处理长文件时优先检索相关片段,不要默认把整库塞进上下文。
- API 看 usage 返回值与官方价格页;本地模型看上下文设置、内存和速度。
- 看到 1M、256K、128K 时,同时查最大输出与产品实际限制。
04 / COSTToken 不只是容量,也是成本与速度。
云 API 常把输入、缓存输入和输出分别定价;输出通常更贵,长推理还会增加等待时间。本地运行虽然没有按 token 账单,但更长上下文会占更多内存并降低生成速度。
最实用的优化不是把每句话压到最短,而是删掉重复历史、只检索相关材料、固定稳定规则、让输出格式明确,并在任务完成后停止循环。
学习来源与阅读边界
- OpenAI Models:各型号上下文与最大输出规格入口。
- Gemini Models API:inputTokenLimit 与 outputTokenLimit 元数据。
- Ollama FAQ:本地模型、上下文与运行配置。
- Ollama Library:模型体积和上下文窗口标签。
- 《深入理解 AI Agent》开源仓库:十章工程主线与术语来源。
- 本前置系列由本站为非技术读者补写,使用生活化例子降低入口门槛,不替代原书。
- 不用访问 GitHub 也能在本站读完整内容并完成预编排互动;原始链接仅供想继续深挖的读者使用。
基础名词已经齐了,现在用“有与无”把它们串起来。
继续保持“先建立直觉,再补术语与工程细节”的顺序。
打开交互实验室 ↗继续零基础路线 →

读者评论
把这篇文章留给你的想法写下来。
还没有评论。你可以留下第一条。