胡泽贤 律师RULES & BEYONDBEGINNER 09 / 2026

AI AGENT / 零基础前置 09

AI 不是按字数思考,而是按 Token 工作。

模型限制和 API 价格常写成 8K、128K、1M tokens。它们既不是固定字数,也不只计算你的最后一句问题。

输入、历史、工具结果与输出共同占用上下文窗口的 token 账本编辑视觉
VISUAL METAPHOR / 主题隐喻Token 账本 · 输入、上下文、输出与成本

Token 是模型处理文本时使用的片段。英文可能一个短词就是一个 token,也可能被拆开;中文常按一个或少数字符形成 token,但具体比例取决于模型的 tokenizer。

所以不要用“一个 token 等于几个汉字”做精确预算。真正准确的数字应由对应模型的 tokenizer 或 API usage 字段给出。

一次请求的 token 账本通常包含系统规则、历史对话、附件、工具结果、你的新问题、模型思考与最终输出。

01 / TOKENToken 既不是字,也不是词。

模型先把文字转成 token ID,再进行计算。标点、空格、代码、数字和不同语言都会影响切分。相同意思换一种语言或格式,token 数量可能不同。

1

输入 Token

系统提示、历史消息、当前问题、附件文本和工具结果都可能计入。

2

输出 Token

模型生成的内容;推理模型还可能有不可见或单独计费的 reasoning tokens。

3

上下文窗口

模型一次能够处理的总容量,通常要同时容纳输入与预留输出。

4

最大输出

一次最多能生成多少 token,常与总上下文限制不同。

02 / WINDOW128K 上下文,不等于能输出 128K。

如果模型总上下文是 128K,而系统规则、历史和材料已经占用 110K,就不可能再完整生成同样长的输出。产品还可能设置比模型理论上限更小的附件、对话或输出限制。

长上下文也不是越满越好。更多 token 意味着更高成本、更长延迟,并可能让关键信息被噪声淹没。Agent 会使用检索、摘要和上下文压缩,只把当前步骤真正需要的内容送入模型。

03 / GENERATION“生成数量”受四类上限共同影响。

第一是模型本身的最大输出;第二是产品套餐或接口参数设置;第三是总上下文剩余容量;第四是时间、费用和安全策略。网页产品显示的消息次数,与 API 的 token 计费也不是同一个概念。

  • 写长文时先要结构,再分段生成和逐段核验,不要赌一次输出到底。
  • 处理长文件时优先检索相关片段,不要默认把整库塞进上下文。
  • API 看 usage 返回值与官方价格页;本地模型看上下文设置、内存和速度。
  • 看到 1M、256K、128K 时,同时查最大输出与产品实际限制。

04 / COSTToken 不只是容量,也是成本与速度。

云 API 常把输入、缓存输入和输出分别定价;输出通常更贵,长推理还会增加等待时间。本地运行虽然没有按 token 账单,但更长上下文会占更多内存并降低生成速度。

最实用的优化不是把每句话压到最短,而是删掉重复历史、只检索相关材料、固定稳定规则、让输出格式明确,并在任务完成后停止循环。

学习来源与阅读边界

  • OpenAI Models各型号上下文与最大输出规格入口
  • Gemini Models APIinputTokenLimit 与 outputTokenLimit 元数据
  • Ollama FAQ本地模型、上下文与运行配置
  • Ollama Library模型体积和上下文窗口标签
  • 《深入理解 AI Agent》开源仓库:十章工程主线与术语来源。
  • 本前置系列由本站为非技术读者补写,使用生活化例子降低入口门槛,不替代原书。
  • 不用访问 GitHub 也能在本站读完整内容并完成预编排互动;原始链接仅供想继续深挖的读者使用。

基础名词已经齐了,现在用“有与无”把它们串起来。

继续保持“先建立直觉,再补术语与工程细节”的顺序。

打开交互实验室 继续零基础路线

读者评论

把这篇文章留给你的想法写下来。

0 / 300

还没有评论。你可以留下第一条。