介绍

理解 Token 与上下文 ​

Token 是模型处理内容时使用的计量单位;上下文是这次请求一起交给模型的材料。

Token 不是固定字数 ​

同一句话会被拆成多个 Token。中文、英文、数字、代码的拆分方式不同,不能用固定的“一个字等于一个 Token”来精确算费。

一句话也可能带着很多材料 ​

你在长对话中只输入“继续”,客户端可能同时发送之前的聊天、文件内容和工具结果。计量看实际发出的全部内容,而不是输入框里最后几个字。

内容通常属于哪里
新问题、系统提示、历史对话、文件输入上下文
命中缓存的输入部分缓存读取,仍是本次上下文的一部分
模型生成的回答或工具指令输出

上下文窗口有什么用 ​

上下文窗口表示模型能一起处理多大范围的材料。有些工具会在接近上限时压缩历史或要求新建对话。较大的上限不代表每次都应该塞满。

不要随意调大限制

客户端里的上下文和最大输出值不能超过服务实际支持的范围。手动填写一个更大数字不会让模型获得额外能力,可能导致请求被拒绝。

降低无关输入 ​

  1. 不相关的新问题新建对话。
  2. 只上传当前需要的文件,避免整个磁盘或大量无关日志。
  3. 长任务先整理已确认的结论,再继续后续工作。
  4. 到使用日志查看实际输入、缓存和输出量。

上下文较长还可能触发长上下文计费档位。是否命中缓存、是否进入分档,都以实际请求记录为准。

阅读中遇到问题?联系支持
AI 助手