理解 Token 与上下文
Token 是模型处理内容时使用的计量单位;上下文是这次请求一起交给模型的材料。
Token 不是固定字数
同一句话会被拆成多个 Token。中文、英文、数字、代码的拆分方式不同,不能用固定的“一个字等于一个 Token”来精确算费。
一句话也可能带着很多材料
你在长对话中只输入“继续”,客户端可能同时发送之前的聊天、文件内容和工具结果。计量看实际发出的全部内容,而不是输入框里最后几个字。
| 内容 | 通常属于哪里 |
|---|---|
| 新问题、系统提示、历史对话、文件 | 输入上下文 |
| 命中缓存的输入部分 | 缓存读取,仍是本次上下文的一部分 |
| 模型生成的回答或工具指令 | 输出 |
上下文窗口有什么用
上下文窗口表示模型能一起处理多大范围的材料。有些工具会在接近上限时压缩历史或要求新建对话。较大的上限不代表每次都应该塞满。
不要随意调大限制
客户端里的上下文和最大输出值不能超过服务实际支持的范围。手动填写一个更大数字不会让模型获得额外能力,可能导致请求被拒绝。
降低无关输入
- 不相关的新问题新建对话。
- 只上传当前需要的文件,避免整个磁盘或大量无关日志。
- 长任务先整理已确认的结论,再继续后续工作。
- 到使用日志查看实际输入、缓存和输出量。
上下文较长还可能触发长上下文计费档位。是否命中缓存、是否进入分档,都以实际请求记录为准。
阅读中遇到问题?联系支持