Token预算顾问(TBA)
在Claude回答之前拦截响应流程,让用户选择回答深度。
何时使用
- 用户希望控制回答的长度或详细程度
- 用户提及token、预算、深度或回答长度
- 用户说"简短版"、"太长不看"、"简要"、"25%"、"详尽"等
- 任何用户希望预先选择深度/详细程度的情况
不要触发当:用户已在本会话中设置了级别(静默保持),或答案本身只有一行。
工作原理
第一步 — 估算输入token
使用仓库的标准上下文预算启发式方法,在脑海中估算提示词的token数量。
使用与context-budget相同的校准指南:
- 散文:
words × 1.3 - 代码密集或混合/代码块:
chars / 4
对于混合内容,使用主导内容类型并保持估算启发式方法。
第二步 — 按复杂度估算响应大小
对提示词进行分类,然后应用乘数范围获取完整响应窗口:
| 复杂度 | 乘数范围 | 示例提示词 |
|---|---|---|
| 简单 | 3× – 8× | "X是什么?",是/否问题,单一事实 |
| 中等 | 8× – 20× | "X是如何工作的?" |
| 中高 | 10× – 25× | 带上下文的代码请求 |
| 复杂 | 15× – 40× | 多部分分析、比较、架构 |
| 创意 | 10× – 30× | 故事、散文、叙事写作 |
响应窗口 = input_tokens × mult_min 到 input_tokens × mult_max(但不要超过模型配置的输出token限制)。
第三步 — 呈现深度选项
在回答之前呈现此区块,使用实际估算的数字:
分析您的提示...
输入:~[N] 个令牌 | 类型:[类型] | 复杂度:[级别] | 语言:[语言]
选择您的深度级别:
[1] 基础 (25%) -> ~[令…