直接答案
100 万 Token 不是一个固定价格。输入与输出单价不同,输入还要拆分为缓存命中和未命中,并根据峰谷时段计费。最准确的办法是分别填写输入 Token、输出 Token、缓存命中率和每日调用次数。
先记住这四点
- 区分输入与输出 Token
- 缓存命中部分按更低单价计算
- 空闲时段与周末价格更低
- 批量业务应按月度调用量估算
为什么“100 万 Token 多少钱”没有唯一答案
模型调用会同时产生输入和输出 Token。相同的 100 万 Token,如果全部是输入、全部是输出,或者一部分命中上下文缓存,最终账单会明显不同。V4 Flash 与 V4 Pro 的定位和单价也不同,因此不能只用一个总 Token 数直接相乘。
- 输入 Cache Hit
- 输入 Cache Miss
- 模型输出
- 高峰或空闲时段
实用估算方法
先从日志或 SDK 返回的 usage 字段取得真实 Token,再统计每日调用次数。没有历史数据时,可用最近一周的典型请求抽样,分别记录输入、输出和缓存命中。将这些数据放入计算器后,同时查看单次、每日和 30 天预算。
常见问题
中文字符和 Token 是一比一吗?
不是。字符到 Token 的比例受文本内容与分词方式影响,预算阶段只能估算,结算应以 API 返回的 usage 数据为准。
为什么输出 Token 通常更值得控制?
输出单价往往高于缓存命中的输入。限制无意义长输出、设置明确格式,通常能直接减少费用。