用大模型 API 开发应用,最困惑的往往是账单。这篇示例文章解释几个最基础的计费概念。
输入与输出分开计费
几乎所有厂商都按 token 计费,并且输入与输出单价不同。通常输出更贵,因为生成过程需要更多算力。写代码时尽量把指令写精简,能显著降低成本。
上下文长度乘以每轮请求
每次请求都会把历史对话一起发送,所以多轮对话的消耗会累积。常见误区是「聊得越多越贵」,其实贵的是每次重发历史。
缓存与批量接口
不少平台提供缓存命中优惠与批量接口折扣:
- 长系统提示词命中缓存后价格大幅下降
- 异步批量任务的价格通常比实时接口低一半左右
省钱的基本原则
- 减少无意义的上下文重发
- 简单任务用小模型
- 高频请求走批量或缓存
(本文为开源仓库示例文章,具体价格以各平台公示为准。)