一次 LLM 请求的计费单元拆解,以及如何利用缓存省钱。
📊 三者关系图示
┌─────────────────────────────────────────────────────────────────┐
│ 一次 LLM 请求的 Token 组成 │
└─────────────────────────────────────────────────────────────────┘
【输入 Input Tokens】 【输出 Output Tokens】
─────────────────── ──────────────────────
│ ▲
▼ │
┌───────────────┐ ┌──────────────┐
│ Prompt │ ──────► LLM ─────► │ Response │
│ (你发的) │ 大模型 │ (模型生成) │
└───────────────┘ └──────────────┘
│
│ 可拆分为两部分:
▼
┌──────────────────────┬──────────────────────┐
│ Cached Tokens │ Uncached Tokens │
│ (命中缓存) │ (新鲜内容) │
│ 💰 便宜 10 倍 │ 💸 正常价格 │
│ ⚡ 响应更快 │ 🐢 需要重新计算 │
└──────────────────────┴──────────────────────┘
2026/4/27大约 2 分钟