Headroom美元节省计算原理:LiteLLM定价如何把Token节省换算成真金白银
Headroom美元节省计算原理LiteLLM定价如何把Token节省换算成真金白银【免费下载链接】headroomCompress tool outputs, logs, files, and RAG chunks before they reach the LLM. 20% fewer tokens for coding agents, 60-95% fewer tokens for JSON, same answers. Library, proxy, MCP server.项目地址: https://gitcode.com/GitHub_Trending/head/headroomHeadroom 是一个 LLM 上下文压缩工具可在工具输出、日志、文件和 RAG 分块进入大模型之前先行压缩为编码 Agent 节省约 20% Token对 JSON 类内容可节省 60–95%。很多人只看到省了多少 Token却不知道 Headroom 仪表盘上那个亮眼的Cost Saved节省美元是怎么算出来的。这篇文章带你拆解 Headroom 的美元节省计算原理它如何用 LiteLLM 的社区定价数据库把每一次压缩节省的 Token 数精准换算成真金白银。一、为什么省Token必须换算成省美元对 LLM API 用户来说账单不是按字符计费而是按Token × 单价计费。不同模型的输入、输出、缓存读取单价差异巨大同一个 Token输出价格通常是输入价格的 4–5 倍缓存读取Cache Read通常只有标准输入价的 10%–50%部分模型如 Anthropic Sonnet 4/4.5 系列超过 200K 长上下文阈值后整个请求会被重新计价。所以省了 10 万个 Token到底值多少钱取决于三个变量哪个模型、哪类 Token输入/输出/缓存、是否触发长上下文重定价。Headroom 的美元节省计算正是围绕这三点展开的。二、核心公式节省Token数 × LiteLLM 每百万Token单价Headroom 不自带硬编码价格表而是直接复用LiteLLM 的社区维护模型成本数据库覆盖 100 模型相关实现在 headroom/pricing/litellm_pricing.py美元节省 节省的Token数 × 该模型每Token价格USD核心换算函数estimate_cost()与estimate_cost_from_tokens()位于 headroom/pricing/litellm_pricing.py后者专门处理两类复杂账单场景LiteLLM 数据库中的价格字段标准输入input_cost_per_token标准输出output_cost_per_token缓存读取cache_read_input_token_cost缓存写入5分钟cache_creation_input_token_cost LiteLLM 内部以每 Token为存储单位Headroom 在读取时统一放大 100 万倍换算为每百万 Token 美元价并做 6 位小数舍入避免浮点噪声例如 $0.4/M 被存成 0.39999999999999997。三、Headroom 的四类节省每一层单独计价压缩代理在处理每个请求时会区分四种性质不同的节省并分别计价。这四条计价函数集中在 headroom/proxy/savings_tracker.py压缩节省compression工具输出、日志等输入 Token 被压缩后省下的部分按输入单价计费 → _estimate_compression_savings_usd工具Schema节省tool_schema工具定义压缩省下的 Token同样按输入单价 → 复用压缩计价输出塑形节省output_shaping限制/优化模型生成内容省下的输出 Token按更贵的输出单价计费 → _estimate_output_savings_usd缓存节省provider_cache命中前缀缓存省下的部分按折扣差值计费见下一节→ _estimate_cache_savings_usd统一入口是 estimate_request_savings_usd它把四个数值汇总成一个字典供仪表盘与遥测消费——这也是省了多少美元能被逐层归因的关键。四、缓存折扣不是省全部而是省差价这是最容易算错的一步。缓存读取并非免费而是按折扣价计费所以 Headroom 计算的缓存节省是标准输入价与缓存读取价之差每Token缓存节省 input_cost_per_token − cache_read_input_token_cost 缓存节省总额 命中缓存的Token数 × 每Token缓存节省例如某模型输入价 $3.0/M、缓存读取价 $0.3/M每命中 1M Token 就省 $2.7。若差价 ≤ 0个别模型缓存反而更贵则记 $0绝不会出现负节省。在会话级成本追踪中headroom/proxy/cost.py 还维护了一张各供应商缓存经济学系数表如 Anthropic 缓存读取按输入价 10%、写入按 125% 计用于更贴近真实账单的会话成本估算。五、边界情况LiteLLM 不认识这个模型怎么办真实部署中网关Kong、LiteLLM Gateway 等经常传入别名模型名如claude-opusLiteLLM 数据库里查不到节省就会读成 $0。Headroom 用三道防线兜底模型名解析resolve_litellm_model 会尝试加bedrock/、vertex_ai/、deepseek/等前缀反复查询结果按模型名缓存避免阻塞事件循环别名映射通过HEADROOM_MODEL_ALIAS_MAP环境变量提供自定义名称映射JSON 格式fail-soft 设计配置无效时行为与默认完全一致兜底混合价实在查不到时savings_tracker.py 使用保守混合单价——输入 $3.0/M、输出 $15.0/M——保证节省数字不为零同时日志给出一次性警告。还有一个细节值得注意代码刻意区分查不到价格走兜底和价格为 0.0免费模型记 $0。早期版本用if not x判断会把真实免费模型误判为无价格凭空算出不存在的节省这个 bug 的修复记录就写在 savings_tracker.py 的注释里。此外headroom/pricing/registry.py 提供了一个带价格时效性检查的注册表PricingRegistry价格数据超过 30 天未核验即标记is_stale并生成警告提示你去官方价格页核对——因为供应商调价后过期的价格表会让美元节省失真。六、结果去哪看持久化与仪表盘每一笔请求计价后SavingsTracker 会把以下字段累加并持久化到本地 JSON默认.headroom/proxy_savings.json重启代理也不丢失compression_savings_usd压缩节省美元cache_savings_usd缓存节省美元output_savings_usd输出塑形节省美元total_input_cost_usd输入实际花费历史数据支持小时/天/周/月分桶聚合并按供应商、项目、模型多维归因。最终所有数字汇聚到仪表盘上——Cost Saved 就是这套计价管线输出的社区级汇总 如上图所示社区累计节省 59B Token、约 $235.9K 美元——每一个数字背后都是Token 数 × LiteLLM 单价这条公式在成千上万次请求上的累加。七、小结三条要点记住换算逻辑要点说明 计价来源复用 LiteLLM 社区数据库100 模型实时价非硬编码 分层计价压缩按输入价、输出塑形按输出价、缓存按折扣差值四层独立归因 稳健兜底别名解析 混合兜底价 免费模型特判保证数字可信不为零想深入了解实现细节建议按以下路径阅读源码定价核心headroom/pricing/litellm_pricing.py模型名解析headroom/pricing/litellm_model_resolution.py节省计价与持久化headroom/proxy/savings_tracker.py会话成本与缓存经济学headroom/proxy/cost.py节省台账headroom/savings_ledger.py价格注册表headroom/pricing/registry.py理解了这套Token → 美元的换算管线你就能准确评估 Headroom 为你省下的每一分钱也能在自己的 LLM 网关里复刻同样的成本归因能力。【免费下载链接】headroomCompress tool outputs, logs, files, and RAG chunks before they reach the LLM. 20% fewer tokens for coding agents, 60-95% fewer tokens for JSON, same answers. Library, proxy, MCP server.项目地址: https://gitcode.com/GitHub_Trending/head/headroom创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻