碳排放明细:对推理能耗进行预算管理
这里有一个事实打破了大多数工程仪表盘的逻辑:两个完全相同的推理请求,返回相同的 token,按相同的 API 费率计费,但其碳足迹(Carbon Footprints)可能相差五倍。相同的模型,相同的提示词,相同的花费。唯一改变的是由哪个数据中心响应以及当时的时间。如果你的可持续发展指标是根据支出金额推导出来的——几乎所有人都是这么做的,因为支出是唯一被真正追踪的数字——那么你的可持续发展指标就是错误的,而且当你越是努力优化成本时,这种错误就越严重。
美元和焦耳看起来应该是一致变动的。更多的 token,更多的计算,更多的钱,更多的能源。对于在单一瞬间、单一地点处理的单个请求,它们确实大致一致。但是,当你开启那些能实现大规模廉价推理的杠杆——激进的批处理(Batching)、模型路由(Model Routing)、非高峰期调度、多区域故障转移——这两个指标就会脱钩。成本是合同的函数,而碳排放是物理学和电网的函数。它们不是同一种函数,将其中一个作为另一个的代用指标,最终会导致你在可持续发展报告中填入一个审计员可以证伪的数字。
