Token-based inference
Estimate input and output tokens separately, including conversation history and retrieved documents. If rates differ, calculate each part at its own rate. Multiply by expected requests; add any separately billed embedding, reranking or audio usage.