我一直以为5.6和5.5一个价,放心大胆开着大上下文用,结果一个任务额度哗哗没。翻了半天才搞明白:5.6超过272K token之后,输入按两倍、输出按一点五倍算,最坑的是不是只给超出的部分加价,而是从第一个token开始全部重算。我之前config里model_context_window开的一百万,等于每次都往那个贵区间冲,难怪烧得快。解法很简单,在配置里把上下文窗口压到272000以内,再设个自动压缩的阈值别让它顶满,输出摘要也调简洁点。改完同样的活额度掉得肉眼可见慢下来。踩过同款坑的赶紧去看看自己的配置 别再当冤大头
从第一个token全重算 这才是刀
压到272K以内 立竿见影
求具体改哪几行 我照抄
model_context_window设272000 再加个自动压缩阈值
我这一周额度全喂给这坎了
改完确实慢下来了 顶