如何通过AI上下文压缩减少重复付费

  • 2026-09-08

每次AI助手处理请求时,可能会对你先前查看的内容重复付费。无论是几轮之前阅读的文件,还是被快速滚动过去的构建日志,甚至是工具生成的庞大JSON数据,实际上模型只需要其中的少数关键信息。每次请求都会将这些内容重新传输并产生费用。为了解决这个问题,我开发了Compresso,这是一种本地AI压缩层,利用Headroom、Rtk等技术来减少token的消耗。其核心思想是用更少的token表达相似信息,而不是让模型尝试把上下文“总结”为短内容——这是个误解。

我们所说的压缩,实际上是保留原文的重要部分,对重复的内容进行重新编码,指向已有的信息,而不是简单的遗漏。操作流程包括先路由再压缩。第一步是识别,一个本地机器学习分类器会判断每个数据块的类型,如JSON数据、构建日志、源代码等。这一步在本地进行,速度极快。

分类的必要性在于不存在普适的压缩方案。对构建日志的压缩策略可能不适用于源代码,因此不同类型的数据会采用特定的压缩器来处理,而分类器不确定的内容则保持不变。这也解释了基准测试中存在的零结果,因为有些信息已经非常紧凑,AI模型所需的数据没有任何处理。 球友会

对于工具输出,常见问题是返回近乎相同的对象数组。通过结构感知的压缩器,对这些数组进行统计分析,判断哪些字段有变化,哪些是固定的,保留有意义的部分,省去重复的信息。经过处理后,原本500条相似的JSON记录可以缩小到仅几条保留的记录,并且数据结构和大小保持一致。

about image

此外,构建和测试输出是AI代理处理时可以显著压缩的信息,同时也是压缩中风险较大的部分。设计原则是完整保留错误、警告和堆栈跟踪,因为有价值的信息常常蕴藏在这些细节中。