SuperCompress icon

SuperCompress

SuperCompress 是面向 LLM 应用的查询感知上下文压缩器,可在推理前减少输入 token,同时保留回答所需证据。开源、可在 CPU 上运行,并提供托管 API 和 Python 包。

SuperCompress

概述

SuperCompress 是面向 LLM 应用的查询感知上下文压缩器。它位于您的应用与模型之间,在推理前通过选择与用户当前问题最相关的提示词部分来减少输入 token。

该产品适用于聊天机器人、RAG 流水线、支持助手、AI 搜索和 agent 循环等长上下文工作流。源内容将其描述为采用 MIT 开源许可、仅支持 CPU、参数规模约 5K,并提供托管 API 和本地 Python 包供使用。

功能

感知查询的上下文压缩

针对当前用户问题对提示词片段进行评分,并移除与回答该问题相关性较低的上下文。

推理前提示词预处理

在模型调用前支持聊天历史、RAG 片段、支持对话记录、工具轨迹、日志以及其他长上下文输入。

压缩报告与诊断

返回 token 数、已节省 token、保留比例和压缩风险级别,方便团队在上线前或日志中审查影响。

托管与本地工作流

提供托管 API 和本地 Python 包,文档中还展示了 curl、JSON 和表单编码请求选项。

仪表盘与测试工作流

包含交互式试玩区和仪表盘,可用于测试上下文、创建密钥并查看计量用量。

集成指南

记录了与 OpenAI、LangChain、Express.js、Vercel AI SDK 以及本地模型调用的集成路径。

使用场景

  • 聊天机器人和对话式 AI

    在每次向模型发送请求前缩短聊天历史和重复的对话状态,帮助消费级 AI 应用随时间控制 token 增长。

  • 检索增强生成

    在 RAG 流水线中压缩检索到的段落和文档片段,使模型在不超出上下文窗口的情况下看到最相关的证据。

  • 支持助手

    在 copilot 和 agent 工具调用 LLM 之前,减少支持对话记录、工单历史和知识库摘录。

  • Agent 循环与工具轨迹

    在 agent 工作流中,修剪跨轮次累积的工具轨迹、中间输出和日志。

  • 提示词压缩评估

    使用您自己的提示词测试产品,对比原始上下文与压缩后上下文,并在上线前检查保留或移除的内容。

Pros and Cons

Pros

  • 在模型调用之前而不是生成之后,直接针对 token 成本和延迟进行优化。
  • 保留回答所需证据,而不是机械地截断上下文尾部。
  • 可在 CPU 上运行,无需 GPU。
  • 同时提供托管和本地两种使用路径。
  • 提供诸如已节省 token 和重要内容保留百分比等可衡量输出字段。

Cons

  • 收集到的源内容中未提供定价页面,因此公开计划详情仅限于仪表盘。
  • 文档同时展示了编译器模式和固定比例模式,用户可能需要根据具体用例选择合适的工作流。
  • 源内容除仪表盘和文档外,没有提供关于部署、安全性或团队管理的更多详细信息。

FAQ

如何使用 SuperCompress?

SuperCompress 可通过托管 HTTP API 或 Python 包使用。文档展示了在仪表盘中获取 API 密钥的快速入门,以及 Python 和 curl 示例。

SuperCompress 是本地运行还是仅作为托管 API 提供?

文档说明,SuperCompress 在托管 API 上以编译器模式运行,而本地 Python 包支持诸如 compress_context()、compress_for_turn() 和 compress_detailed() 等压缩函数。

它适用于哪些工具和模型栈?

源内容列出了 OpenAI、Claude、Gemini 和本地模型调用作为支持目标,文档还提到了与 OpenAI、LangChain、Express.js 以及 Vercel AI SDK 的集成。

输出包含什么?

文档描述了一个查询感知编译器,可在推理前压缩上下文,输出字段包括压缩后的文本、节省的 token、保留的重要内容百分比以及压缩风险。

是否有定价信息可用?

文档说明托管 API 通过仪表盘进行计量,计划限制为每月 token 限额。由于未提供定价页面,源内容中仅能看到仪表盘中的计划标签。

Quick Facts

类别
开发者工具
产品类型
面向 LLM 的查询感知上下文压缩器
平台
托管 API 和 Python 包
运行环境
仅支持 CPU;无需 GPU
许可证
MIT
来源域名
supercompress.dev