感知查询的上下文压缩
针对当前用户问题对提示词片段进行评分,并移除与回答该问题相关性较低的上下文。
SuperCompress 是面向 LLM 应用的查询感知上下文压缩器。它位于您的应用与模型之间,在推理前通过选择与用户当前问题最相关的提示词部分来减少输入 token。
该产品适用于聊天机器人、RAG 流水线、支持助手、AI 搜索和 agent 循环等长上下文工作流。源内容将其描述为采用 MIT 开源许可、仅支持 CPU、参数规模约 5K,并提供托管 API 和本地 Python 包供使用。
针对当前用户问题对提示词片段进行评分,并移除与回答该问题相关性较低的上下文。
在模型调用前支持聊天历史、RAG 片段、支持对话记录、工具轨迹、日志以及其他长上下文输入。
返回 token 数、已节省 token、保留比例和压缩风险级别,方便团队在上线前或日志中审查影响。
提供托管 API 和本地 Python 包,文档中还展示了 curl、JSON 和表单编码请求选项。
包含交互式试玩区和仪表盘,可用于测试上下文、创建密钥并查看计量用量。
记录了与 OpenAI、LangChain、Express.js、Vercel AI SDK 以及本地模型调用的集成路径。
在每次向模型发送请求前缩短聊天历史和重复的对话状态,帮助消费级 AI 应用随时间控制 token 增长。
在 RAG 流水线中压缩检索到的段落和文档片段,使模型在不超出上下文窗口的情况下看到最相关的证据。
在 copilot 和 agent 工具调用 LLM 之前,减少支持对话记录、工单历史和知识库摘录。
在 agent 工作流中,修剪跨轮次累积的工具轨迹、中间输出和日志。
使用您自己的提示词测试产品,对比原始上下文与压缩后上下文,并在上线前检查保留或移除的内容。
SuperCompress 可通过托管 HTTP API 或 Python 包使用。文档展示了在仪表盘中获取 API 密钥的快速入门,以及 Python 和 curl 示例。
文档说明,SuperCompress 在托管 API 上以编译器模式运行,而本地 Python 包支持诸如 compress_context()、compress_for_turn() 和 compress_detailed() 等压缩函数。
源内容列出了 OpenAI、Claude、Gemini 和本地模型调用作为支持目标,文档还提到了与 OpenAI、LangChain、Express.js 以及 Vercel AI SDK 的集成。
文档描述了一个查询感知编译器,可在推理前压缩上下文,输出字段包括压缩后的文本、节省的 token、保留的重要内容百分比以及压缩风险。
文档说明托管 API 通过仪表盘进行计量,计划限制为每月 token 限额。由于未提供定价页面,源内容中仅能看到仪表盘中的计划标签。
AakarDev AI 帮助团队在一个仪表板中管理 AI provider 访问、项目级设置、日志和分析,支持 BYOK 工作流,并涵盖 OpenAI、Google Gemini、Anthropic、Groq、Mistral AI 和 Perplexity AI。
CreateOS Sandbox 是基于 Firecracker 微型虚拟机的隔离计算环境,用于运行代码和 agent 工作负载,支持私有网络、SDK、CLI 和 MCP 程序化控制。
Arduino VENTUNO Q 是面向 AI 和机器人应用的边缘 AI 计算机,单板集成 AI 推理与确定性控制,并支持 Arduino App Lab。
ByteAsk 是面向 C 和 C++ 的终端优先 AI 编码 agent,可直接编辑仓库,并在展示 diff 前用真实编译器、调试器、sanitizers 和测试验证修改。提供免费版与付费方案。
Codex Plugins 将可复用技能、应用集成和 MCP 服务器打包为工作流,可在 Codex 应用中安装或通过 Codex CLI 使用,帮助扩展连接服务任务、复用指令和团队共享流程。
hob 是面向编码 agent 的独立工作区,可将 agent 会话、终端、历史记录和后续工作围绕你已在用的工具与提供商有序管理,适合重视本地路由、历史和工作区结构控制的开发者。