具查詢感知的上下文壓縮
根據目前使用者問題對提示片段進行評分,並移除對回答該問題較不相關的上下文。
SuperCompress 是一款適用於 LLM 應用的具查詢感知上下文壓縮器。它位於您的應用與模型之間,會先在推論前透過選取與使用者當前問題最相關的提示片段來減少輸入 token。
此產品適用於長上下文工作流程,例如聊天機器人、RAG 管線、支援副駕、AI 搜尋與代理迴圈。來源描述其為 MIT 授權的開源專案、僅支援 CPU、參數量約 5K,並提供代管 API 與本機 Python 套件供使用。
根據目前使用者問題對提示片段進行評分,並移除對回答該問題較不相關的上下文。
支援在模型呼叫前處理聊天紀錄、RAG 區塊、支援對話紀錄、工具追蹤、日誌及其他長上下文輸入。
回傳 token 數、節省的 token、保留百分比,以及壓縮風險等級,方便團隊在上線前或日誌中檢視影響。
提供代管 API 與本機 Python 套件,文件中也展示了 curl、JSON 與 form-encoded 請求選項。
包含互動式試用空間與儀表板,可試驗上下文、建立金鑰並查看計量用量。
文件記錄了與 OpenAI、LangChain、Express.js、Vercel AI SDK 以及本機模型呼叫的整合路徑。
在每次將請求送往模型前,先縮短聊天紀錄與重複的對話狀態,協助消費型 AI 應用控制 token 成長。
在 RAG 管線中壓縮檢索到的段落與文件區塊,讓模型看到最相關的證據,同時不超出上下文視窗。
在副駕與代理工具呼叫 LLM 之前,先減少支援對話紀錄、工單歷史與知識庫摘錄。
修剪在代理工作流程中跨輪次累積的工具追蹤、中間輸出與日誌。
使用自己的提示測試產品,比較原始與壓縮後的上下文,並在上線前檢視保留或移除的內容。
SuperCompress 可透過代管 HTTP API 或 Python 套件使用。文件展示了在儀表板中設定 API 金鑰的快速開始,並提供 Python 與 curl 範例。
文件指出,SuperCompress 可在代管 API 的 compiler mode 中運作,而本機 Python 套件則支援 compress_context()、compress_for_turn() 與 compress_detailed() 等壓縮函式。
來源列出 OpenAI、Claude、Gemini 與本機模型呼叫為支援目標,文件也提到可與 OpenAI、LangChain、Express.js 以及 Vercel AI SDK 整合。
文件描述了一個具查詢感知的 compiler,會在推論前壓縮上下文,輸出欄位包含壓縮後文字、節省的 token、保留重要內容百分比,以及壓縮風險。
文件指出,代管 API 會透過儀表板進行計量,而方案限制為每月 token 上限。由於未提供定價頁面,因此來源中僅能看到儀表板上的方案標籤。
AakarDev AI 讓團隊透過單一儀表板管理 AI 供應商權限、專案設定、日誌與分析,支援 BYOK 工作流程,並可連接 OpenAI、Google Gemini、Anthropic、Groq、Mistral AI、Perplexity AI。
CreateOS Sandbox 是以 Firecracker micro-VM 執行程式與 agent 工作負載的隔離運算環境,支援私有網路、SDK、CLI 與 MCP 程式化控制。
Arduino VENTUNO Q 是一款適用於 AI 與機器人應用的邊緣 AI 電腦,結合 AI 推論與可預測控制,並可搭配 Arduino App Lab 使用。
ByteAsk 是專為 C 與 C++ 打造的終端機優先 AI coding agent,先編輯儲存庫再用真實編譯器、除錯器、sanitizer 與測試驗證變更,並提供免費方案與付費方案。
Codex Plugins 將可重用技能、應用程式整合與 MCP 伺服器打包成可安裝到 Codex app 或在 Codex CLI 使用的工作流程,方便延伸 Codex 的連線服務任務、重複使用指令與團隊共享流程。
hob 是一個獨立的 coding agents 工作區,整合 agent sessions、終端機、歷史紀錄與後續工作,並維持你既有的工具與供應商設定。適合想保有本機路由、歷史與工作區結構控制權的開發者。