并行多模型运行
并行将同一提示运行到多个模型,并在同步列中并排比较输出,运行时显示每个模型的耗时和成本。
Revalvo 是一款 local-first 的 LLM eval 工作台,用于在多个模型之间编写、运行、版本管理和评估提示。主页将其定位为一个可一次把同一提示运行到所有模型、为结果评分,并保留可追踪的已发布记录的地方。
它在浏览器中运行,无需账户,也没有托管数据库。网站说明你可以用自己的密钥连接提供方,使用 Ollama 或 LM Studio 等本地运行时,或者使用自定义端点,然后从单次提示测试扩展到基于数据集的批量评测和报告。
并行将同一提示运行到多个模型,并在同步列中并排比较输出,运行时显示每个模型的耗时和成本。
实时为响应打分,并查看报告输出,其中包含通过率、模型排名、单条案例的通过/失败情况和调试细节。
将一次运行保存为不可变快照,结合模型配置差异和逐行词级 diff 比较版本,并可回滚到任意更早版本。
可手动创建数据集、上传 CSV 文件、从空白开始,或根据描述生成行;将已保存版本批量运行到整个数据集上。
通过 API 密钥、OAuth、localhost 运行时或自定义端点连接提供方,并按提供方进行工作区隔离。
将已保存版本或批量报告导出为 Python、TypeScript、cURL、Node.js、Go、agent prompts、HTML、Markdown、JSON 或 CSV。
一次将同一提示与多个模型进行比较,查看并排输出,并了解在所选标准下哪个模型得分最高。
像处理代码一样处理提示:保存不可变版本、比较配置和词级变更,并在后续草稿表现更差时回滚。
构建数据集,将已保存的提示版本在其上批量运行,并使用报告在发布前检查通过率、延迟、成本和失败情况。
使用自己的密钥或本地运行时连接提供方工作区,然后在浏览器中工作,无需创建账户或使用托管数据库。
将提示版本或批量结果导出为代码片段、agent prompts 或常见文件格式,以便交接给编码代理或队友。
Revalvo 是一款基于浏览器的提示工程和 LLM 评测工作台。它可让你在多个模型间运行提示、查看评分后的输出、对提示进行版本管理,并导出或回滚已保存的版本。
网站说明你可以通过粘贴密钥、使用 OAuth 登录,或指向 localhost 来连接提供方。显示支持的选项包括 OpenRouter、Ofox.AI、Vercel AI Gateway、Groq、OpenAI、Anthropic、Ollama、LM Studio,以及自定义的 OpenAI 兼容端点。
Revalvo 设计为在浏览器中运行,无需账户,并将提示、版本、数据集、评测配置、结果和 API 密钥保存在本地存储中。隐私政策说明,直接连接的提供方可在 Revalvo 服务器看不到你内容的情况下使用,而某些提供方会通过仅在内存中运行的 worker 进行代理。
主页展示了在 playground 中进行单次运行,以及针对完整数据集进行批量评测的工作流。报告包括通过率、延迟、成本、模型排名、逐条样本的通过/失败情况,以及导出为 HTML、Markdown、JSON 和 CSV 的选项。
在 /pricing 页面没有可用的定价信息;该 URL 在网站上返回 404。条款页面说明 Revalvo 可免费使用且没有正常运行时间 SLA,但未描述付费层级或方案细节。
Edgee 是面向编码代理和 LLM 应用的 AI gateway,可压缩 token 流量、跨模型路由请求,并提供可观测性与团队控制,帮助降低成本并保持会话持续运行。
ByteAsk 是面向 C 和 C++ 的终端优先 AI 编码 agent,可直接编辑仓库,并在展示 diff 前用真实编译器、调试器、sanitizers 和测试验证修改。提供免费版与付费方案。
Prompty Town 将链接变成小型互联网城市中的一栋建筑。用户可购买地块、添加提示词,并将结果与其他建筑一起发布展示。
Manta AI 是面向团队的自治式网页应用测试工具,可从 URL 自动探索应用、映射行为、捕捉回归,并用自然语言生成测试,无需脚本或维护选择器。
Creativly 是一款基于网页的 AI 创意工作室,可用简短输入快速生成视觉概念、样机和风格化图片,适合设计师、创作者和创业者进行快速视觉构思。
AakarDev AI 帮助团队在一个仪表板中管理 AI provider 访问、项目级设置、日志和分析,支持 BYOK 工作流,并涵盖 OpenAI、Google Gemini、Anthropic、Groq、Mistral AI 和 Perplexity AI。