战斗式模型对比
用户可以通过战斗式格式与模型聊天,在投票前并排比较回复结果。
Arena 是一个公开的 AI 排名与对比平台,支持用户与前沿模型聊天、比较它们的输出并对结果投票。它将自己定位为面向 LLM 以及图像、代码、视频和 Agent 模型的社区驱动排行榜。
该产品围绕特定 arena 的排行榜视图组织,包括通用排行榜和带有任务导向信号及方法说明链接的 Agent Arena 页面。搜索页也表明用户可以回看聊天记录和归档会话,而网站提示则明确说明提示词及部分个人信息可能会与提供方共享,并且可能对外公开可见。
用户可以通过战斗式格式与模型聊天,在投票前并排比较回复结果。
专门页面覆盖多个 arena 的排名,包括文本、网页开发、视觉、文档、搜索、图像、视频和 Agent 任务。
排行榜视图展示按顺序排列的模型列表、分数和不确定区间,便于查看各个 arena 中模型之间的对比。
Agent Arena 页面会将表现拆分为任务完成、工具可靠性、可引导性、bash 恢复和工具幻觉等信号。
聊天历史搜索页可帮助用户查找先前对话和归档条目,覆盖战斗、代码、图像和视频等类别。
网站提供方法说明和排行榜导航,方便用户查看结果展示方式并在各个 arena 视图之间切换。
输入会由第三方 AI 提供商处理,网站也提示对话可能作为社区流程的一部分公开披露。
并排比较前沿模型的回复,并为给定提示词投票选出更好的输出。
在你想快速了解模型在特定任务类别中的表现时,查看排行榜快照。
当你关注 Agent 工作流中的工具使用、完成情况、可引导性或失败恢复时,查看 Agent Arena。
搜索以前的聊天和归档会话,以回看先前实验或检查早期对比。
在选择用于文本、代码、图像或视频工作的模型时,将公开排行榜作为社区参考点。
Arena 是一个面向 AI 模型的公开排行榜和对比平台。它允许用户与模型聊天、比较回复、投票,并浏览文本、图像、代码、视频和 Agent 任务的排名。
该网站展示了战斗式聊天和对比流程,以及专门的排行榜视图。用户还可以搜索聊天历史,并按 arena 或任务类型浏览模型排名。
Arena 提供多个排行榜,包括通用模型排行榜和面向 Agent 任务的 Agent Arena 排行榜。排名页面展示模型顺序、分数和各项信号指标,Agent 页面还提供方法说明链接。
可用页面强调社区评测和对话公开分享。首页警告输入会由第三方 AI 处理,并且对话和某些个人信息可能会公开披露,因此不应提交敏感信息。
根据所提供的证据,价格页面 URL 当前返回 404,因此无法从这里使用的来源确认其定价模式。
AakarDev AI 帮助团队在一个仪表板中管理 AI provider 访问、项目级设置、日志和分析,支持 BYOK 工作流,并涵盖 OpenAI、Google Gemini、Anthropic、Groq、Mistral AI 和 Perplexity AI。
BookAI允许您通过简单提供书名和作者与您的书籍进行AI聊天。
Skills Janitor 是一组托管于 GitHub 的斜杠命令,用于审计、跟踪和管理 Claude Code 与 OpenAI Codex skills。可查找重复项、损坏链接和未使用的 skills,并用独立命令清理。
FeelFish 是一款面向 AI 辅助小说写作的 PC 客户端,帮助小说作者规划人物与场景、撰写和修改长篇内容,并管理故事上下文。支持免费版和付费方案,兼容多种大模型服务商。
Benchspan 是一款 AI agent 安全平台,可发现 agent、实时阻止提示注入和数据外泄,并支持上线前红队测试,适用于生产环境中的 agent 团队,提供 Python 和 TypeScript SDK。
ChatBA 是一款生成式 AI 工具,可根据提示词快速生成演示文稿。支持即时生成幻灯片,并提供模板、分享和数据源帮助内容。