Arena icon

Arena

Arena 是面向前沿模型聊天、对比输出和投票的公开 AI 模型比较与排行榜平台,覆盖文本、图像、代码、视频和 Agent 任务,并提供聊天历史搜索页。

Arena

Arena 的作用

Arena 是一个公开的 AI 排名与对比平台,支持用户与前沿模型聊天、比较它们的输出并对结果投票。它将自己定位为面向 LLM 以及图像、代码、视频和 Agent 模型的社区驱动排行榜。

该产品围绕特定 arena 的排行榜视图组织,包括通用排行榜和带有任务导向信号及方法说明链接的 Agent Arena 页面。搜索页也表明用户可以回看聊天记录和归档会话,而网站提示则明确说明提示词及部分个人信息可能会与提供方共享,并且可能对外公开可见。

核心能力

战斗式模型对比

用户可以通过战斗式格式与模型聊天,在投票前并排比较回复结果。

多 arena 排行榜

专门页面覆盖多个 arena 的排名,包括文本、网页开发、视觉、文档、搜索、图像、视频和 Agent 任务。

模型分数表

排行榜视图展示按顺序排列的模型列表、分数和不确定区间,便于查看各个 arena 中模型之间的对比。

面向 Agent 的评测信号

Agent Arena 页面会将表现拆分为任务完成、工具可靠性、可引导性、bash 恢复和工具幻觉等信号。

聊天历史搜索

聊天历史搜索页可帮助用户查找先前对话和归档条目,覆盖战斗、代码、图像和视频等类别。

排名浏览

网站提供方法说明和排行榜导航,方便用户查看结果展示方式并在各个 arena 视图之间切换。

公开评测流程

输入会由第三方 AI 提供商处理,网站也提示对话可能作为社区流程的一部分公开披露。

常见用例

  • 并排模型评测

    并排比较前沿模型的回复,并为给定提示词投票选出更好的输出。

  • 跟踪模型排名

    在你想快速了解模型在特定任务类别中的表现时,查看排行榜快照。

  • 评估 Agent 行为

    当你关注 Agent 工作流中的工具使用、完成情况、可引导性或失败恢复时,查看 Agent Arena。

  • 回顾过去会话

    搜索以前的聊天和归档会话,以回看先前实验或检查早期对比。

  • 模型选择研究

    在选择用于文本、代码、图像或视频工作的模型时,将公开排行榜作为社区参考点。

Pros and Cons

Pros

  • 提供多个排行榜视图,而不是单一模型列表,覆盖文本、网页、视觉、图像、视频和 Agent 任务。
  • 在排行榜页面提供具体排名数据,包括模型顺序、分数值和不确定区间。
  • 包含带有工具使用和任务执行独立信号的 Agent Arena 视图,这对依赖流程的评测很有用。
  • 允许用户通过实时聊天和投票交互来比较模型,而不只是依赖静态基准页面。
  • 提供用于浏览历史聊天和归档条目的搜索页。

Cons

  • 所提供证据中的价格 URL 返回 404,因此无法从来源集确认定价和套餐结构。
  • 公开评测流程包含明确警告,提示对话和某些个人信息可能会公开披露,这限制了它在敏感场景中的适用性。

FAQ

Arena 是什么?

Arena 是一个面向 AI 模型的公开排行榜和对比平台。它允许用户与模型聊天、比较回复、投票,并浏览文本、图像、代码、视频和 Agent 任务的排名。

Arena 如何运作?

该网站展示了战斗式聊天和对比流程,以及专门的排行榜视图。用户还可以搜索聊天历史,并按 arena 或任务类型浏览模型排名。

Arena 提供哪些类型的排名?

Arena 提供多个排行榜,包括通用模型排行榜和面向 Agent 任务的 Agent Arena 排行榜。排名页面展示模型顺序、分数和各项信号指标,Agent 页面还提供方法说明链接。

Arena 适合私密或敏感提示词吗?

可用页面强调社区评测和对话公开分享。首页警告输入会由第三方 AI 处理,并且对话和某些个人信息可能会公开披露,因此不应提交敏感信息。

Arena 是否公布了价格?

根据所提供的证据,价格页面 URL 当前返回 404,因此无法从这里使用的来源确认其定价模式。

Quick Facts

类别
AI 模型排行榜
主要用途
比较、排名并对 AI 模型输出投票
支持的 arena
文本、网页开发、视觉、文档、搜索、图像、视频和 Agent 任务
显著页面
Agent Arena
网站
arena.ai
价格
未确认;所提供证据中的价格 URL 返回 404