一家未直接开发AI技术的公司,已实现了每年1亿美元的营收。

这一商业上的成功归功于Arena,一个在大型语言模型领域备受关注的平台。Arena的前身为Chatbot Arena,最初是加州大学伯克利分校团队于2023年启动的一项开放研究项目。

在短时间内,Arena已成为掌握大型语言模型发展关键的中心。在其商业化服务推出仅8个月后,年化营收便达到了1亿美元,创下了新的里程碑。

ChatGPT、Claude等模型榜上有名,Arena成为大型模型竞技场

Arena对许多人来说并不陌生。

它最受关注的特点是其完全基于用户真实盲测生成的大型模型排行榜。

其运作方式极其简单,却极具竞争性:用户输入一段指令,系统会匿名派出两个模型同时生成回应,然后用户选择哪个更好。

系统将数千万的此类投票汇总,形成一个类似Elo评分系统的排行榜。

这种“擂台赛”的机制使其成为全球AI爱好者和开发者的重要平台。

截至目前,该平台已积累了超过1000万次用户评测、7亿次对话、8200万张投票,每月吸引超过1000万访客,遍布全球150多个国家。

更重要的是,每天约有80%的用户提问是全新的,这确保了没有任何模型能够提前“背下”答案。

其含金量有多高?

OpenAI、谷歌、Anthropic、Meta等竞争激烈的顶级科技公司,都将自家旗舰模型提交到Arena接受社区的评估。

OpenAI甚至在GPT-5正式发布前,秘密地以代号“summit”进行了测试。

换句话说,硅谷最顶尖的模型都在等待一个伯克利学生的项目为其“盖章认证”。

1亿美元营收从何而来?

那么问题来了——一个免费的排行榜,是如何成为一个年营收1亿美元的“吸金机器”的?

去年9月,Arena推出了名为AI Evaluations的商业服务。

模型开发商和大型企业可以付费,利用Arena庞大的社区用户群体,对其模型进行深度评测,从而获得仅靠跑分无法获得的“真实世界”性能分析。

这被描述为一套“面向真实世界的CI/CD系统”。

一旦模型准备好公开发布,Arena会免费为其进行社区评测;

而企业若想了解自家模型在真实用户手中的优势、劣势以及潜在的错误信息,则需要付费。

这是一种典型的“为淘金者提供工具”的商业模式——在淘金热中,卖水和铲子的人往往比挖金子的人更赚钱。

大型模型厂商之间的竞争越激烈,越渴望提升模型性能,对这种“上线后调优”服务的需求就越大。

Arena恰好处于所有参与者都必须经过的关键节点。

三位伯克利人

打造最赚钱的生意

Arena的前身是Chatbot Arena。

再往前追溯,它属于伯克利著名的LMSYS研究小组。

两位伯克利大学的室友,最初只是想做一件简单的事情——为大型语言模型搭建一个中立的平台,让它们能够公平地进行比较。

没有人预料到,这个学生项目会迅速发展成为一家独角兽公司。

发展速度惊人:2025年春天,项目从大学独立出来,正式成立公司,并在几周内获得了1亿美元的种子轮融资,估值达到6亿美元;

几个月后商业产品上线,仅用四个月,年化营收就达到了3000万美元。

随后,今年1月,由Felicis和UC Investments领投的1.5亿美元A轮融资完成,投后估值定格在17亿美元。

掌舵该公司的三位核心人物,都拥有不凡的背景。

CEO Anastasios Angelopoulos,其学术根基深厚,专攻数学领域。

他在斯坦福大学攻读电子工程本科期间,曾师从凸优化领域的著名学者Stephen Boyd。

在加州大学伯克利分校攻读博士学位时,他的导师是机器学习领域的泰斗Michael I. Jordan和计算机视觉领域的权威Jitendra Malik。

他多年来一直致力于研究如何对“黑箱”模型进行具有数学严谨性的评估。

CTO Wei-Lin Chiang是开源社区的知名人物——备受好评的开源聊天机器人Vicuna正是出自他之手。

他在伯克利攻读博士学位,师从Ion Stoica,专注于分布式系统领域,并曾在美国谷歌、亚马逊和微软等公司工作过。

2022年底ChatGPT公测之际,他暂停了之前所有的研究,全身心投入到Arena项目中。

他的同事Angelopoulos形容他对这个项目的投入是“一份用爱发电的事业”。

为了这个项目,两人长时间工作,甚至选择住在一起。这两位室友,共同创立了一家估值17亿美元的公司。

第三位联合创始人是著名的伯克利教授、Databricks联合创始人Ion Stoica,他在项目于2025年4月公司化之前一直担任顾问。

成为裁判比成为选手更重要

Arena最新的举措是推出了Agent Mode(智能体模式)。

该模式的评测范围已不再局限于“哪个模型聊天更好”,而是涵盖了数百万用户正在使用的智能体执行的真实任务,例如编写代码、调试错误、进行研究、分析文档等——这些涉及多次工具调用和多轮交互的长程任务。

Arena开始使用任务完成率、幻觉率等客观指标进行评分,这已经远远超出了最初“人类偏好投票”的范畴。

人工智能正从“聊天机器人”演变为能够独立完成任务的“智能体”,其任务日益复杂,重要性也随之提升。

评测,可以被视为人类深入了解AI内部运作机制的最后一道防线。

Arena这门生意之所以能达到1亿美元甚至17亿美元的价值,其核心在于押注于评测的重要性将日益增加,其价值也将随之提升。

然而,最终所有人都必须面对一个问题——当机器开始自主出题时,谁将拥有阅卷的资格?

02条评论

  • There are many variations of passages of available but major - 乐竞体育

    樂競體育

    2026年5月15日 下午2:37

    乐竞体育深耕穩定可靠的平台系統,流暢無阻的觀賽過程领域,用心服务每一位用户。

  • There are many variations of passages of available but major - 乐竞体育

    樂競體育

    2026年5月15日 下午2:37

    在持續優化的播放技術,提供專業級的視覺享受方面,乐竞体育提供贴心周到的支持。

发表评论

乐竞体育
返回顶部