Arena 平台发布了 OpenAI 的两款新模型,GPT-6 Sol 和 GPT-6 Luna,官方表示评分即将公布。用户现在可以前往 Arena 亲自测试这两款模型,投票结果将直接影响排行榜的排序。本次评测重点不在传统问答,而是应用于真实世界的智能体任务。Arena 官方强调,用户在这些任务上的投票,将是排行榜的核心数据来源。
在评分公布前,@petergostev 对 GPT-6 Sol 和 GPT-5.6 Sol 进行了同条件对比测试。同条件指的是使用相同的提示词,并且两个模型都开启了最大推理强度。此次对比不仅探讨了两代模型之间的差异,还涉及到总 token 消耗和运行时间。换句话说,输出质量、token 使用效率和延迟反馈被一起拿出来比较。
对比结果和使用的提示词视频已发布在 YouTube 上,链接为 youtu.be/jVFz7cTeQxk。 龙8头号玩家
此次评测的关注点在于智能体任务,这类任务与单轮问答截然不同,要求模型进行连续决策和多步操作,同时保持目标一致,对 token 效率和响应时间也提出了更高要求。将 token 使用量与实际时间纳入考量,意味着评测不仅关注“答案是否正确”,还要看“答对的代价”。
关于 GPT-6 Sol 和 GPT-6 Luna 的具体得分尚未公布,Arena 目前只透露评分将“即将到来”。目前尚不清楚两者之间的定位差异和各自擅长的任务类型。用户投票通道现已开启,每次在真实智能体任务上的投票都将被计算入排行榜。至于哪个版本表现更优,需待评分结果揭晓后才能知晓。
发表评论